
Site Reliability Engineer (SRE)
공고 요약
팀 소개
전사 서비스의 인프라, 배포, 안정성 책임
AWS 멀티 어카운트 및 EKS 기반 프로덕션 인프라 운영
Datadog 옵저버빌리티, Claude Code, Codex 등 AI 도구 적극 활용
개발팀과 장애 대응부터 아키텍처 리뷰까지 협업
담당업무
전사 서비스 장애의 1차 대응 및 RCA 리드
포스트모템 및 재발 방지 액션 아이템 추적 관리
온콜 및 인시던트 체계 수립 및 표준화
SLI, SLO 정의 및 신뢰성 데이터 정량화
서비스 레벨에 따른 프로덕션 필수 점검항목 정의 및 관리
전사 배포 및 변경 관리 표준화 (배포 전 영향도 분석, 리스크 검토)
장애 리스크 사전 진단 및 Chaos Engineering 훈련 기획
지원자격
SRE 또는 인프라 운영 관련 실무 5년 이상 또는 이에 준하는 경험 보유자
AWS 운영 경험 3년 이상 보유자
IT 서비스 장애를 1차 대응부터 RCA, 재발방지까지 추적 및 해결한 경험 보유자
옵저버빌리티 플랫폼을 활용한 장애 진단 및 분석 경험 보유자
서버 및 네트워크 레벨 장애 진단 역량 보유자
시스템간 연동 구조 분석 및 장애 영향도 평가 경험 보유자
우대사항
대규모 및 대용량 트래픽 서비스 운영 경험 보유자
SLI, SLO, 에러 버짓 운영 경험 보유자
Java 및 Spring 애플리케이션 성능 분석 경험 보유자
LLM 및 에이전트를 개발, 운영, 진단에 활용해 본 경험 보유자
옵저버빌리티 플랫폼으로 서비스 품질을 상시 관측 및 개선한 경험 보유자
포스트모템 문화 정착 경험 보유자
배포 및 변경관리 프로세스 설계 또는 자동화 경험 보유자
전형절차
서류전형
코딩테스트
1차 인터뷰
2차 인터뷰
레퍼런스 체크
처우협의 및 채용검진
최종합격
참고사항
첨부파일에는 연봉 정보를 기입하지 말고 지원서 내 연봉 정보 기입칸에만 작성 필요
모든 직무는 3개월의 시용기간이 적용되며 해당 기간 동안 급여는 100% 지급
국가 등록 장애인 및 국가 보훈 대상자는 관련 법규에 의거하여 우대
마감기한
2026년 6월 30일 23:59까지
티맵모빌리티 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요