
Site Reliability Engineer III
공고 요약
담당업무
미션 크리티컬 금융 애플리케이션 L2/L3 프로덕션 지원
애플리케이션·배치 상태 모니터링 및 실패, 데이터 오류, 성능 저하 트리아지
장애 심각도 평가, 브리지 운영, 이해관계자 업데이트 및 서비스 복구
Linux, 로그, 메트릭, SQL 기반 근본 원인 분석과 임시 해결책 적용
AutoSys, Airflow, Amazon Managed Workflows for Apache Airflow 기반 배치 오케스트레이션 및 의존성 검증
엔지니어링 팀과 영구 수정사항 제공, 근본 원인 분석과 예방 조치 수행
배포 검증, 롤백 준비, 하이퍼케어를 포함한 릴리스·변경 지원
데이터 레이크, ETL 패턴, Databricks 기반 데이터 플랫폼·파이프라인 운영 및 데이터 품질 이슈 해결
Python·셸 스크립팅을 활용한 반복 업무 자동화와 평균 복구 시간 개선
런북·표준운영절차·운영 지식 및 감사 대응 문서 작성·관리
재해복구·서비스 복구 계획, 장애조치·복귀 테스트 및 후속 조치 관리
글로벌 처리 시간대에 대한 온콜·교대 지원
자격요건
Linux와 SQL을 활용한 로그·메트릭 기반 트러블슈팅 경험
스케줄링·오케스트레이션 도구 및 배치 운영·의존성 검증 경험
장애·문제·변경 관리와 ITIL 원칙에 기반한 운영 경험
Databricks, 데이터 레이크 패턴, ETL 개념을 포함한 데이터 플랫폼·파이프라인 지원 경험
Python 및 셸 스크립팅을 활용한 자동화 역량
Splunk, Grafana, Dynatrace, OpenTelemetry 등 관측성 도구 활용 지식
AWS, Kubernetes 및 클라우드 네이티브 서비스에 대한 실무 지식
압박 상황에서의 명확하고 침착한 이해관계자 커뮤니케이션
우대사항
분산 시스템 경험
API 경험
데이터 통합 패턴 적용 경험
근무환경
빠르게 변화하는 환경에서 엔지니어링·운영 팀과 협업
운영 안정성, 자동화, 통제 체계 중심의 업무
글로벌 처리 시간대 대응을 위한 온콜·교대 커버리지 참여
마감기한
2026년 8월 31일 13:00까지
JPMorganChase 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요