인기 검색

[기술혁신실] MLOps Engineer
공고 요약
담당업무
FoundEx ML 파이프라인 고도화 및 운영
영상·이미지 데이터 수집, Ceph 저장, 가공·검수, annotation 등재를 연결하는 이벤트 기반 워크플로우 운영
Data Manager 승인 워크플로우, 가공 도구, Slack 알림 등 시스템 연동 안정화 및 자동화
FlowEx 모델 라이프사이클 플랫폼 설계 및 발전
데이터셋 버전 관리와 실험 추적을 통한 재현성 보장
TFLite, CoreML 등 배포 포맷 변환 자동화
모델 성능 확인을 위한 배포 보드 발전
배포 이후 데이터 수집, 성능 추정, 이상 탐지, 알림, rollback 피드백 루프 설계
Multi-node on-prem GPU 클러스터와 스토리지 운영
Slurm 기반 실험 환경의 Kubernetes 전환 및 운영 안정화
인프라 모니터링·알림, 실험 환경 표준화, CI/CD 개선
ISO/IEC 42001 기준에 맞춘 데이터·모델 거버넌스와 감사 추적성 구현
자격요건
Python 능숙
PyTorch 기반 딥러닝 모델 학습·추론 파이프라인 구조 이해
스토리지, 데이터 가공 도구, 메시징·알림, 실험 관리 시스템을 연동한 end-to-end 워크플로우 자동화 경험
Docker와 Kubernetes 기반 ML 워크로드 운영 경험
데이터·모델 버전 관리, 실험 추적, 모델 레지스트리 구축 또는 운영 경험
진행 상황 공유와 문서 기반 소통 역량
우대사항
외국어 능통자 우대
복리후생
자기계발 지원
협업 및 근무문화
AI Research Scientist·Engineer, Backend Engineer, Data Manager, Mobile Engineer, RA·QA와 협업
연구 단계 모델이 제품 환경까지 안전하게 도달하도록 연결
기록되는 시스템과 기록하는 문화를 중시
마감기한
상시채용
에버엑스 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
소개
[합류하게 될 팀에 대해 알려드려요] "Bringing Personalized Rehabilitation to Everyone"이라는 Mission 아래, EverEx는 디지털 헬스케어 기술로 재활 치료의 패러다임을 바꾸고 있어요. 기술혁신실의 AI팀은 Human Pose Estimation 모델과 Multimodal LLM을 중심으로 사용자의 움직임을 정확하게 분석하고, 재활과 운동에 특화된 개인 맞춤형 피드백을 제공하고 있어요. 그리고 이 모든 것이 빠르고 안전하게 순환하도록 만드는 토대에는 MLOps 파트가 직접 만들어가는 두 개의 시스템이 있어요. • FoundEx: 데이터 수집 요청부터 자동 수집, 저장, 가공/검수, 학습 데이터화까지 여러 내부 플랫폼을 연동해 데이터가 "학습 가능한 상태"로 흘러가게 만드는 데이터 파이프라인이에요. • FlowEx: 데이터 관리 학습 실험 평가 배포로 이어지는 모델 라이프사이클 전체를 하나의 흐름으로 관리하는 학습·배포 관리 플랫폼이에요. 중복 실험을 방지하고, 데이터 정합성을 지키고, ISO/IEC 42001이 요구하는 데이터·모델 관리 기준을 시스템 수준에서 보장하는 것을 목표로 해요. 우리는 이 시스템들을 "AI 연구자가 모델에만 집중할 수 있는 환경"으로 완성하고, 나아가 수집 가공 학습 평가 배포 모니터링이 자동으로 순환하는 ML 파이프라인으로 발전시키려 해요. 이미 만들어진 플랫폼을 운영만 하는 것이 아니라, 파이프라인의 다음 단계를 직접 설계하고 주도할 MLOps Engineer를 찾고 있어요.
주요업무
• ML 파이프라인(FoundEx)을 고도화하고 운영해요. 영상/이미지 데이터의 수집 요청 자동 수집 스토리지(Ceph) 저장 가공/검수 annotation 등재까지 이어지는 이벤트 기반 워크플로우를 운영하고, 병목 구간의 자동화 수준을 높여요. Data Manager의 승인 워크플로우, 가공 도구 연동, Slack 알림 체계 등 여러 시스템의 연결 지점을 안정적으로 유지하는 역할이에요. • 모델 라이프사이클 플랫폼(FlowEx)을 설계하고 발전시켜요. 데이터 관리 학습 실험 평가 배포로 이어지는 4개 보드의 워크플로우를 고도화해요. 데이터셋 버전 관리와 실험 추적으로 재현성을 보장하고, 배포 포맷(TFLite, CoreML) 변환을 자동화하고, 비개발 직군을 포함한 전사가 모델 성능을 확인할 수 있는 배포 보드를 발전시켜요. 웹 애플리케이션 개발은 Backend Engineer와 함께하고, MLOps는 스토리지 동기화, 실험 추적, 변환 자동화 등 ML 워크플로우와 파이프라인 로직을 책임져요. • 배포 이후를 책임지는 모델 품질 모니터링 체계를 0부터 만들어요. 지금은 배포까지의 파이프라인이 잘 갖춰진 반면, 배포 이후는 계획 문서만 있는 초기 상태예요. 제품에 탑재된 모델로부터 성능을 추정할 수 있는 데이터가 아직 수집되지 않고 있거든요. 제품팀과 함께 On-device 환경(나아가 Serving 환경까지)과 개인정보 규제 제약 안에서 어떤 데이터를 수집할지 정의하는 것부터 시작해서, 수집 성능 추정 이상 탐지 알림 rollback으로 이어지는 피드백 루프 전체를 직접 설계하는 역할이에요. • ML 인프라를 운영하고, 인프라 Observability를 구축해요. Multi-node on-prem GPU 클러스터와 스토리지를 운영하고 있어요. 그동안 Slurm 기반으로 운영해온 실험 환경을 Kubernetes 기반으로 전환하는 작업을 진행 중이고, 이 전환을 함께 완성하고 새 환경의 운영을 안정화하는 역할이에요. 문제를 사전에 탐지하고 대응할 수 있는 모니터링·알림 체계를 만들고, 실험 환경 표준화와 CI/CD 개선도 함께 해요. • 헬스케어 규제 친화적인 거버넌스를 시스템으로 구현해요. ISO/IEC 42001(AIMS)이 요구하는 데이터·모델 관리 기준을 문서가 아닌 파이프라인으로 충족시키고, 재현 가능성(reproducibility)과 감사 추적성(auditability)을 시스템 수준에서 보장해요. • 다양한 직군과 협업해요. AI Research Scientist/Engineer, Backend Engineer, Data Manager, Mobile Engineer, RA/QA와 긴밀히 협업하며, 연구 단계의 모델이 제품 환경까지 안전하게 도달하도록 연결하는 역할을 해요.
자격요건
• MLOps, ML Platform, DevOps, 백엔드 등 시스템 구축·운영 분야에서 5년 이상의 실무 경험이 있으신 분을 찾고 있어요. • Python에 능숙하고, PyTorch 기반 딥러닝 모델의 학습·추론 파이프라인 구조를 이해하고 계신 분이면 좋아요. 모델을 직접 연구하지 않더라도, 연구자의 워크플로우를 시스템으로 옮길 수 있어야 해요. • 서로 다른 시스템(스토리지, 데이터 가공 도구, 메시징/알림, 실험 관리 등)을 연동해 end-to-end 워크플로우를 자동화해본 경험이 있으신 분이면 좋아요. 우리의 파이프라인은 하나의 거대한 솔루션이 아니라 여러 플랫폼의 유기적인 연결로 이루어져 있어요. • Docker와 Kubernetes 기반 환경에서 ML 워크로드를 직접 운영해보신 분이면 좋아요 (단순 사용을 넘어 리소스 관리·장애 대응 경험이 있다면 더 좋아요) • 데이터·모델 버전 관리, 실험 추적, 모델 레지스트리 체계를 구축하거나 운영해본 경험(MLflow, W&B, DVC 등 도구 무관)이 있으신 분이면 좋아요. • 진행 상황을 유기적으로 공유하고, 문서를 통해 소통하는 것에 익숙하신 분이면 좋아요. 특히, 규제 산업에서는 "기록되는 시스템"만큼 "기록하는 문화"도 중요해요.
우대사항
• 헬스케어, 의료기기(SaMD), 또는 규제 산업에서 AI 시스템을 개발·운영해본 경험이 있으면 더 좋아요. ISO/IEC 42001, ISO 13485, MFDS GMP, 개인정보 관련 규제 대응 경험이면 금상첨화예요. • 대용량 비디오·이미지 데이터 파이프라인을 다뤄본 경험(FFmpeg, torchcodec 등)이 있으면 더 좋아요. • 온프레미스 GPU 클러스터(멀티 노드·멀티 GPU)를 운영해본 경험이 있으면 더 좋아요. 특히 Slurm 등 스케줄러 기반 환경을 Kubernetes로 전환해본 경험이면 금상첨화예요. 분산 스토리지(Ceph 등) 운영 경험도 환영해요. • Prometheus, Grafana 등을 활용해 인프라·시스템 모니터링과 알림 체계를 구축해본 경험이 있으면 더 좋아요. • Kubernetes 환경에서 GPU 워크로드 스케줄링(NVIDIA GPU Operator, Kueue, Volcano 등)을 다뤄봤거나, 워크플로우 오케스트레이션 도구(Airflow, Argo Workflows, Kubeflow 등)를 구축해본 경험이 있으면 더 좋아요. • 모바일/온디바이스 모델 배포 툴체인(TFLite/LiteRT, CoreML, ExecuTorch 등)에 대한 이해가 있으면 더 좋아요. 변환 과정을 자동화하는 것이 우리의 일이에요. • 사내 도구를 웹 서비스 형태로 직접 만들어 배포·운영해본 경험이 있으면 더 좋아요. 우리는 데이터 가공 도구와 관리 플랫폼을 직접 만들어 쓰고 있어요. • 모델 서빙 프레임워크(Triton Inference Server, vLLM 등)에 대한 실무 경험이 있으면 더 좋아요. 향후 VideoLLM 도입을 준비하고 있어요. • 연구 조직과 제품 조직 사이에서 모델을 "실험 단계 제품 단계"로 옮기는 과정에 기여해본 경험이 있으면 더 좋아요
혜택 및 복지
• 유연한 시차출퇴근제로 각자의 리듬에 맞게 근무해요 • 업무에 몰입할 수 있도록 장비와 소프트웨어를 아낌없이 지원해요 • 성장에 필요한 도서·강의 등 교육비를 적극 지원해요 • 눈치 보지 않고 쓰는 자유로운 연차 사용 • 3년 이상 근속 시 리프레시 휴가로 재충전의 시간을 드려요 • 팀워크를 위한 본부별 회식비 지원 • 생일에는 조기 퇴근 + 작은 선물로 축하해요 • 명절 선물로 감사의 마음을 전해요 • 관심사 기반 소모임 활동비도 지원 해요 • 야간 근무 시 안전한 귀가를 위한 택시비를 지원해요 • 새로운 출발을 응원하는 결혼 축하금 지급해요
댓글
에버엑스에 맞는
이력서로 자동 수정하기