
ML Engineer (Runtime Optimization)
공고 요약
주요업무
OVISION Int 적용 Computer Vision 모델의 Serving/Runtime 최적화 및 제품 적용
인공지능연구소 모델 및 오픈소스 모델 패키징·관리
모델 artifact 버전, 실행 설정, 의존성 재현 가능한 배포 형태로 패키징 및 버전 관리
추론 성능 및 GPU 메모리 병목 분석·개선
PyTorch/CUDA 환경에서 병목 분석 및 최적화 기법 적용
운영 환경 대비 배포 체계 고도화
Linux 기반 On-Premise CUDA·GPU driver 버전 이슈 분석 및 대응
대표 운영 환경에서 추론 속도 측정·재현 조건 문서화
협업 및 품질 검증 지원
모델 실행 인터페이스 개선 및 Backend 서비스 API 연동 방식 협의
모델 특성·실패 조건·runtime 제약 기반 QA 항목 제시 및 QA 엔지니어 독립 검증 지원
PM과 고객 환경 및 제품 우선순위 확인 및 속도·GPU 메모리·모델 품질 간 trade-off 공유
자격요건
AI 모델을 제품 환경에 적용·서빙·운영 경력 3년 이상(3년~10년)
PyTorch/CUDA/Linux 환경에서 profiling 도구로 추론 속도 및 GPU 메모리 병목 분석
FP16 또는 BF16 혼합 정밀도 추론 적용 가능
ONNX Runtime, TensorRT, NVIDIA Triton Inference Server 중 하나 이상 활용经验
Docker/Kubernetes 기반 모델 패키징·배포 경험
모델 실행 인터페이스와 Backend API 연동 방식에 대한 이해
모델 artifact의 버전, 실행 설정, 의존성, 출처 재현 가능 관리 및 오픈소스 라이선스 확인 역량
연구원/Backend Engineer/QA Engineer/PM 등 다양한 직무와 제약사항, QA 항목, 제품 요구사항 커뮤니케이션 가능
우대사항
FlashAttention, quantization, torch.compile 등 추론 최적화 기법 활용 경험
Triton language 기반 GPU kernel 또는 CUDA kernel 직접 구현/최적화 경험
위성·항공·UAV 영상 등 지구관측 도메인 Computer Vision 모델 또는 대용량 영상 처리 프로젝트 경험
Rasterio, GDAL, TorchGeo 등 도구 활용 영상 tiling·mosaicking, 좌표계 처리 또는 raster/vector 후처리 경험
GeoAI 모델을 지역/환경 차이를 고려해 제품 적용 경험
On-Premise GPU 환경에서 CUDA·GPU driver 호환성 이슈 해결 및 배포 운영 경험
LLM 기반 agent 기능의 특성과 외부 API 기반 LLM 및 On-Premise LLM의 serving/runtime 차이 이해
혜택
선택적 근로시간제(core 타임 10~15시)
하이브리드 근무제(월 2회 재택)
희망 개발장비 제공
복지포인트 지급
3년단위 리프레시 휴가
매년 종합검진(본인+가족 1인)
단체보험 가입(본인+배우자+자녀)
첫 출근웰컴키트+부모님 선물
사내 채용 추천포상
생일선물
자유로운 휴가 사용 문화
당 충전소
전형절차
서류전형
사전과제
1차 인터뷰(직무 적합성)
2차 인터뷰(조직 적합성)
레퍼런스 체크
처우협의
채용검진
접수방법
지원방법: 지원하기
마감기한
2026년 9월 30일 23:59까지
에스아이에이 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요