Recruitment background

[미리캔버스] Machine Learning Engineer (Model Inference & Serving)

미리디|2026. 9. 4. 게시|
0

공고 요약

경력1년~3년
채용 유형정규직
학력무관
지역서울
마감일상시채용
출처직행

담당업무

  • vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙 운영

  • TensorRT-LLM 기반 내부 서비스용 LLM 서빙 구성 및 튜닝

  • 모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응

  • PyTorch 모델의 가속 프레임워크 변환 및 변환 전후 정확도·추론 속도 검증

  • quantization, pruning, distillation을 통한 모델 경량화 및 비용·latency 개선

  • 프로파일링을 통한 병목 연산 식별 및 개선

  • p99 latency, GPU 활용률, 토큰 처리량, 큐 대기 시간 수집 및 대시보드화

  • 성능 저하 선제 탐지 알림 체계 구축

  • 서비스별 latency·비용 요구사항에 따른 GPU 선정 및 배치

  • 각 서비스 팀이 직접 모델을 배포할 수 있는 서빙 플랫폼 구축

자격요건

  • TensorRT, TensorRT-LLM, vLLM, ONNX Runtime 등 추론 최적화 프레임워크를 활용한 프로덕션 모델 서빙 경험

  • GPU 추론 경험 및 배치 크기·GPU 메모리·throughput·latency 트레이드오프 설명 능력

  • matmul, softmax/sigmoid, cumsum, attention 등 주요 추론 연산의 병목 이해

  • 리눅스 서버와 컨테이너 환경에서 프로세스·메모리·네트워크·로그 추적 능력

우대사항

  • FastAPI, Django, Flask 등 Python 웹 프레임워크 기반 프로덕션 서비스 개발·운영 경험

  • quantization, pruning, distillation 등 모델 경량화 및 학습 코드 작성 경험

  • H200, A100, A10G, L40S 등 다양한 GPU 아키텍처의 추론 가속 경험

  • CUDA 이해 및 Nsight Systems, PyTorch Profiler 등 프로파일링 도구 활용 경험

  • 검색·추천 등 대규모 실시간 트래픽 시스템 서빙 경험

전형절차

  1. 서류 전형

  2. 1차 인터뷰

  3. 처우 협의

  4. 입사

  5. 직무·직급에 따라 2차 인터뷰 추가 가능

  6. 직급에 따라 인터뷰 후 레퍼런스 체크 추가 가능

접수방법

  • 서류는 PDF 형식으로 제출

  • 여러 포지션 동시 지원 가능

  • 동일 포지션은 최종 결과 안내 후 6개월 뒤 재지원 가능

근무환경

  • 온콜 및 장애 대응 프로세스 참여

  • p99 latency, GPU 활용률, 토큰 처리량 등 운영 지표 상시 관측

  • 모델 장애를 시스템 개선점으로 다루는 문화

  • 기술 전파와 문서화

  • 온콜 체계 정착 및 서빙 역량의 조직 자산화

마감기한

상시채용

미리디 지원하기 전 이력서 Check

시간이 없다면 AI와 한번에 수정해보세요

공고 원문

미리디 [미리캔버스] Machine Learning Engineer (Model Inference & Serving) 채용공고
이런 공고 어때요?
지금 많이 보는 공고

댓글