인기 검색

[미리캔버스] ML Engineer (Model Inference & Serving)
공고 요약
담당업무
vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙 운영
TensorRT-LLM 기반 내부 서비스용 LLM 서빙 구성 및 튜닝
모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응
PyTorch 모델의 가속 프레임워크 변환 및 정확도·추론 속도 검증
quantization, pruning, distillation 기반 모델 경량화
프로파일링을 통한 병목 연산 식별 및 개선
p99 latency, GPU 활용률, 토큰 처리량, 큐 대기 시간 대시보드화
성능 저하 선제 탐지 알림 체계 구축
서비스별 latency·비용 요구사항에 따른 GPU 선정 및 배치
모델 배포 플랫폼 구축, 추론 최적화 기술 검증 및 도입
팀 내 기술 전파, 문서화, 온콜 체계 정착
자격요건
TensorRT, TensorRT-LLM, vLLM, ONNX Runtime 등 추론 최적화 프레임워크를 활용한 프로덕션 모델 서빙 경험
GPU 추론 경험 및 배치 크기·GPU 메모리·throughput·latency 트레이드오프 설명 역량
matmul, softmax/sigmoid, cumsum, attention 등 추론 연산의 병목 이해
Linux 서버와 컨테이너 환경에서 프로세스·메모리·네트워크·로그 추적 역량
우대사항
FastAPI, Django, Flask 등 Python 웹 프레임워크 기반 프로덕션 서비스 개발·운영 경험
quantization, pruning, distillation 등 모델 경량화 및 학습 코드 작성 경험
H200, A100, A10G, L40S 등 다양한 GPU 아키텍처의 추론 가속 경험
CUDA 및 Nsight Systems, PyTorch Profiler 등 프로파일링 도구 활용 경험
검색·추천 등 대규모 실시간 트래픽 시스템 서빙 경험
모델 정확도뿐 아니라 실행 시간과 비용을 중시하는 태도
프로파일링과 측정을 통한 병목 개선 선호
장애를 시스템 개선점으로 다루는 협업 방식
보상과 복리후생
연봉 협의
자유로운 휴가 사용
경조사 휴가 지원
3년 근속 시 리프레시 휴가
업무 관련 비용 100% 지원
업무 도서 구입비 무제한 지원
외부 교육 및 기술 세미나 참여 지원
아침·점심·저녁 식사비 지원
제휴 카페 포인트 지원
신입사원 OJT 및 적응 프로그램 지원
동호회 지원
분기별 문화이벤트 및 회식 지원
전형절차
서류 전형
1차 인터뷰
처우 협의
입사
지원방법
서류는 PDF 형식으로 제출
직무·직급에 따라 2차 인터뷰 추가 가능
직급에 따라 인터뷰 후 레퍼런스 체크 추가 가능
서류 결과 안내까지 최대 2주
인터뷰 결과 안내까지 최대 3주
동일 포지션 재지원은 최종 결과 안내 후 6개월 경과 시 가능
근무환경
시차출퇴근제 운영
자율과 책임의 근무 환경
직급 없이 수평적인 문화 지향
온콜 및 장애 대응 프로세스 참여
마감기한
2026년 11월 3일 23:59까지
미리디 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요