인기 검색

AI Platform 추론 최적화 Engineer(경력)
공고 요약
담당업무
LLM 추론 엔진 기반 AI 서빙 플랫폼 설계 및 최적화
vLLM, SGLang, TensorRT-LLM 등 오픈소스 추론 엔진 도입·적용·운영
캐시, 배칭, 양자화, 커널 최적화를 통한 LLM 추론 성능 향상
Tensor, Pipeline, Expert, Sequence Parallelism 및 MoE 라우팅 기반 분산 추론 전략 설계·구현
latency, throughput, TTFT, TPOT 등 추론 성능 지표 측정 및 개선
Kubernetes 기반 LLM 서빙 인프라 구축·운영·자동화
라우팅, 오토스케일링, 로드밸런싱, 요청 스케줄링 등 서빙 시스템 기능 개발
코드 리뷰, 테스팅, CI/CD를 통한 서비스 품질 관리
자격요건
Python 또는 Go 기반 시스템·백엔드·ML 시스템 개발 경험
Transformer 아키텍처 및 LLM 동작 원리에 대한 이해
vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상의 프로덕션 또는 대규모 실험 환경 운영 경험
GPU 환경 성능 프로파일링 및 최적화 경험
Nsight, NCU, PyTorch Profiler 활용 경험
Kubernetes에 대한 높은 이해도
클라우드 환경 CI/CD 경험
새로운 환경에 도전하는 오픈 마인드
우대사항
vLLM, SGLang, TensorRT-LLM, Hugging Face Transformers, PyTorch 등 오픈소스 프로젝트 컨트리뷰션 경험
CUDA 또는 Triton 커널 작성·튜닝 경험
Speculative Decoding, Mixture-of-Experts, FlashAttention, PagedAttention, RadixAttention 등 LLM 추론 가속 기법 적용 경험
AWQ, GPTQ, FP8, INT4, SmoothQuant, Pruning, Distillation 등 모델 양자화·압축 경험
대규모 분산 추론 설계·운영 경험
NVIDIA Triton Inference Server, KServe, Ray Serve, vLLM Production Stack, LLM-D 등 서빙 플랫폼 구축 경험
수십~수백 GPU 이상 대규모 GPU 클러스터 추론 워크로드 운영 경험
RDMA, RoCE, InfiniBand, NCCL 튜닝 또는 네트워크 트러블슈팅 경험
ML 또는 AI 동작에 대한 이해
Python, C++, CUDA, Go, Rust 등 다양한 프로그래밍 언어 활용 경험
LLM 추론 성능 관련 논문 구현·재현 경험
전형절차
서류전형
코딩테스트
사전인터뷰
1차 인터뷰
2차 인터뷰
처우 협의
최종 합격 및 입사
근무환경
완전선택근무제
월 1일 리커버리데이
주 1일 원격근무
마감기한
채용시 마감
카카오 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요