Recruitment background

AI Platform 추론 최적화 Engineer(경력)

카카오|2026. 8. 24. 게시|
27

공고 요약

경력5년 이상
채용 유형정규직
학력무관
지역경기
마감일채용시마감
출처직행

담당업무

  • LLM 추론 엔진 기반 AI 서빙 플랫폼 설계 및 최적화

  • vLLM, SGLang, TensorRT-LLM 등 오픈소스 추론 엔진 도입·적용·운영

  • 캐시, 배칭, 양자화, 커널 최적화를 통한 LLM 추론 성능 향상

  • Tensor, Pipeline, Expert, Sequence Parallelism 및 MoE 라우팅 기반 분산 추론 전략 설계·구현

  • latency, throughput, TTFT, TPOT 등 추론 성능 지표 측정 및 개선

  • Kubernetes 기반 LLM 서빙 인프라 구축·운영·자동화

  • 라우팅, 오토스케일링, 로드밸런싱, 요청 스케줄링 등 서빙 시스템 기능 개발

  • 코드 리뷰, 테스팅, CI/CD를 통한 서비스 품질 관리

자격요건

  • Python 또는 Go 기반 시스템·백엔드·ML 시스템 개발 경험

  • Transformer 아키텍처 및 LLM 동작 원리에 대한 이해

  • vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상의 프로덕션 또는 대규모 실험 환경 운영 경험

  • GPU 환경 성능 프로파일링 및 최적화 경험

  • Nsight, NCU, PyTorch Profiler 활용 경험

  • Kubernetes에 대한 높은 이해도

  • 클라우드 환경 CI/CD 경험

  • 새로운 환경에 도전하는 오픈 마인드

우대사항

  • vLLM, SGLang, TensorRT-LLM, Hugging Face Transformers, PyTorch 등 오픈소스 프로젝트 컨트리뷰션 경험

  • CUDA 또는 Triton 커널 작성·튜닝 경험

  • Speculative Decoding, Mixture-of-Experts, FlashAttention, PagedAttention, RadixAttention 등 LLM 추론 가속 기법 적용 경험

  • AWQ, GPTQ, FP8, INT4, SmoothQuant, Pruning, Distillation 등 모델 양자화·압축 경험

  • 대규모 분산 추론 설계·운영 경험

  • NVIDIA Triton Inference Server, KServe, Ray Serve, vLLM Production Stack, LLM-D 등 서빙 플랫폼 구축 경험

  • 수십~수백 GPU 이상 대규모 GPU 클러스터 추론 워크로드 운영 경험

  • RDMA, RoCE, InfiniBand, NCCL 튜닝 또는 네트워크 트러블슈팅 경험

  • ML 또는 AI 동작에 대한 이해

  • Python, C++, CUDA, Go, Rust 등 다양한 프로그래밍 언어 활용 경험

  • LLM 추론 성능 관련 논문 구현·재현 경험

전형절차

  1. 서류전형

  2. 코딩테스트

  3. 사전인터뷰

  4. 1차 인터뷰

  5. 2차 인터뷰

  6. 처우 협의

  7. 최종 합격 및 입사

근무환경

  • 완전선택근무제

  • 월 1일 리커버리데이

  • 주 1일 원격근무

마감기한

채용시 마감

카카오 지원하기 전 이력서 Check

시간이 없다면 AI와 한번에 수정해보세요

공고 원문

카카오 AI Platform 추론 최적화 Engineer(경력) 채용공고
이런 공고 어때요?
지금 많이 보는 공고

댓글