추천 검색

LLM 서빙 및 추론 최적화 엔지니어 채용
공고 요약
담당업무
LLM 추론 서비스 개발 및 운영
LLM 구조·서빙 워크로드·GPU 특성 프로파일링 및 병목 분석
서비스 요구사항에 맞춘 LLM 추론 시스템 설계·구현
추론 성능 및 GPU 자원 사용 현황 모니터링
모델·엔진 변경 전후 회귀 테스트를 통한 문제 조기 발견
Kubernetes 환경 추론 시스템 배포·운영
트래픽 변화에 따른 요청 및 GPU 자원 효율적 배분
vLLM·SGLang 기반 추론 서버 구현·구성·튜닝
모델 압축, KV 캐시 최적화, 요청 스케줄링, 다중 GPU 분산 추론 적용
추론 성능 개선 및 모델 품질 저하 여부 검증
Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 기법 검토·구현·검증
자격요건
LLM 서빙 또는 추론 최적화 분야 실무 경험
최신 LLM 구조 및 추론 과정 이해
모델·워크로드 특성에 따른 성능 병목 분석 및 최적화 방향 수립 역량
vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상 실무 사용 경험
추론 엔진 내부 코드 분석·수정 및 워크로드 맞춤 튜닝 경험
Python 능숙한 사용 및 추론 엔진 최적화 기능 직접 구현·검증 역량
모델 압축 또는 KV 캐시 최적화 경험
요청 스케줄링·다중 GPU 분산 추론 등 서빙 시스템 최적화 경험
Speculative Decoding, Prefill/Decode Disaggregation, Expert Parallelism 등 고급 추론·서빙 최적화 경험
우대사항
CUDA, Triton, TileLang 기반 GPU 커널 구현·튜닝 경험
다중 GPU 환경 LLM 분산 서빙 및 GPU 간 통신 비용·부하 불균형 개선 경험
MoE·긴 문맥·멀티모달 모델 서빙 및 메모리·연산 병목 해결 경험
LLM·NLP 분야 논문 발표 경험
추론 엔진·프레임워크 오픈소스 기여 경험
Kubernetes 환경 대규모 LLM 추론 서비스 배포·운영 경험
플랫폼팀과의 협업 경험
금융 등 규제 산업의 보안·규제 요건을 시스템 설계·운영에 반영한 경험
국가유공자 및 장애인 등 취업보호대상자 우대
전형절차
서류전형
과제전형
1차 실무진 면접전형
1차 면접 전 컬처핏 프로파일 검사
2차 경영진 면접전형
연봉 및 처우 협의
최종합격
경영진 면접 이후 레퍼런스 체크 진행 가능
서류전형 결과 개별 안내
접수방법
본사 홈페이지 지원
마감기한
2026년 8월 31일 23:59까지
공고 원문
이런 공고는 어때요?

펄크럼테크놀로지스
3년~20년 · 정규직 · 서울

메크랩
3년~10년 · 정규직 · 서울

모다플
3년~10년 · 정규직 · 서울

일레븐
3년~10년 · 정규직 · 경기

폴라펄스
10년 이하 · 계약직 · 서울

포밸류소프트
7년~20년 · 정규직 · 경기

스텝에이아이
20년 이하 · 정규직 · 서울

텔어스
20년 이하 · 정규직 · 서울

휴멜로
3년~8년 · 정규직 · 서울

vox.ai
1년~9년 · 정규직 · 서울

엘리스그룹
6년 이하 · 정규직 · 서울

딥아이
20년 이하 · 정규직 · 부산

주미당
8년~20년 · 정규직 · 서울

콕스웨이브
3년~7년 · 정규직 · 서울

페이스웹
20년 이하 · 체험형인턴 · 서울

메디콜
20년 이하 · 정규직 · 서울

디피플래닝
20년 이하 · 정규직 · 서울

에이아이카데미
20년 이하 · 정규직 · 광주

매버릭스
3년~5년 · 정규직 · 서울

오믈렛
5년~20년 · 정규직 · 서울




