인기 검색

ML Engineer (Platform)
공고 요약
담당업무
Gateway 시스템 개발 및 고도화
전사 LLM API 요청 처리 Gateway 구성
FastAPI 기반 Gateway 애플리케이션 설계·구현
인증·라우팅·트래픽 제어·장애 격리(Circuit Breaker, Fallback)·대규모 TPS 처리·부하 분산 설계·운영
ML서비스 운영 및 서빙: Kubernetes에서 모델 서빙 운영
LLM 서빙 아키텍처 설계·개선
서비스 지연시간(latency)·에러율·리소스 모니터링 및 이슈 분석·해결
근본 원인 규명 및 구조적 개선
전사 공통 ML 플랫폼 Kubeflow 기반 개발·운영
워크로드 성능 모니터링·최적화
LLM 인프라 환경 구축: vLLM, SGLang, Triton 활용
고성능 GPU 클러스터(H100,B300 등) 관리
데이터 학습 환경 구축·운영
자격요건
Python, Go, Java, Kotlin 중 하나 이상 숙련
프로덕션 API 서버 설계·개발 경험
API Gateway(Nginx, Kong 등) 또는 LLM Router 개발·운영 경험
대용량 트래픽 처리 및 장애 대응 경험
Kafka, Elasticsearch, Kibana 연동 경험
Prometheus, Grafana 활용 모델 서빙 모니터링 경험
KServe, BentoML, vLLM, SGLang 활용 경험
Kubernetes 환경에서 MLOps 컴포넌트 운영 경험(Kubeflow, KServe, Airflow, Argo CD, MLflow)
운영 이슈에 대한 근본 원인 분석 및 개선 경험
우대사항
MSA 환경에서 REST/gRPC 서비스 간 통신 경험(우대)
분산 시스템 설계로 대규모 트래픽 운영 경험(우대)
Azure AI Foundry/Azure AI Studio, AWS Bedrock/SageMaker 등 Public Cloud MLOps/LMMOps 운영 경험(우대)
vLLM, SGLang 활용으로 서빙 병목 분석 및 최적화 경험(또는 관련 오픈소스 기여)
disaggregated serving, prefix-aware routing, context caching 설계·최적화 경험(우대)
Kubernetes Operator/ Scheduler 확장 컴포넌트 설계·개발 경험(우대)
데이터 전처리부터 학습·배포·품질 관리·재학습까지 ML 파이프라인 운영 경험(우대)
임팩트 있는 업무/프로젝트 구체화 및 문제 해결 방법론 기술
전형절차
서류전형
프리테스트
직무 인터뷰
문화적합성 인터뷰
레퍼런스 체크
처우협의
최종합격 및 입사
근무환경
플랫폼: Kubernetes 기반 ML 인프라
도구: Kubeflow, Argo CD, Argo Workflows, Airflow
서빙: vLLM, SGLang, KServe, BentoML
모니터링·로깅: Prometheus, Grafana, Kafka, Elasticsearch, Kibana
GPU 인프라: H100/A100/B300 등 GPU 클러스터
데이터/클라우드: 온프렘 GPU 클러스터 운영 및 공용 클라우드 연계 가능성
마감기한
상시채용
토스증권 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요