인기 검색

AI Platform Engineer
공고 요약
담당업무
온프레미스와 AWS·GCP를 아우르는 하이브리드 GPU Kubernetes 클러스터 및 Istio·Cilium 기반 네트워크 구축
GPU Operator 스택 트러블슈팅 및 용량 계획을 통한 리소스 효율 최적화
vLLM·SGLang 기반 대규모 LLM 서빙 및 NVIDIA Dynamo 기반 분산 추론 아키텍처 설계
Kubernetes Custom Resource와 Operator 패턴을 활용한 서빙 워크로드 배포 자동화
RDMA(IB/RoCE) 기반 고속 GPU 네트워크 설계 및 노드 간 통신·I/O 병목 해결
VAST 등 고성능 AI 스토리지 도입 및 대용량 모델 로딩·KV Cache 관리 최적화
자격요건
Kubernetes 기반 공용 플랫폼 직접 설계·운영 경험
대규모 GPU 클러스터 및 GPU Operator 스택 프로덕션 운영 경험
vLLM·SGLang 등 LLM 서빙 엔진을 활용한 대용량 트래픽 처리 및 분산 추론 인프라 운영 경험
Python·Go 기반 인프라 자동화 또는 Kubernetes CRD·Controller 패턴 구현 경험
AI·ML 모델링에 대한 완벽한 도메인 지식 없이도 데이터·AI 조직과 협업할 수 있는 역량
우대사항
NVIDIA Dynamo 기반 분산 추론 아키텍처 이해
RDMA(IB/RoCE)·NCCL 기반 고속 GPU 네트워크 환경 이해
Volcano·Kueue를 활용한 대규모 멀티테넌트 GPU 자원 스케줄링 경험
온프레미스와 퍼블릭 클라우드가 결합된 하이브리드 환경 경험
VAST 등 고성능 AI 스토리지 활용 경험
DCGM 지표·XID·NVLink 등 GPU 하드웨어 레벨 장애 분석·진단 경험
플랫폼 치명적 장애 해결 또는 성능·리소스 최적화 경험
오픈소스 버그·이슈 해결 또는 기능 개선 기여 경험
전형절차
서류 접수
프리 인터뷰
직무 인터뷰
문화적합성 인터뷰
레퍼런스 체크
처우 협의
최종 합격
면접안내
프리 인터뷰: 지원서 기반 주요 경험 및 직무 적합도 중심
직무 인터뷰: 심층 기술 면접 및 ML 시스템 설계
근무환경
ML·AI 워크로드를 안정적으로 운영하는 ML/AI Infra 팀
온프레미스 ML 전용 Kubernetes 클러스터와 AWS·GCP 멀티 클라우드 환경 운영
대규모 프론티어 LLM 서빙 인프라 및 GPU 하드웨어·Kubernetes 레벨 최적화 경험
금융·추천·검색 등 다양한 도메인의 대규모 트래픽을 지원하는 프로덕션 인프라 구축
마감기한
상시채용
비바리퍼블리카 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
댓글
비바리퍼블리카에 맞는
이력서로 자동 수정하기