인기 검색

AI Infrastructure Operations Engineer
공고 요약
담당업무
사내 GPU 서버(H200, B300, DGX Spark 등) 운영 및 리소스 스케줄링
LLM, Embedding, Reranker 모델의 GPU 배치 및 서빙 파이프라인 관리
TTFT, throughput, latency, 가용성, SLA 모니터링 및 튜닝
GPU utilization 최적화와 신규 모델·서비스 도입을 위한 인프라 확장
GPU 인프라 장애 대응 및 RCA 기반 재발 방지 대책 수립
GPU 리소스 사용량 분석 기반 Capacity Planning 및 비용 최적화
RAG·Knowledge Graph 서버 운영 및 안정성·품질 관리
AI Chat·AI Search 등 사내 AI 서비스의 SLA 관리 및 사용성 개선
Retrieval 품질 및 Agent 응답 품질 모니터링과 지속적 개선
GPU 인프라와 서비스 특성을 활용한 서비스 확장 아이디어 발굴 및 실행
AI 서비스 CI/CD 구축, 무중단 배포 및 롤백 프로세스 운영
GPU·서비스 모니터링 대시보드 및 Alerting 체계 구축·고도화
운영 매뉴얼(Runbook) 작성 및 신규 서비스 온보딩 지원
자격요건
전문적인 Python 개발 역량
Linux 및 Docker 기반 container 환경 실무 경험
LLM, RAG, Agent 중 하나 이상에 대한 실제 서비스 구축 또는 운영 경험
우대사항
vLLM, SGLang, TensorRT-LLM, TGI, Ollama 등 On-prem LLM serving framework 경험
CUDA, cuDNN, NCCL, MIG, NVLink 등 NVIDIA GPU stack 이해
GPTQ, AWQ, FP8 등 모델 양자화, speculative decoding, KV-cache 관리 경험
Multi-GPU 분산 서빙 및 리소스 스케줄링 경험
Milvus, Qdrant, Weaviate, pgvector 등 Vector DB 운영 경험
Neo4j 등 Graph DB 운영 경험
Hybrid search, reranker, query rewriting 기반 Retrieval 품질 개선 경험
LangSmith, Phoenix, Ragas, DeepEval 등 LLM observability·evaluation 경험
반도체, OS, Storage, SSD 도메인에 대한 이해 또는 관심
도메인 전문가와 협업하고 요구사항을 시스템으로 전환한 경험
Git, Jira, Confluence 등 협업 도구 숙련도
영문 기술 specification·논문 독해 및 프레젠테이션 자료 작성·발표 능력
재사용 가능하고 유지보수 가능한 품질 코드 작성 경험
분석 및 문제 해결 능력과 팀 협업·커뮤니케이션 역량
Open source 프로젝트 기여 경험
마감기한
상시채용
파두 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요