Recruitment background

AI Infrastructure Operations Engineer

파두|2026. 9. 1. 게시|
2

공고 요약

경력3년 이상
채용 유형정규직
학력학사
지역서울
마감일상시채용
출처직행

담당업무

  • 사내 GPU 서버(H200, B300, DGX Spark 등) 운영 및 리소스 스케줄링

  • LLM, Embedding, Reranker 모델의 GPU 배치 및 서빙 파이프라인 관리

  • TTFT, throughput, latency, 가용성, SLA 모니터링 및 튜닝

  • GPU utilization 최적화와 신규 모델·서비스 도입을 위한 인프라 확장

  • GPU 인프라 장애 대응 및 RCA 기반 재발 방지 대책 수립

  • GPU 리소스 사용량 분석 기반 Capacity Planning 및 비용 최적화

  • RAG·Knowledge Graph 서버 운영 및 안정성·품질 관리

  • AI Chat·AI Search 등 사내 AI 서비스의 SLA 관리 및 사용성 개선

  • Retrieval 품질 및 Agent 응답 품질 모니터링과 지속적 개선

  • GPU 인프라와 서비스 특성을 활용한 서비스 확장 아이디어 발굴 및 실행

  • AI 서비스 CI/CD 구축, 무중단 배포 및 롤백 프로세스 운영

  • GPU·서비스 모니터링 대시보드 및 Alerting 체계 구축·고도화

  • 운영 매뉴얼(Runbook) 작성 및 신규 서비스 온보딩 지원

자격요건

  • 전문적인 Python 개발 역량

  • Linux 및 Docker 기반 container 환경 실무 경험

  • LLM, RAG, Agent 중 하나 이상에 대한 실제 서비스 구축 또는 운영 경험

우대사항

  • vLLM, SGLang, TensorRT-LLM, TGI, Ollama 등 On-prem LLM serving framework 경험

  • CUDA, cuDNN, NCCL, MIG, NVLink 등 NVIDIA GPU stack 이해

  • GPTQ, AWQ, FP8 등 모델 양자화, speculative decoding, KV-cache 관리 경험

  • Multi-GPU 분산 서빙 및 리소스 스케줄링 경험

  • Milvus, Qdrant, Weaviate, pgvector 등 Vector DB 운영 경험

  • Neo4j 등 Graph DB 운영 경험

  • Hybrid search, reranker, query rewriting 기반 Retrieval 품질 개선 경험

  • LangSmith, Phoenix, Ragas, DeepEval 등 LLM observability·evaluation 경험

  • 반도체, OS, Storage, SSD 도메인에 대한 이해 또는 관심

  • 도메인 전문가와 협업하고 요구사항을 시스템으로 전환한 경험

  • Git, Jira, Confluence 등 협업 도구 숙련도

  • 영문 기술 specification·논문 독해 및 프레젠테이션 자료 작성·발표 능력

  • 재사용 가능하고 유지보수 가능한 품질 코드 작성 경험

  • 분석 및 문제 해결 능력과 팀 협업·커뮤니케이션 역량

  • Open source 프로젝트 기여 경험

마감기한

상시채용

파두 지원하기 전 이력서 Check

시간이 없다면 AI와 한번에 수정해보세요

공고 원문

파두 AI Infrastructure Operations Engineer 채용공고
이런 공고 어때요?
지금 많이 보는 공고

댓글