인기 검색

[FADU] AI Infrastructure Operations Engineer
공고 요약
주요업무
사내 GPU 서버(H200, B300, DGX Spark 등) 운영 및 리소스 스케줄링
LLM, Embedding, Reranker 모델의 GPU 배치 및 서빙 파이프라인 관리
서빙 성능(TTFT, throughput, latency), 가용성, SLA 모니터링 및 튜닝
GPU utilization 최적화와 신규 모델·서비스 도입을 위한 인프라 확장
GPU 인프라 장애 대응(On-call) 및 재발 방지 대책(RCA) 수립
GPU 리소스 사용량 분석 기반 용량 계획 및 비용 최적화
RAG·Knowledge Graph 서버 운영과 안정성·품질 관리
AI Chat·AI Search 등 사내 AI 서비스의 SLA 관리 및 사용성 개선
Retrieval 품질과 Agent 응답 품질 모니터링 및 개선
AI 서비스 배포 자동화(CI/CD), 무중단 배포 및 롤백 프로세스 운영
GPU·서비스 모니터링 대시보드와 알림 체계 구축·고도화
운영 매뉴얼(Runbook) 작성 및 신규 서비스 온보딩 지원
자격요건
전문적인 Python 개발 역량
Linux 및 Docker 기반 container 환경 실무 경험
LLM, RAG, Agent 중 하나 이상의 실제 서비스 구축 또는 운영 경험
우대사항
vLLM, SGLang, TensorRT-LLM, TGI, Ollama 등 On-prem LLM serving framework 경험
CUDA, cuDNN, NCCL, MIG, NVLink 등 NVIDIA GPU stack 이해
GPTQ, AWQ, FP8 등 모델 양자화, speculative decoding, KV-cache 관리 경험
Multi-GPU 분산 서빙 및 리소스 스케줄링 경험
Milvus, Qdrant, Weaviate, pgvector 등 Vector DB 운영 경험
Neo4j 등 Graph DB 운영 경험
hybrid search, reranker, query rewriting 등 Retrieval 품질 개선 경험
LangSmith, Phoenix, Ragas, DeepEval 등 LLM observability·evaluation 경험
반도체, OS, Storage, SSD 도메인 이해 또는 관심
Git, Jira, Confluence 등 협업 도구 사용 능력
영문 기술 specification·논문 독해 및 프레젠테이션 자료 작성·발표 능력
재사용 가능하고 유지보수 가능한 품질 코드 작성 경험
분석·문제 해결 능력 및 팀 협업·커뮤니케이션 역량
Open source 프로젝트 기여 경험
보상 및 복리후생
연봉 협의
교육비 지원
영어 회화 교육 지원
외부 교육 프로그램 수강 지원
식대 지원
성과급
경조금 및 경조휴가
임직원 및 가족 종합건강검진 연 2회
조직강화활동비
입사축하 가족 꽃선물 및 웰컴키트
전형절차
서류전형
1차면접
2차면접
처우협상
근무환경
자유로운 출퇴근이 가능한 유연근무제
10 to 4 코어타임
기본 20일 연차 휴가
무제한 간식과 휴식 공간
안마의자 및 플레이스테이션 구비
타운홀 미팅 및 주제별 런치 프로그램
마감기한
2026년 9월 27일 23:59까지
파두 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요