Recruitment background

[FADU] AI Infrastructure Operations Engineer

파두|2026. 9. 1. 게시|
2

공고 요약

경력3년 이상
채용 유형정규직
학력학사
지역서울
마감일D-22
출처리멤버

주요업무

  • 사내 GPU 서버(H200, B300, DGX Spark 등) 운영 및 리소스 스케줄링

  • LLM, Embedding, Reranker 모델의 GPU 배치 및 서빙 파이프라인 관리

  • 서빙 성능(TTFT, throughput, latency), 가용성, SLA 모니터링 및 튜닝

  • GPU utilization 최적화와 신규 모델·서비스 도입을 위한 인프라 확장

  • GPU 인프라 장애 대응(On-call) 및 재발 방지 대책(RCA) 수립

  • GPU 리소스 사용량 분석 기반 용량 계획 및 비용 최적화

  • RAG·Knowledge Graph 서버 운영과 안정성·품질 관리

  • AI Chat·AI Search 등 사내 AI 서비스의 SLA 관리 및 사용성 개선

  • Retrieval 품질과 Agent 응답 품질 모니터링 및 개선

  • AI 서비스 배포 자동화(CI/CD), 무중단 배포 및 롤백 프로세스 운영

  • GPU·서비스 모니터링 대시보드와 알림 체계 구축·고도화

  • 운영 매뉴얼(Runbook) 작성 및 신규 서비스 온보딩 지원

자격요건

  • 전문적인 Python 개발 역량

  • Linux 및 Docker 기반 container 환경 실무 경험

  • LLM, RAG, Agent 중 하나 이상의 실제 서비스 구축 또는 운영 경험

우대사항

  • vLLM, SGLang, TensorRT-LLM, TGI, Ollama 등 On-prem LLM serving framework 경험

  • CUDA, cuDNN, NCCL, MIG, NVLink 등 NVIDIA GPU stack 이해

  • GPTQ, AWQ, FP8 등 모델 양자화, speculative decoding, KV-cache 관리 경험

  • Multi-GPU 분산 서빙 및 리소스 스케줄링 경험

  • Milvus, Qdrant, Weaviate, pgvector 등 Vector DB 운영 경험

  • Neo4j 등 Graph DB 운영 경험

  • hybrid search, reranker, query rewriting 등 Retrieval 품질 개선 경험

  • LangSmith, Phoenix, Ragas, DeepEval 등 LLM observability·evaluation 경험

  • 반도체, OS, Storage, SSD 도메인 이해 또는 관심

  • Git, Jira, Confluence 등 협업 도구 사용 능력

  • 영문 기술 specification·논문 독해 및 프레젠테이션 자료 작성·발표 능력

  • 재사용 가능하고 유지보수 가능한 품질 코드 작성 경험

  • 분석·문제 해결 능력 및 팀 협업·커뮤니케이션 역량

  • Open source 프로젝트 기여 경험

보상 및 복리후생

  • 연봉 협의

  • 교육비 지원

  • 영어 회화 교육 지원

  • 외부 교육 프로그램 수강 지원

  • 식대 지원

  • 성과급

  • 경조금 및 경조휴가

  • 임직원 및 가족 종합건강검진 연 2회

  • 조직강화활동비

  • 입사축하 가족 꽃선물 및 웰컴키트

전형절차

  1. 서류전형

  2. 1차면접

  3. 2차면접

  4. 처우협상

근무환경

  • 자유로운 출퇴근이 가능한 유연근무제

  • 10 to 4 코어타임

  • 기본 20일 연차 휴가

  • 무제한 간식과 휴식 공간

  • 안마의자 및 플레이스테이션 구비

  • 타운홀 미팅 및 주제별 런치 프로그램

마감기한

2026년 9월 27일 23:59까지

파두 지원하기 전 이력서 Check

시간이 없다면 AI와 한번에 수정해보세요

공고 원문

파두 [FADU] AI Infrastructure Operations Engineer 채용공고
이런 공고 어때요?
지금 많이 보는 공고

댓글