인기 검색

ML Engineer (Infra)
공고 요약
담당업무
대규모 AI 인프라의 효율성 극대화
자원 정교한 제어
인프라 성능 고도화
초고성능 AI 컴퓨팅 환경 설계 및 운영
GPU 클러스터(H100, B300 시리즈)와 400Gbps급 고성능 스토리지의 쿠버네티스 환경 설계 및 운영
네트워크와 스토리지 최적화로 하드웨어 성능 극대화
사내 인프라 및 외부 클라우드 자원 현황 통합 관측 시스템 구축
자원 독점 방지 및 중요도 기반 리소스 정교한 할당
딱 맞는 자원 추천 도구 개발
모델 실시간 성능/에러율 감지 및 자동 스케일링/GPU 재배치 구현
프로파일링 환경 구축으로 학습/서빙 병목 원인 분석 및 개선 지원
자격요건
대규모 트래픽 처리 쿠버네티스 기반 ML 인프라 구축 및 운영
실제 라이브 서비스의 안정적 운영에 대한 책임 의식
장애 발생 시 근본 원인 분석 및 디버깅 경험
시스템 리소스(GPU/CPU/Memory/Network/Storage) 동작 원리 이해 및 모니터링 시스템 구축 경험
서비스 운영 중 다양한 문제 해결 및 시스템 견고성 향상에 기여
우대사항
대규모 클러스터 자원 현황 통합 관측 경험
Quota 및 Rate Limit 기반 리소스 제어 시스템 구축 경험
오픈 소스 플랫폼(Kubeflow/Kubernetes) 내부 코드 이해 및 필요 시 수정 경험
Nsight Systems/Compute, PyTorch Profiler 등 도구를 통한 커널 레벨 병목 분석 경험
워크로드 특성에 따른 비용 최적화(Rightsizing) 설계 경험
GPU 가상화 기술(MIG, MPS) 도입 및 자원 활용 극대화 경험
우대환경 및 선호 기술
대규모 인프라 관측 시스템 설계 및 운영 경험
다양한 클라우드(AWS, Azure) 및 온프렘 인프라 연계 경험
인프라 자동화 도구 설계 및 구현 경험
전형절차
서류접수
프리테스트
직무 인터뷰
문화적합성 인터뷰
레퍼런스 체크
처우협의
최종합격 및 입사
혜택 및 우대
장애인 및 국가보훈대상자 우대
기술 및 환경
토스증권 인프라 기술 스택
Infrastructure: Kubernetes, Kubeflow, Argo CD, Helm
Cloud & Compute: AWS, Azure, H100/B300 GPU Cluster, Infiniband, NVLink, 고성능 스토리지
Serving & Optimization: vLLM, SGLang
Observability & Data: Prometheus, Grafana, Elasticsearch, Kafka, DCGM, Nsight
Languages: Python
마감기한
상시채용
토스증권 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요