Recruitment background

Senior Network Engineer – GPU Cluster Networking

AMD|2026. 10. 9. 게시|
0

공고 요약

경력12년~20년
채용 유형정규직
학력학사
지역해외
마감일상시채용
출처직행

담당업무

  • AMD Instinct GPU 클러스터용 고성능 백엔드 네트워크 패브릭의 아키텍처 설계, 구축, 운영 및 지속 개선

  • 개별 GPU 랙부터 10,000개 이상 GPU 규모 클러스터까지 지원하는 네트워크 패브릭 설계

  • GPU 서버와 NIC부터 리프-스파인 스위칭 패브릭까지 백엔드 네트워크 아키텍처 전반 담당

  • RoCEv2 기반 100/200/400 GbE 패브릭 설계 및 최적화

  • 리프-스파인, Clos, 팻트리, 레일 최적화, 멀티플레인 및 논블로킹 패브릭 토폴로지 설계

  • 토폴로지 모델링, 오버서브스크립션·트래픽 흐름 분석, 대역폭·포트 용량 계획, 장애 도메인 분석 및 장기 확장 예측

  • PFC, ECN, DCQCN, QoS, ECMP, 스위치 버퍼·큐 관리, DSCP 및 우선순위 매핑을 포함한 RoCEv2 환경 구성·튜닝·검증·문제 해결

  • BGP, ECMP, VLAN, VRF, EVPN, VXLAN 기반 라우팅·스위칭 환경 구성 및 운영

  • GPU, NIC, 스위치, CPU, PCIe 장치, 스토리지 및 Linux 네트워킹 스택 간 통신 성능 최적화

  • GPU 클러스터 네트워크의 운영 장애 대응, 근본 원인 분석, 시정 조치 및 예방 개선 주도

  • 네트워크 증설, 클러스터 확장, 스위치 교체, 용량 업그레이드 및 패브릭 마이그레이션 계획·실행

  • GPU·NIC·스위치 간 경로에서 분산 AI 학습, LLM 추론 및 HPC 워크로드의 대역폭·지연시간·집단 통신 성능 보장

자격요건

  • 데이터센터 네트워킹, RDMA, RoCEv2 및 대규모 GPU 클러스터 패브릭에 대한 심층 전문성

  • GPU 클러스터 네트워크 토폴로지, 혼잡, GPU-NIC 근접성, 라우팅, 스위치 버퍼링, 트래픽 클래스 및 집단 통신 패턴이 워크로드 성능에 미치는 영향에 대한 이해

  • 아키텍처, 구현, 검증, 운영 배포, 모니터링, 장애 대응, 용량 계획 및 지속 개선까지 엔드투엔드 결과에 대한 책임

  • 텔레메트리와 반복 가능한 성능 테스트를 통한 설계 검증 및 데이터 기반 엔지니어링 판단

  • 기술 과제 주도, 엔지니어 멘토링, 아키텍처·운영 표준 문서화 및 글로벌 조직과의 협업 역량

  • CCIE Data Center 또는 동등한 인증

우대사항

  • AI, GPU, HPC, 클라우드 또는 대규모 분산 컴퓨팅 환경의 프로덕션 데이터센터 네트워크 설계·구축·운영 경험

  • 약 10,000개 이상 GPU 또는 이에 준하는 하이퍼스케일 컴퓨팅 환경의 백엔드 네트워크 인프라 경험

  • 데이터센터 라우팅·스위칭, VLAN, 서브넷, BGP, ECMP, QoS, MTU, 스위치 버퍼링 및 네트워크 분할 지식

  • 프로덕션 환경의 RDMA 및 RoCEv2 실무 경험

  • PFC, ECN, DCQCN, QoS, 스위치 버퍼, NIC 큐, RDMA 트래픽 클래스 및 무손실·준무손실 이더넷 구성·튜닝·문제 해결 경험

  • 리프-스파인, Clos, 팻트리, 레일 최적화 및 멀티플레인 네트워크 아키텍처 이해

  • BGP·ECMP 라우팅과 EVPN·VXLAN 오버레이 기술 경험

  • GPU-GPU, GPU-NIC, CPU-NIC, PCIe, NUMA 및 네트워크 로컬리티를 포함한 GPU 클러스터 토폴로지 이해

  • Prometheus, Grafana, 스트리밍 텔레메트리, gNMI, SNMP, sFlow 또는 동등한 플랫폼 기반 모니터링·관측성 구축 경험

  • Juniper 데이터센터 스위칭 플랫폼 및 Junos OS 구성·문제 해결 경험

  • AMD Instinct 가속기, ROCm, RCCL 및 AMD GPU 소프트웨어 환경 경험

  • AMD Pensando AI NIC, SmartNIC, DPU 또는 기타 AMD Pensando 네트워킹 기술 경험

  • LLM 학습 및 통신 집약적 분산 AI 워크로드를 위한 백엔드 네트워크 설계 경험

  • BGP, EVPN, VXLAN 및 최신 리프-스파인 아키텍처 등 이더넷 패브릭 기술 경험

마감기한

상시채용

AMD 지원하기 전 이력서 Check

시간이 없다면 AI와 한번에 수정해보세요

공고 원문

AMD Senior Network Engineer – GPU Cluster Networking 채용공고
이런 공고 어때요?
지금 많이 보는 공고

댓글