인기 검색

Senior Network Engineer – GPU Cluster Networking
공고 요약
담당업무
대규모 AMD Instinct GPU 클러스터용 고성능 백엔드 네트워크 아키텍처 설계·배포·운영·개선
GPU 서버와 NIC부터 데이터센터 leaf-spine 스위칭 패브릭까지 네트워크 경로 설계
100/200/400 GbE 기반 RoCEv2 네트워크 패브릭 설계 및 최적화
leaf-spine, Clos, fat-tree, rail-optimized, multi-plane, non-blocking 네트워크 토폴로지 설계
토폴로지 모델링, 오버서브스크립션·트래픽 흐름·대역폭·포트 용량 분석 및 성장 예측
PFC, ECN, DCQCN, QoS, ECMP, 스위치 버퍼·큐 관리, DSCP·우선순위 매핑 구성·튜닝·검증·문제 해결
BGP, ECMP, VLAN, VRF, EVPN, VXLAN 기반 라우팅·스위칭 환경 운영
GPU, NIC, 스위치, CPU, PCIe, 스토리지 및 Linux 네트워킹 스택 간 통신 성능 최적화
GPU 클러스터 네트워크 장애 대응, 근본 원인 분석, 시정·예방 조치 수행
네트워크 확장, 클러스터 스케일아웃, 스위치 교체, 용량 업그레이드 및 패브릭 마이그레이션
자격요건
데이터센터 네트워킹, RDMA, RoCEv2 및 대규모 GPU 클러스터 패브릭 전문성
AI, GPU, HPC, 클라우드 또는 대규모 분산 컴퓨팅 환경의 프로덕션 데이터센터 네트워크 설계·배포·운영 경험
약 10,000개 이상 GPU 규모의 클러스터 또는 유사한 하이퍼스케일 환경 경험
라우팅·스위칭, VLAN, 서브넷팅, BGP, ECMP, QoS, MTU, 스위치 버퍼, 네트워크 세그멘테이션 지식
PFC, ECN, DCQCN, QoS, 스위치 버퍼, NIC 큐, RDMA 트래픽 클래스 및 무손실 Ethernet 튜닝 경험
GPU-to-GPU, GPU-to-NIC, CPU-to-NIC, PCIe, NUMA 및 네트워크 로컬리티 이해
Prometheus, Grafana, 스트리밍 텔레메트리, gNMI, SNMP, sFlow 등을 활용한 모니터링·관측성 구축 경험
Juniper 데이터센터 스위칭 플랫폼과 Junos OS 구성·트러블슈팅 경험
AMD Instinct, ROCm, RCCL 및 AMD GPU 소프트웨어 환경 경험
AMD Pensando AI NIC, SmartNIC, DPU 또는 관련 네트워킹 기술 경험
LLM 학습 및 통신 집약형 분산 AI 워크로드용 백엔드 네트워크 설계 경험
우대사항
대규모 GPU 클러스터의 고성능 Ethernet 패브릭 구축 경험
BGP, EVPN, VXLAN 및 최신 leaf-spine 데이터센터 아키텍처 경험
반복 가능한 성능 테스트와 텔레메트리를 활용한 데이터 기반 엔지니어링 경험
복잡한 기술 이니셔티브 리딩, 엔지니어 멘토링 및 아키텍처·운영 표준 문서화 경험
근무환경
AMD AI 엔지니어링, 네트워크 엔지니어링, 데이터센터, 스토리지, 보안, 플랫폼, 애플리케이션 팀과 협업
글로벌 분산 조직과 협업
기술 이니셔티브 리딩 및 엔지니어 멘토링
마감기한
상시채용
AMD 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
댓글
AMD에 맞는
이력서로 자동 수정하기