인기 검색

Senior Network Engineer – GPU Cluster Networking
공고 요약
담당업무
AMD Instinct GPU 클러스터용 고성능 백엔드 네트워크 패브릭의 아키텍처 설계, 구축, 운영 및 지속 개선
개별 GPU 랙부터 10,000개 이상 GPU 규모 클러스터까지 지원하는 네트워크 패브릭 설계
GPU 서버와 NIC부터 리프-스파인 스위칭 패브릭까지 백엔드 네트워크 아키텍처 전반 담당
RoCEv2 기반 100/200/400 GbE 패브릭 설계 및 최적화
리프-스파인, Clos, 팻트리, 레일 최적화, 멀티플레인 및 논블로킹 패브릭 토폴로지 설계
토폴로지 모델링, 오버서브스크립션·트래픽 흐름 분석, 대역폭·포트 용량 계획, 장애 도메인 분석 및 장기 확장 예측
PFC, ECN, DCQCN, QoS, ECMP, 스위치 버퍼·큐 관리, DSCP 및 우선순위 매핑을 포함한 RoCEv2 환경 구성·튜닝·검증·문제 해결
BGP, ECMP, VLAN, VRF, EVPN, VXLAN 기반 라우팅·스위칭 환경 구성 및 운영
GPU, NIC, 스위치, CPU, PCIe 장치, 스토리지 및 Linux 네트워킹 스택 간 통신 성능 최적화
GPU 클러스터 네트워크의 운영 장애 대응, 근본 원인 분석, 시정 조치 및 예방 개선 주도
네트워크 증설, 클러스터 확장, 스위치 교체, 용량 업그레이드 및 패브릭 마이그레이션 계획·실행
GPU·NIC·스위치 간 경로에서 분산 AI 학습, LLM 추론 및 HPC 워크로드의 대역폭·지연시간·집단 통신 성능 보장
자격요건
데이터센터 네트워킹, RDMA, RoCEv2 및 대규모 GPU 클러스터 패브릭에 대한 심층 전문성
GPU 클러스터 네트워크 토폴로지, 혼잡, GPU-NIC 근접성, 라우팅, 스위치 버퍼링, 트래픽 클래스 및 집단 통신 패턴이 워크로드 성능에 미치는 영향에 대한 이해
아키텍처, 구현, 검증, 운영 배포, 모니터링, 장애 대응, 용량 계획 및 지속 개선까지 엔드투엔드 결과에 대한 책임
텔레메트리와 반복 가능한 성능 테스트를 통한 설계 검증 및 데이터 기반 엔지니어링 판단
기술 과제 주도, 엔지니어 멘토링, 아키텍처·운영 표준 문서화 및 글로벌 조직과의 협업 역량
CCIE Data Center 또는 동등한 인증
우대사항
AI, GPU, HPC, 클라우드 또는 대규모 분산 컴퓨팅 환경의 프로덕션 데이터센터 네트워크 설계·구축·운영 경험
약 10,000개 이상 GPU 또는 이에 준하는 하이퍼스케일 컴퓨팅 환경의 백엔드 네트워크 인프라 경험
데이터센터 라우팅·스위칭, VLAN, 서브넷, BGP, ECMP, QoS, MTU, 스위치 버퍼링 및 네트워크 분할 지식
프로덕션 환경의 RDMA 및 RoCEv2 실무 경험
PFC, ECN, DCQCN, QoS, 스위치 버퍼, NIC 큐, RDMA 트래픽 클래스 및 무손실·준무손실 이더넷 구성·튜닝·문제 해결 경험
리프-스파인, Clos, 팻트리, 레일 최적화 및 멀티플레인 네트워크 아키텍처 이해
BGP·ECMP 라우팅과 EVPN·VXLAN 오버레이 기술 경험
GPU-GPU, GPU-NIC, CPU-NIC, PCIe, NUMA 및 네트워크 로컬리티를 포함한 GPU 클러스터 토폴로지 이해
Prometheus, Grafana, 스트리밍 텔레메트리, gNMI, SNMP, sFlow 또는 동등한 플랫폼 기반 모니터링·관측성 구축 경험
Juniper 데이터센터 스위칭 플랫폼 및 Junos OS 구성·문제 해결 경험
AMD Instinct 가속기, ROCm, RCCL 및 AMD GPU 소프트웨어 환경 경험
AMD Pensando AI NIC, SmartNIC, DPU 또는 기타 AMD Pensando 네트워킹 기술 경험
LLM 학습 및 통신 집약적 분산 AI 워크로드를 위한 백엔드 네트워크 설계 경험
BGP, EVPN, VXLAN 및 최신 리프-스파인 아키텍처 등 이더넷 패브릭 기술 경험
마감기한
상시채용
AMD 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
댓글
AMD에 맞는
이력서로 자동 수정하기