인기 검색

Senior GPU Inference Performance Engineer
공고 요약
담당업무
AMD Instinct와 NVIDIA GPU의 AI·LLM 추론 워크로드 풀스택 프로파일링 및 성능 분석
HBM 대역폭, 컴퓨트 사용률, 커널 스케줄링, 메모리 할당, PCIe·Infinity Fabric 데이터 이동, GPU 런타임 병목 진단
GPU 런타임, Linux 운영체제, 디바이스 드라이버, 컨테이너 런타임, 메모리 서브시스템, CPU 스케줄링, NUMA 토폴로지 및 I/O 경로 간 성능 상호작용 분석
AMD와 NVIDIA 간 표준 AI·LLM 워크로드 벤치마크 설계 및 하드웨어 아키텍처, 네트워크 토폴로지, 통신 라이브러리, 소프트웨어 성숙도와 설정 차이에 기반한 성능 차이 설명
Prefill-decoding 분리, 파이프라인 병렬화, 텐서 병렬화를 포함한 멀티 서버 추론 네트워크 프로파일링 및 최적화
RDMA·RoCE 트레이스, NCCL·RCCL 집단 통신 프로파일링, GPUDirect RDMA, NIC 카운터와 네트워크 성능 도구를 활용한 지연·대역폭·혼잡·토폴로지 영향 분석
GPU 오퍼레이터, 디바이스 플러그인, Docker·containerd, Kubernetes 스케줄링이 추론 지연에 미치는 오버헤드 분석 및 지터·콜드스타트·리소스 경합 해결
재현 가능한 벤치마크 하네스, 프로파일링 스크립트, 성능 회귀 대시보드 구축 및 트레이스 수집·분석 자동화
펌웨어, 드라이버, 네트워킹 스택, 런타임 및 AI 프레임워크 전반의 지속적 성능 검증 지원
성능 분석 결과를 서면 보고서와 프레젠테이션으로 작성하고 제품 및 임원 이해관계자에게 설명
자격요건
GPU 성능 엔지니어링, HPC, 분산 시스템, 네트워킹, 운영체제 또는 시스템 성능 분석 배경
GPU 아키텍처, 워프·웨이브프론트 실행, 메모리 계층, 점유율 및 명령어 수준 병렬화 이해
Linux 시스템 성능 분석, 운영체제, 디바이스 드라이버, 가상화, 컨테이너 런타임 또는 저수준 시스템 소프트웨어 개발 경험
Python 및 C/C++ 역량
GPU 커널 코드, 런타임 코드 또는 시스템 수준 소프트웨어를 읽고 분석하는 능력
하드웨어·소프트웨어 근거에 기반해 성능 차이를 설명하고 보고서나 프레젠테이션으로 전달하는 능력
NCCL·RCCL, RDMA·RoCE, GPUDirect RDMA, UCX, MPI, ConnectX, Pensando 또는 유사 고성능 네트워킹 기술 경험
멀티 GPU·멀티 노드 추론, 학습 또는 HPC 환경과 텐서 병렬화, 파이프라인 병렬화, 분산 통신 라이브러리 경험
우대사항
ROCm, rocProfiler, ROCm Systems Profiler, RGP, rocprof-compute, rocprof-sys, Omniperf·Omnitrace 등 AMD 프로파일링 도구 경험
CUDA, Nsight Systems·Compute, NCU, DCGM 등 NVIDIA 프로파일링 도구 경험
Kubernetes GPU 스케줄링, MIG 또는 GPU 오퍼레이터 성능 분석 경험
오픈소스 인프라, 시스템, 네트워킹, 추론 또는 프로파일링 프로젝트 기여 경험
관련 기술 분야의 고급 학위
비자 스폰서십을 제공하지 않는 포지션
근무환경
하이브리드 근무
하드웨어, 시스템 소프트웨어, 네트워킹 및 AI 인프라 팀과의 협업
직접적인 커뮤니케이션, 협업, 포용적 관점을 중시하는 업무 문화
전형절차
인공지능을 활용한 지원자 스크리닝·평가·선발 가능
채용 및 선발 과정 전반에서 지원자 편의 제공
마감기한
상시채용
AMD 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요