인기 검색

Principal Software Engineer - LLM Optimization
공고 요약
담당업무
프로덕션 LLM 워크로드 벤치마킹 및 성능 특성 분석
재현 가능한 기준선 수립과 성능 회귀 조기 탐지
FP8, INT8/INT4 GPTQ/AWQ 등 양자화 실험 및 정확도·처리량·메모리·토큰당 비용 측정
draft model, n-gram, multi-token prediction 기반 speculative decoding 전략 수립
GPU 사용률, 메모리 여유, 1K 토큰당 비용을 포함한 GPU 효율 scorecard 구축
외부 프로바이더 및 업계 벤치마크와의 성능 비교
새로운 스케줄러 아키텍처, async tensor parallelism, disaggregated prefill/decode 및 speculative decoding 검증
KV-cache 최적화, prefix caching, 멀티노드 서빙 아키텍처 협업
GPU 장애 시나리오를 활용한 chaos engineering 및 감지·복구 성능 측정
에이전트 AI 기반 코드 리뷰, 테스트 생성·유지보수, 릴리스 점검, 장애 원인 분석 워크플로 설계
AI 지원 개발 및 자동화 도구의 보안·복원력·검증·재사용 가드레일 수립
자격요건
LLM 추론 시스템에 대한 실무 경험
vLLM, TensorRT-LLM, SGLang, LLM-D 또는 동등한 프로덕션 서빙 엔진 경험
GPU 메모리 구조, KV cache, 메모리 대역폭과 연산 병목에 대한 이해
추론 시 양자화 기법과 실제 운영상 트레이드오프 이해
speculative decoding과 프로덕션 workload의 acceptance rate 변수 이해
GuideLLM 또는 커스텀 하네스를 활용한 엄격한 벤치마킹 경험
AWS, EKS 및 관리형 추론 서비스를 포함한 클라우드 GPU 인프라 경험
업계 벤치마크를 활용한 플랫폼 개선 경험
시니어 엔지니어링 및 비즈니스 이해관계자에게 기술적 트레이드오프를 명확히 전달하는 역량
여러 팀에 에이전트 AI 개발 방식을 도입하고 human-in-the-loop 검증, 변경 이력 추적, 민감 데이터 보호 기준을 수립한 경험
엔지니어링 워크플로에서 책임 있는 AI 사용, 보안·복원력·데이터 민감도·위험 기반 거버넌스에 대한 이해
우대사항
Disaggregated prefill/decode 서빙 아키텍처 경험
DCGM, NVML, XID 이벤트 추적 등 GPU 하드웨어 진단 경험
ML observability 및 프로덕션 모니터링 경험
보상과 복리후생
기본급 및 역할·경력·기술·근무지역에 따른 총보상
성과에 따른 현금 또는 forfeitable equity 형태의 인센티브
건강관리 지원
retirement savings plan
backup childcare
tuition reimbursement
정신건강 지원
금융 코칭
근무환경
기업 승인 AI 도구를 활용한 개발 자동화
보안, 복원력, 감사 가능성 및 변경 추적을 고려한 AI 활용 거버넌스
다양성과 포용성을 중시하는 조직 문화
종교적 실천과 정신적·신체적 장애에 대한 합리적 편의 제공
마감기한
상시채용
JPMorganChase 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
댓글
JPMorganChase에 맞는
이력서로 자동 수정하기