추천 검색

[인턴] [NetsPresso] R&D AI Research Engineer (XPU Enabler팀)
공고 요약
담당업무
대규모 MoE 모델 Quantization 기술 연구·개발
구조적·비구조적 Pruning 및 Sparsity 기술 연구·개발
Calibration, Reconstruction, Fine-tuning 방법론 개발
TensorRT-LLM, vLLM, SGLang, ONNX Runtime 기반 추론 최적화
CUDA, Triton, NPU Vendor SDK 기반 Operator·Kernel 개발
KV Cache Optimization, Dynamic Batching, Speculative Decoding 개발
LLM/VLM의 Accuracy, Latency, Throughput, Memory Footprint 평가
NVIDIA GPU 및 국내외 NPU·AI Accelerator 탑재와 실제 Device 성능 검증
모델 변환, Compile, Runtime 연동
최신 연구 분석, 특허 출원, 논문 작성 및 학술대회 발표
자격요건
LLM, VLM 또는 Transformer 기반 모델에 대한 깊은 이해
MoE Quantization, Pruning, Sparsity 또는 Inference Optimization 실무 경험
LLM/VLM Quantization, Model Pruning, MoE Compression, Efficient Transformer, Inference Optimization 중 하나 이상의 연구·개발 경험
정확도·Latency·Throughput·Memory·연산량 종합 분석 역량
추론 시스템 및 Hardware 환경 구현 역량
문제 정의와 실험 설계·수행 역량
해외 출장 및 여행 결격 사유 없음
우대사항
Top-tier AI/ML 학술대회 논문 게재 경험
LLM/VLM 또는 MoE Quantization·Pruning 논문·특허·오픈소스 실적
GPTQ, AWQ, SmoothQuant, OmniQuant, AutoRound, SparseGPT 구현·확장 경험
TensorRT-LLM, vLLM, SGLang, DeepSpeed, Megatron-LM 개발 경험
CUDA 또는 Triton GPU Kernel Optimization 경험
NPU·ASIC·Edge AI Accelerator 모델 Porting·Optimization 경험
NPU Vendor SDK, Compiler, Runtime 기반 모델 변환·배포 경험
Custom Operator·Kernel 개발 경험
MoE Expert Routing, Load Balancing, Parallelism 또는 통신 최적화 경험
마감기한
2026년 8월 23일 23:59까지
공고 원문
소개
[Nota AI] 2026 R&D Internship • 노타와 함께 실제 AI 제품과 기술을 만들어갈 R&D 인턴을 모집합니다. AI for everyone, everywhere AI를 누구에게나, 어디에서나 노타는 AI 최적화 기술을 통해 AI의 일상화를 선도하는 기업입니다. 우리는 다양한 디바이스와 산업 전반에 걸쳐, 누구나 어디서나 AI를 사용할 수 있는 세상을 만들고자 합니다. 노타의 핵심 제품인 넷츠프레소(NetsPresso)는 하드웨어의 특성을 이해하는 AI 모델 최적화 플랫폼입니다. 또한, 차세대 영상 관제 솔루션 (NVA: Nota Vision Agent), 지능형 교통 시스템(ITS) 등 온디바이스 생성형 AI 솔루션을 통해 실제 산업 현장에서의 AI 실현 가능성을 넓히고 있습니다. 국내 스타트업으로는 최초로 삼성과 LG의 투자 유치 기록을 보유하고 있으며, 네이버 DS2F의 첫 투자 기업이기도 합니다. 최근에는 두바이 교통국과의 AI 솔루션 공급 계약을 체결하고, CB Insights AI 100에도 선정되는 등 글로벌 무대에서의 성과를 이어가고 있습니다. 노타는 빠르게 성장하는 조직과 함께할 다양한 직군의 노타 크루를 찾고 있습니다. 직급과 경력에 관계없이 누구나 동등한 입장에서 의견을 나눌 수 있는 수평적인 문화 속에서, 공동의 목표를 향해 자율적으로 일할 수 있는 분과 함께하고 싶습니다. 누구나, 어디에서나 AI의 가치를 경험할 수 있도록 하는 여정, 지금 노타에서 함께하세요.
주요업무
업스테이지 컨소시엄을 통해 개발되는 LLM/VLM Foundation Model의 경량화 및 추론 최적화를 담당합니다. • 대규모 MoE 모델의 Quantization 기술 연구·개발 • Post-Training Quantization(PTQ) • Quantization-Aware Training(QAT) • 구조적·비구조적 Pruning 및 Sparsity 기술 연구·개발 • Quantization·Pruning 과정에서 발생하는 모델 성능 저하를 최소화하기 위한 Calibration, Reconstruction 및 Fine-tuning 방법론 개발 • TensorRT-LLM, vLLM, SGLang, ONNX Runtime 등 Inference Framework 기반 최적화 • CUDA, Triton 또는 NPU Vendor SDK를 활용한 고성능 Operator 및 Kernel 개발 • KV Cache Optimization, Continuous/Dynamic Batching, Speculative Decoding 등 추론 가속 기술 개발 • LLM/VLM의 Accuracy, Latency, Throughput, Memory Footprint 평가 • 최적화된 LLM/VLM의 NVIDIA GPU 및 다양한 국내외 NPU·AI Accelerator 탑재 • Hardware 특성을 고려한 Model Optimization • 모델 변환, Compile, Runtime 연동 및 실제 Device 성능 검증 • LLM/VLM 및 MoE 모델 경량화·추론 최적화 관련 최신 연구 분석 • 신규 Quantization, Pruning 및 Inference Optimization 방법론 연구 • 연구 결과의 특허 출원, 논문 작성 및 국내외 학술대회 발표
자격요건
• LLM, VLM 또는 Transformer 기반 모델에 대한 깊은 이해를 보유하신 분 • MoE 모델의 Quantization, Pruning, Sparsity 또는 Inference Optimization 기술을 실제 프로젝트에 적용할 수 있으신 분 • 아래 분야 중 하나 이상에서 실질적인 연구 또는 개발 경험을 보유하신 분 • LLM/VLM Quantization • Model Pruning 및 Sparsity • MoE Compression 및 Routing Optimization • Efficient Transformer • LLM/VLM Inference Optimization • 모델 정확도뿐 아니라 Latency, Throughput, Memory 및 연산량을 종합적으로 분석할 수 있으신 분 • 연구 방법론을 실제 추론 시스템 및 Hardware 환경에 구현할 수 있으신 분 • 독립적으로 문제를 정의하고 실험을 설계·수행할 수 있으신 분 • 해외 출장 및 여행에 결격 사유가 없는 분
우대사항
• NeurIPS, ICML, ICLR, ACL, EMNLP, NAACL, CVPR, ICCV, ECCV 등 Top-tier AI/ML 학술대회 논문 게재 경험이 있으신 분 • LLM/VLM 또는 MoE 모델 Quantization·Pruning 관련 논문, 특허 또는 Open Source 실적이 있으신 분 • GPTQ, AWQ, SmoothQuant, OmniQuant, AutoRound, SparseGPT 등 Model Compression 기술 구현 또는 확장 경험이 있으신 분 • TensorRT-LLM, vLLM, SGLang, DeepSpeed, Megatron-LM 등 대규모 모델 추론 시스템 개발 경험이 있으신 분 • CUDA 또는 Triton 기반 GPU Kernel Optimization 경험이 있으신 분 • 국내외 NPU, ASIC 또는 Edge AI Accelerator 대상 모델 Porting·Optimization 경험이 있으신 분 • NPU Vendor SDK, Compiler 또는 Runtime을 이용한 모델 변환 및 배포 경험이 있으신 분 • Custom Operator 또는 Custom Kernel 개발 경험이 있으신 분 • MoE 모델의 Expert Routing, Expert Load Balancing, Expert Parallelism 또는 통신 최적화 경험이 있으신 분
혜택 및 복지
[근무지] 서울특별시 강남구 테헤란로 521 (삼성동, 파르나스타워) 16층 Nota
이런 공고는 어때요?

폴라펄스
10년 이하 · 계약직 · 서울

퓨처릭스
20년 이하 · 정규직 · 경기

미리디
1년~3년 · 정규직 · 서울

플라잎
20년 이하 · 병역특례 · 울산

테라마임
3년 이하 · 정규직 · 서울

OURSYMBOL(아워심볼)
20년 이하 · 정규직 · 서울

플라잎
20년 이하 · 병역특례 · 경기

딥아이
20년 이하 · 정규직 · 부산

지엔에이컴퍼니
20년 이하 · 정규직 · 서울

데이터드리븐
1년~3년 · 정규직 · 서울

페이스웹
9년 이하 · 정규직 · 서울

텔어스
20년 이하 · 체험형인턴 · 서울

세카
20년 이하 · 정규직 · 서울

비바리퍼블리카
신입 · 병역특례 외 1개 · 기타

AMD
3년 이하 · 체험형인턴 · 해외

서울로보틱스
신입 · 병역특례 · 서울

보이저엑스
신입 · 체험형인턴 · 서울

고영테크놀러지
신입 · 병역특례 · 경기

AMD
3년 이하 · 체험형인턴 · 해외

AMD
3년 이하 · 체험형인턴 · 해외


