인기 검색

AI Evaluation Engineer
공고 요약
담당업무
모델 및 비즈니스 목표를 검증 가능한 역량 항목, 평가 과제, 난이도 분포와 평가 기준으로 구체화
평가 과제, rubric, grader, verifier 및 Human Evaluation 프로세스 설계와 일관성·안정성·변별력 검증
모델 출력, 도구 호출 기록 및 Agent 궤적 분석을 통한 문제 원인 진단
실패 사례 기반 학습 데이터, 합성 데이터 및 평가 데이터 설계·개선
코드 실행, 테스트 결과, 도구 피드백, 환경 상태 또는 rubric을 활용한 평가·보상 신호 설계 및 검증
평가 데이터 오염, grader 취약점 및 reward hacking 가능성 발견·개선
대조 실험, 표본 검토 및 기초 통계 분석을 통한 개선 효과 검증
Python 기반 데이터 처리, 모델 호출, 배치 평가, 자동 검증 및 결과 분석과 실험 추적 가능성·재현성 관리
자격요건
LLM 평가, 학습 데이터, 합성 데이터 또는 모델 품질 분석 관련 실무·프로젝트 경험
Benchmark, rubric, LLM-as-a-Judge, grader, verifier 등 평가 방법 활용 경험
평가 방법이 측정하는 역량과 평가 결과의 신뢰성 검증 방법 설명 능력
모델 출력 또는 Agent 궤적에서 실패 유형을 도출하고 데이터·평가 개선안으로 연결하는 능력
Python을 활용한 데이터 처리, 모델 호출 및 실험 분석 수행 능력
실험 설계와 통계적 판단을 바탕으로 우연한 변동, 데이터 오염 및 채점 편향을 구분하는 능력
SFT, RLVR, rubric 기반 보상 및 Agent RL 등 포스트 트레이닝 방법 이해
명확한 문서 작성, 협업 및 독립적인 업무 추진 능력
우대사항
외국어 능통자 우대
우대 언어: 영어, 중국어
보상과 복리후생
지원자와 추천인에게 각 현금 50만원 합격보상
자기계발지원
마감기한
상시채용
Tiki Ai 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
소개
AI Evaluation Engineer는 LLM의 성능을 평가하고 실패 원인을 분석해, 다음 단계의 학습 데이터와 평가 체계를 설계하는 역할입니다. 모델의 역량 목표와 실제 비즈니스 시나리오를 바탕으로 평가 과제, 데이터 기준 및 채점 방식을 설계합니다. 모델 출력과 Agent 행동 궤적을 분석해 구체적인 역량 부족을 파악하고, 이를 학습 데이터와 평가 데이터의 개선으로 연결합니다. 평가와 데이터 개선이 실제 모델 성능 향상으로 이어졌는지도 실험을 통해 검증합니다. 이 포지션의 핵심은 강화학습 알고리즘 개발 자체보다 평가 체계 설계, 데이터 설계 및 실패 분석에 있습니다. SFT, RLVR, rubric 기반 보상 및 Agent RL의 기본 원리를 이해하고 학습 목표, 데이터, grader, verifier, 보상 신호와 모델 성능의 관계를 분석할 수 있는 분을 찾습니다. 경력 연차나 기존 직무명으로 지원자를 제한하지 않습니다. 과거 직함보다 직접 수행한 프로젝트, 실제 기여 범위, 판단 과정과 검증 방법을 중요하게 평가합니다.
주요업무
모델 및 비즈니스 목표를 검증 가능한 역량 항목, 평가 과제, 난이도 분포와 평가 기준으로 구체화합니다. 평가 과제, rubric, grader, verifier 및 Human Evaluation 프로세스를 설계하고 일관성, 안정성과 변별력을 검증합니다. 모델 출력, 도구 호출 기록 및 Agent 궤적을 분석해 문제의 원인이 모델, 데이터, 평가 과제, grader 또는 실행 환경 중 어디에 있는지 진단합니다. 실패 사례를 바탕으로 학습 데이터, 합성 데이터 및 평가 데이터를 설계하고 개선합니다. 코드 실행, 테스트 결과, 도구 피드백, 환경 상태 또는 rubric을 활용한 평가·보상 신호를 설계하고 검증합니다. 평가 데이터 오염, grader 취약점 및 reward hacking 가능성을 발견하고 개선합니다. 대조 실험, 표본 검토 및 기초 통계 분석을 통해 개선 효과가 실제로 유효한지 판단합니다. Python을 활용해 데이터 처리, 모델 호출, 배치 평가, 자동 검증 및 결과 분석을 수행하고 실험의 추적 가능성과 재현성을 관리합니다.
자격요건
LLM 평가, 학습 데이터, 합성 데이터 또는 모델 품질 분석과 관련된 실무·프로젝트 경험이 있는 분 Benchmark, rubric, LLM-as-a-Judge, grader, verifier 등 평가 방법을 활용해 본 분 평가 방법이 측정하는 역량과 평가 결과의 신뢰성을 검증하는 방법을 설명할 수 있는 분 모델 출력 또는 Agent 궤적에서 실패 유형을 도출하고 데이터나 평가 개선안으로 연결할 수 있는 분 Python으로 데이터 처리, 모델 호출 및 실험 분석을 독립적으로 수행할 수 있는 분 기본적인 실험 설계와 통계적 판단을 바탕으로 우연한 변동, 데이터 오염 및 채점 편향을 구분할 수 있는 분 SFT, RLVR, rubric 기반 보상 및 Agent RL 등 주요 포스트 트레이닝 방법을 이해하는 분 명확한 문서 작성과 협업 능력, 독립적인 업무 추진 능력을 갖춘 분 4년제 대학 학사 이상인 분 — 전공 무관
우대사항
아래 경험을 모두 갖출 필요는 없습니다. 하나 이상의 경험이 있다면 우대합니다. RLVR, rubric 기반 강화학습, Agent RL 또는 기타 포스트 트레이닝 실험 경험 코드 테스트, 실행 결과, 도구 피드백 또는 환경 상태를 활용한 verifiable reward 설계 경험 SFT, 선호도 최적화, RLHF/RLAIF 또는 reward model 관련 경험 Coding, Agent, 멀티모달 또는 전문 도메인의 데이터 구축·평가 경험 평가 데이터 오염, grader 취약점 또는 reward hacking 문제를 발견하고 해결한 경험 재현 가능한 오픈소스 코드, 데이터셋, benchmark 또는 실험 보고서를 공개한 경험
혜택 및 복지
GPT, Claude, Gemini 등 주요 AI 모델을 활용할 수 있는 실험 환경 모델 평가와 데이터 개선을 위한 컴퓨팅 자원 지원 평가 과제, 데이터 기준 및 개선 방향을 직접 제안할 수 있는 업무 환경 유연 근무제 실행 업계 최고 수준의 장비, 교육비 제공 경쟁력 있는 보상과 회사 성장 공유
댓글
Tiki Ai에 맞는
이력서로 자동 수정하기