인기 검색

[기술혁신실] AI Software Engineer(VLM-Eval)
공고 요약
담당업무
실제 운동·재활 영상을 기반으로 한 VideoLLM 평가 데이터셋 및 벤치마크 구축
의학팀·데이터 매니저와 정답, 채점 기준, Annotation 가이드라인 설계
평가자 간 일치도 관리 및 평가 데이터 구조화
LLM/MLLM-as-a-Judge 기반 자동 채점 파이프라인 설계·구현
사람의 평가와 대조한 Judge 신뢰성 검증 및 위치 편향·자기 편향 완화
학습 체크포인트별 자동 평가 하네스 구축 및 학습·배포 파이프라인 연동
FlowEx 평가 보드 연동, 평가 결과 자동 축적·비교 및 성능 회귀 탐지
정확성·안전성·일관성·환각·응답 지연 등 평가축 정량화
실패 사례 수집·유형화 및 평가셋 반영을 통한 개선 루프 구축
평가 결과 이상 발생 시 모델 변화와 파이프라인 문제 원인 규명
의학팀과 임상적 타당성 검증 프로토콜 설계
ISO/IEC 42001 수준의 재현 가능성과 감사 추적성 보장
AI Research Engineer, MLOps Engineer, 의학팀, 제품팀, RA/QA와 협업
자격요건
Python 기반 실험·평가 파이프라인 설계 및 구현 역량
LLM 또는 Multimodal LLM 동작과 실패 양상에 대한 이해
모호한 품질 문제를 측정 가능한 지표로 정량화한 경험
진행 상황 공유 및 문서 기반 커뮤니케이션 역량
우대사항
외국어 능통자
영어 활용 역량
복리후생
자기계발 지원
근무환경
유연근무
리프레시 휴가
마감기한
상시채용
에버엑스 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
소개
[합류하게 될 팀에 대해 알려드려요] "Bringing Personalized Rehabilitation to Everyone"이라는 Mission 아래, EverEx는 디지털 헬스케어 기술로 재활 치료의 패러다임을 바꾸고 있어요. 기술혁신실 AI팀은 Human Pose Estimation 기술로 사용자의 움직임을 정확하게 분석해왔고, 이제 실제 운동/재활 전문가처럼 자세와 동작을 이해하고 실시간으로 피드백하는 자체 VideoLLM을 만드는 일에 도전해요. 그런데, 이런 모델은 만드는 것만큼이나 "제대로 하고 있는지 증명하는 것"이 어려워요. Pose Estimation은 예측한 관절 좌표를 정답과 비교하면 됐지만, VideoLLM이 내놓는 피드백은 정답이 하나가 아니에요. 게다가 우리 서비스에서 잘못된 피드백은 단순한 오답이 아니라 사용자의 부상이나 재활 지연으로 이어질 수 있어요. 그래서, 우리는 모델 개발과 나란히, "이 모델을 사용자에게 내보내도 되는가"에 근거를 가지고 답할 수 있는 검증 체계를 만들 동료를 찾고 있어요. 무엇이 좋은 피드백인지를 측정 가능한 기준으로 옮기고, 재현 가능한 평가 파이프라인을 만들고, 모델이 바뀔 때마다 무엇이 좋아지고 무엇이 나빠졌는지 자동으로 드러나게 만드는 일이에요. 평가 데이터셋도, 벤치마크도, 파이프라인도 처음부터 함께 만들어나가는 과정에 합류하여 기여할 수 있어요.
주요업무
• VideoLLM 평가 데이터셋과 벤치마크를 직접 만들어요. 실제 운동·재활 영상을 기반으로 "이 상황에서 전문가라면 어떤 피드백을 줄 것인가"를 정의하고, 이를 평가 가능한 형태로 구조화해요. 의학팀, 데이터 매니저와 함께 정답과 채점 기준(rubric)을 설계하고, Annotation 가이드라인을 작성하고, 평가자 간 일치도를 관리하는 일까지 포함돼요. • 자동 채점 파이프라인을 설계하고 구현해요. 규칙 기반 지표만으로는 자연어 피드백의 품질을 담을 수 없어요. LLM/MLLM-as-a-Judge를 도입하고, judge 자체가 신뢰할 만한지를 사람의 평가와 대조해 검증하고, 위치 편향, 자기 편향 같은 알려진 문제를 완화하는 것까지가 이 업무의 범위예요. • 학습 체크포인트마다 자동으로 돌아가는 평가 하네스를 만들어요. 모델이 바뀔 때마다 사람이 수동으로 돌려보는 구조가 아니라, 학습·배포 파이프라인에 상시 물려 있는 평가 시스템을 만들어요. 사내 모델 라이프사이클 플랫폼(FlowEx)의 평가 보드와 연동해 결과가 자동으로 축적되고 비교되도록 하고, 성능 회귀가 발생하면 놓치지 않고 드러나게 만들어요. • 정확도 외의 평가축을 구현해요. 답변의 정확성뿐 아니라 안전성(위험한 동작 지시 여부), 일관성, 환각(hallucination), 응답 지연까지, 헬스케어 서비스에 요구되는 여러 관점을 각각 정량화해요. 특히 실시간 피드백이 목표인 만큼, 서비스 환경의 지연 조건 아래에서의 품질을 측정하는 것도 중요한 과제예요. • 실패 사례를 분석하고 개선 루프로 되돌려요. 평가에서 드러난 실패 사례를 수집 및 유형화(categorize)해서 연구자에게 전달하고, 그 사례를 다시 평가셋에 반영해 평가 체계 자체를 계속 강화해요. 평가 결과가 이상할 때, 모델의 변화 때문인지 파이프라인 문제인지 규명하는 것도 이 역할의 몫이에요. • 의학팀과 함께 임상적 타당성 검증 체계를 만들어요. 기술적 지표를 넘어, 모델의 피드백이 임상적으로 타당한지를 어떻게 확인할 것인지 검증 프로토콜을 함께 설계해요. ISO/IEC 42001이 요구하는 재현 가능성과 감사 추적성을 평가 과정에서도 시스템 수준으로 보장해요. • 다양한 직군과 협업해요. AI Research Engineer(모델 개발), MLOps Engineer(파이프라인·인프라), 의학팀, 제품팀, RA/QA와 긴밀히 협업해요. 특히 AI Research Engineer와는 "무엇이 좋은 피드백인가"를 함께 정의하고, 그것을 측정 가능한 시스템으로 옮기는 역할을 맡아요.
자격요건
• Python으로 실험·평가 파이프라인을 직접 설계하고 구현할 수 있는 분이면 좋아요. 이 역할은 분석 리포트를 쓰는 일이 아니라, 돌아가는 시스템을 만드는 일이에요. • LLM 또는 Multimodal LLM을 다뤄본 경험이 있는 분이면 좋아요. 직접 학습시켜본 경험까지는 아니더라도, 모델이 어떻게 동작하고 어떤 방식으로 실패하는지를 이해하고 계셔야 해요. • 관련 분야 경력 3년 이상, 또는 그에 준하는 실력을 프로젝트로 입증할 수 있는 분을 찾고 있어요. 우리에게 중요한 건 연차가 아니라 경험이에요. • 모호한 품질 문제를 측정 가능한 지표로 바꿔본 경험이 있는 분이면 좋아요. "왠지 답변이 별로다"를 "무엇이 얼마나 나쁜지"로 옮기는 일이 이 직무의 핵심이에요. 꼭 LLM이 아니어도, 정답이 명확하지 않은 문제를 정량화해본 경험이면 충분해요. • 진행 상황을 유기적으로 공유하고, 문서를 통해 소통하는 것에 익숙하신 분이면 좋아요. 규제 산업에서는 "무엇을 어떻게 검증했는지"의 기록 자체가 결과물이에요.
우대사항
• LLM/VLM 평가 벤치마크나 평가셋을 직접 설계·구축해본 경험이 있으면 더 좋아요. • LLM-as-a-Judge 기반 자동 평가를 구축하고, judge의 신뢰도를 사람 평가와 비교 검증해본 경험이 있으면 더 좋아요. • lm-evaluation-harness, DeepEval, Ragas, W&B, Langfuse 등 평가·관측 도구를 활용해본 경험이 있으면 더 좋아요. 도구는 무관해요. • Video understanding(action recognition, temporal grounding 등) 또는 영상 데이터 처리 경험이 있으면 더 좋아요. • 사람 평가(human evaluation)를 설계하고, Annotation 가이드라인 작성이나 평가자 간 일치도(IAA) 관리를 해본 경험이 있으면 더 좋아요. • vLLM 등 추론 서빙 환경에서 대규모 배치 추론·평가를 수행해본 경험이 있으면 더 좋아요. • A/B 테스트, 통계적 유의성 검정 등을 활용해 모델 변경의 효과를 판단해본 경험이 있으면 더 좋아요. • 의료·헬스케어·피트니스 도메인 데이터를 다뤄본 경험, 또는 규제 환경(ISO/IEC 42001, SaMD 등)에서 검증 문서를 작성해본 경험이 있으면 더 좋아요. • 스스로 문제를 정의하고 이를 해결하기 위해 다양한 시도를 한 경험이 있으면 더 좋아요. 문제를 해결하지 못했더라도 괜찮아요!
혜택 및 복지
• 유연한 시차출퇴근제로 각자의 리듬에 맞게 근무해요 • 업무에 몰입할 수 있도록 장비와 소프트웨어를 아낌없이 지원해요 • 성장에 필요한 도서·강의 등 교육비를 적극 지원해요 • 눈치 보지 않고 쓰는 자유로운 연차 사용 • 3년 이상 근속 시 리프레시 휴가로 재충전의 시간을 드려요 • 팀워크를 위한 본부별 회식비 지원 • 생일에는 조기 퇴근 + 작은 선물로 축하해요 • 명절 선물로 감사의 마음을 전해요 • 관심사 기반 소모임 활동비도 지원 해요 • 야간 근무 시 안전한 귀가를 위한 택시비를 지원해요 • 새로운 출발을 응원하는 결혼 축하금 지급해요
댓글
에버엑스에 맞는
이력서로 자동 수정하기