
[AX krewa] 리서치 엔지니어
공고 요약
담당업무
Agent 오류 탐지 및 벤치마크 구축
환각·추론 오류·도구 사용 실패 탐지 모델 연구
벤치마크 데이터셋 및 자동화 평가 파이프라인 구축
비용·추론 속도·정확도 최적화
프롬프트 엔지니어링 및 Agent 파이프라인 설계
연구용 PoC의 프로덕션 전환
코드 리팩토링 및 테스트 코드 작성
NeurIPS·ICLR 논문 투고 및 특허 출원
자격요건
Transformer 구조 및 LLM 동작 원리 이해
PyTorch·HuggingFace 등 Python 기반 ML 프레임워크 실무 활용
Multi-Agent 또는 ReAct 기반 에이전트 설계·제어 경험
LLM-as-a-Judge 평가 방법 적용 경험
최신 논문 구현 및 테스트 역량
문제 정의부터 프로젝트 완료까지 주도한 경험
논문·특허·기술 문서 작성 및 기술 커뮤니케이션
우대사항
컴퓨터공학·AI 관련 석사·박사 또는 이에 준하는 연구·개발 경험
대규모 벤치마크 데이터셋 구축 경험
에이전트 실패 사례 및 안전성 연구 경험
vLLM 기반 추론 환경 최적화 및 모델 경량화 경험
기술 성과의 특허 출원·등록 경험
보상과 복리후생
연봉 300~3500만원
주1회 재택근무
자율 출근제(오전 8시~11시)
식대 제공
오후 11시 이후 퇴근 시 택시비 지원
경조사 지원 및 근속 연차별 포상
Claude 등 AI 도구 구독 지원
업무 관련 도서 및 컨퍼런스 참가비 지원
근무환경
Trust & Honesty 기반의 투명한 피드백
직급·연차와 무관한 논리적 의사결정
업무 오너십과 높은 몰입 중시
마감기한
상시채용
콕스웨이브 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
소개
[AX Team, krewa] • krewa는 기업이 AI에게 중요한 업무를 위임할 수 있는 운영 기반을 만들어요. • AI 모델은 이미 문서를 읽고, 판단하고, 도구를 사용할 만큼 강력해졌어요. 하지만 기업 현장에서는 여전히 사람이 결과를 전부 다시 확인해요. 80%가 맞아도 어느 20%가 틀렸는지 모르면 결국 100%를 검토해야 하니까요. AI가 아직 '초안 도우미'에 머물러 있고 이 상태로는 중요한 업무를 AI에게 맡길 수 없어요. • krewa는 이걸 모델 성능이 아니라 실행 구조로 풀고 있어요. AI Worker가 업무를 수행하고, Trust System이 실행 전 과정을 검증해요. 위험이 감지되면 실행을 멈추고 사람의 판단을 받은 뒤 다시 이어가요. 그 판단은 다음 실행을 더 정확하고 안전하게 만드는 데 활용돼요. • 이를 통해 사람의 판단이 필요해 자동화하기 어려웠던 반복 업무까지 AI에게 위임할 수 있게 해요. 직원은 반복적인 처리와 검토에서 벗어나, 자신의 전문성이 더 필요한 일에 집중할 수 있어요. • AI가 업무를 돕는 시대에서, 업무를 맡는 시대로. krewa는 AI가 기업 운영의 한 축이 되는 미래를 만들고 있어요. [krewa 를 만들어온 여정] • AI를 평가하는 데서, 실행을 통제하는 데까지 -- AI가 내린 판단과 업무 수행 과정을 검증하는 일은 콕스웨이브가 2021년부터 풀어온 문제예요. -- AI Agent 성능 평가 솔루션을 운영하며 300개 이상의 글로벌 고객사에 품질 평가와 분석 기능을 제공했어요. -- 금융 고객사의 실제 업무 데이터를 월 수십만 건 규모로 분석하고 평가하고 있어요. -- 독자 파운데이션 모델의 지시 이행 성능을 평가하는 기준을 만들고, 평가 데이터의 품질을 검증했어요. -- 2025년부터 AI의 이상 행동을 탐지하는 기술을 개발하고 있어요. -- AI 실행 통제 관련 국가 표준화 작업에 참여하고 있어요. -- 행정안전부, 국가인공지능위원회 등 여러 기관에 AI Agent 통제 기술을 자문했어요. • 연구를 넘어, 제품과 시장에서 증명해 왔어요 -- 우리는 기술을 연구하는 데서 멈추지 않고, 실제 제품과 고객의 성과로 연결해 왔어요. -- 국내 최초의 생성형 AI 서비스 매각 사례를 만들었어요. -- 2023년부터 Microsoft의 Agent Orchestration 오픈소스 프로젝트에 코어 컨트리뷰터로 참여하고 있어요. -- Meta, PwC 등 글로벌 기업의 AX 프로젝트를 수행하고, 현대차를 비롯한 여러 기업에 AI Agent 연구와 개발을 자문했어요. -- NVIDIA, Anthropic, OpenAI 등 글로벌 기술 기업과 협업하고 파트너십을 구축했어요. -- Anthropic, OpenAI와 서밋과 해커톤을 공동 개최하며 국내 AI 생태계의 성장을 함께 만들어 왔어요. [지금 krewa 팀에 합류한다는 것] • krewa는 아이디어만 있는 단계도, 답이 모두 정해진 단계도 아니에요. 고객사와 실제 Agent 를 만들며 반복적으로 나타나는 문제를 발견하고, 그 해법을 표준 Krewa와 Trust System의 공통 기능으로 발전시키는 단계에 있어요. • Agent는 여러 단계에 걸쳐 판단하고 도구를 사용하기 때문에 최종 결과만 확인해서는 어디서 왜 실패했는지 알기 어려워요. 형식이나 정책을 위반할 수 있고, 근거 없이 판단하거나 잘못된 도구를 호출할 수도 있어요. 개별 판단은 맞더라도 전체 실행 흐름이 의도와 다르게 진행될 수도 있어요. • 우리는 이런 실패를 사후에 평가하는 데서 멈추지 않으려고 해요. Agent의 실행을 관찰하고, 위험을 탐지하고, 원인을 추적하고, 필요한 경우 실행을 중단하거나 사람의 판단을 요청할 수 있는 Trust System을 만들고 있어요. • Trust System은 특정 Agent Framework에 종속되지 않는 독립적인 시스템을 지향해요. krewa뿐 아니라 다른 Agent Workflow에도 연결할 수 있도록 공통 실행 정보와 판단 인터페이스를 설계해야 해요. 동시에 고객 현장의 구체적인 실패를 실제로 해결하면서, 어떤 기술이 제품에서 유효한지 증명해야 해요. [이런 분과 함께하고 싶어요] • 이 포지션은 Agent의 실패를 연구하고, 이를 실제로 탐지하고 통제할 수 있는 Trust System의 기능으로 구현하는 Research Engineer예요. • 논문을 읽고 실험하는 데서 끝나지 않아요. 고객 환경에서 발견한 실패를 데이터와 평가 문제로 구체화하고, 탐지 모델과 평가 파이프라인을 구현하며, 검증된 결과를 동료 연구자 및 엔지니어와 함께 실제 제품에 적용해요. 제품 개발 과정에서 얻은 결과는 다시 연구로 발전시켜 논문과 특허로 남겨요. • 경력 수준에 따라 명확하게 정의된 연구 또는 기능을 맡는 것부터, 하나의 연구·개발 과제를 독립적으로 이끌고 동료의 설계와 실험을 리뷰하는 것까지 역할 범위가 달라질 수 있어요. • 연차보다 실제로 해결해 본 문제와 성장 가능성을 중요하게 봐요. 모든 경험을 이미 갖춘 사람보다, 자신의 강점이 분명하고 부족한 부분을 동료와 함께 빠르게 학습하며 결과를 완성할 수 있는 사람을 찾아요. [합류 후 함께할 일] • 고객사의 실제 Agent Workflow에서 발생하는 실패 사례를 분석하고, 재현 가능한 데이터와 평가 문제로 만들어요. • Agent의 실행 정보를 수집하고 위험을 탐지하며, 필요한 경우 실행을 중단하거나 사람의 승인을 요청할 수 있는 Trust System을 함께 구축해요. • 특정 고객을 위해 만든 해법에서 공통 요소를 찾아 표준 Krewa에 적용할 수 있는 기능으로 발전시켜요. • 제품 문제에서 연구 질문을 발굴하고, 실험과 benchmark를 구축하여 탑티어 학회 논문과 특허에 기여해요. • 연구 결과가 실험에 머물지 않고 안정적인 프로덕션 시스템에서 작동하도록 연구자 및 엔지니어와 함께 구현하고 검증해요.
주요업무
• Trust System 기술 전략 및 아키텍처 -- Agent의 어떤 실패를 다룰지 함께 정의하고, 이를 판단하기 위해 필요한 실행 정보와 신호를 탐색해요. -- krewa와 외부 Agent Workflow에 연결되는 trace, event schema, 판단 API와 제어 기능을 설계하고 구현해요. -- 탐지 정확도뿐 아니라 오탐과 미탐, 응답 지연, 비용, 설명 가능성 및 운영 안정성을 실험하고 개선해요. • Agent 오류 탐지 및 실행 통제 -- 규칙과 정책 기반 검증, LLM 기반 평가, ML 기반 이상 탐지 등을 활용하여 Agent의 오류와 의도하지 않은 행동을 탐지해요. -- 환각, 추론 오류, 정책 위반, 잘못된 도구 호출, 일관성 오류 등 주요 실패의 원인을 실행 단계별로 분석해요. -- 위험 수준과 판단 근거에 따라 실행 허용, 중단, 재시도, 대체 경로 또는 Human-in-the-loop로 연결되는 기능을 구현해요. • 평가 체계 및 개선 루프 -- Agent의 실패를 일관되게 분류할 수 있는 failure taxonomy와 benchmark 데이터셋을 만들어요. -- Grader, human evaluation 및 자동화된 평가 파이프라인을 구현하고 평가 결과의 신뢰도와 재현성을 검증해요. -- 실행 결과와 사람의 피드백을 prompt, retrieval, memory, workflow와 Trust System 개선으로 연결해요. • Research-to-Production -- 최신 연구를 읽고 핵심 아이디어를 빠르게 구현하여 실제 제품 문제에 유효한지 실험해요. -- 실험 코드를 테스트 가능하고 관찰 가능한 프로덕션 코드로 발전시키고 실제 환경에서 운영 결과를 확인해요. -- 고객사별 구현에서 공통 원리와 재사용 가능한 기능을 찾아 표준 Krewa와 Trust System의 제품 자산으로 만들어요. • 논문 및 지식재산화 -- Agent Reliability, failure attribution, online auditing, anomaly detection, runtime control 등 제품과 연결되는 연구에 참여해요. -- 재현 가능한 실험을 설계하고 결과를 분석하며, 경력과 기여 범위에 따라 논문 작성 및 투고를 주도하거나 공동 저자로 참여해요. -- 업무 과정에서 발견한 독창적인 기술을 특허와 기술 보고서로 정리하는 데 기여해요.
자격요건
• Python을 사용하여 데이터 처리, ML 실험 또는 AI 기능을 구현할 수 있어요. • Transformer와 LLM의 기본적인 동작 원리를 이해하고, PyTorch, Hugging Face 등 ML Framework를 활용할 수 있어요. • ReAct, Tool-using Agent 또는 Multi-Agent System을 직접 설계하고 개발해 본 경험이 있어요. • 논문이나 기술 자료의 아이디어를 이해하고 실행 가능한 코드와 실험으로 옮길 수 있어요. • 가설, 평가 기준과 비교 대상을 세우고 실험 결과를 근거로 다음 행동을 결정할 수 있어요. • 자신이 작성한 코드를 테스트하고, 동료가 이해하고 재사용할 수 있는 형태로 개선하려고 노력해요. • 익숙하지 않은 문제를 만났을 때 필요한 내용을 학습하고 동료와 협업하여 끝까지 해결할 수 있어요. • 자신의 실험 과정과 기술적 판단을 문서와 말로 명확하게 설명할 수 있어요.
우대사항
• LLM 또는 Agent 기능을 연구하거나 실제 서비스에 적용해 본 경험이 있어요. • Benchmark, LLM-as-a-Judge, human evaluation 또는 online monitoring을 구현해 본 경험이 있어요. • Agent의 오류, reliability, safety, observability 또는 runtime control 문제를 다뤄 본 경험이 있어요. • 대규모 비정형 문서를 OCR, layout detection, table extraction 또는 multimodal model로 구조화하고, 출처 추적성과 품질 및 처리 비용을 함께 개선해 본 경험이 있어요. • Agent Memory의 검색, 충돌 해소, 버전 관리, provenance 및 lifecycle을 설계하거나 실험해 본 경험이 있어요. • 평가 결과와 사용자 피드백을 prompt, retrieval, memory 또는 workflow 개선으로 연결하는 자동화된 loop를 구축해 본 경험이 있어요. • NeurIPS, ICML, ICLR, ACL, EMNLP 등 주요 학회 논문에 참여하거나, 자신의 연구 결과를 논문 또는 기술 보고서로 완결해 본 경험이 있어요. • 자신의 기술적 성과를 특허로 출원하거나 등록해 본 경험이 있어요. • 컴퓨터공학, 인공지능 또는 관련 분야의 학위를 보유했거나 그에 준하는 연구·개발 경험이 있어요.
혜택 및 복지
• 자율 출근제(오전 8시~11시) 및 재택 근무(주1회) 제도 운영 • 최신 업무 장비 제공 • 근로계약 외 별도 식대 소정 제공 • 간식 및 음료 제공 • 월간 팀 회식비 지원 • 경조사 지원 및 근속 연차별 포상 제도 운영 • Claude 등 AI 도구 구독 지원 • 업무 관련 도서 지원 • 업무 유관 컨퍼런스 참가비 지원