
[AX krewa] 리서치 엔지니어 (Lead)
공고 요약
담당업무
Trust System 기술 전략 및 아키텍처
공통 trace·event schema·판단 API·제어 지점 설계
Agent 오류 및 의도하지 않은 행동 탐지
환각·추론 오류·정책 위반·잘못된 도구 호출 원인 추적
실행 허용·중단·재시도·대체 경로·Human-in-the-loop 제어
failure taxonomy와 benchmark 데이터셋 구축
Grader·human evaluation·자동화 평가 파이프라인 설계
연구 아이디어의 프로덕션 시스템 구현
Agent Reliability·failure attribution·online auditing·anomaly detection·runtime control 연구
논문 작성·투고 및 특허·기술 보고서 작성
연구자·엔지니어의 실험·코드·아키텍처 리뷰
기술 로드맵과 우선순위 수립
자격요건
LLM 또는 Agent 시스템 연구 및 프로덕션 개발 경험
제품 문제의 연구 가설·실험 설계·평가 지표·시스템 구현 경험
LLM Workflow 설계·운영 및 실패 분석·개선 경험
AI 시스템 평가 체계 설계 및 검증 경험
Python과 ML Framework 기반 prototype·프로덕션 코드 작성 역량
성능·안정성·비용·개발 속도 간 trade-off 판단 역량
연구자·엔지니어의 기술 방향과 기준을 제시한 경험
재현 가능한 실험 설계 및 논문 수준 결과물 완결 경험
논문·설계 문서·기술 문서 작성 역량
우대사항
Agent 평가·reliability·safety·observability·runtime control 경험
복잡한 Agent Workflow 또는 Multi-Agent System 운영 경험
NeurIPS·ICML·ICLR·ACL·EMNLP 논문 투고·게재 경험
OCR·layout detection·table extraction·multimodal model 기반 문서 구조화 경험
Agent Memory의 검색·충돌 해소·버전 관리·provenance·lifecycle 설계 경험
prompt·retrieval·memory·workflow 개선 자동화 loop 구축 경험
고객사 문제를 공통 제품 기능으로 일반화한 경험
기술 성과의 특허 출원·등록 경험
컴퓨터공학·인공지능 관련 석·박사 또는 이에 준하는 연구개발 경험
복리후생
자율 출근제 오전 8시~11시
주 1회 재택근무
별도 식대 제공
간식 및 음료 제공
월간 팀 회식비 지원
경조사 지원
근속 연차별 포상
Claude 등 AI 도구 구독 지원
업무 관련 도서 지원
업무 유관 컨퍼런스 참가비 지원
근무환경
주 1회 재택근무 및 자율 출근제 운영
마감기한
상시채용
콕스웨이브 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요
공고 원문
소개
[AX Team, krewa] • krewa는 기업이 AI에게 중요한 업무를 위임할 수 있는 운영 기반을 만들어요. • AI 모델은 이미 문서를 읽고, 판단하고, 도구를 사용할 만큼 강력해졌어요. 하지만 기업 현장에서는 여전히 사람이 결과를 전부 다시 확인해요. 80%가 맞아도 어느 20%가 틀렸는지 모르면 결국 100%를 검토해야 하니까요. AI가 아직 '초안 도우미'에 머물러 있고 이 상태로는 중요한 업무를 AI에게 맡길 수 없어요. • krewa는 이걸 모델 성능이 아니라 실행 구조로 풀고 있어요. AI Worker가 업무를 수행하고, Trust System이 실행 전 과정을 검증해요. 위험이 감지되면 실행을 멈추고 사람의 판단을 받은 뒤 다시 이어가요. 그 판단은 다음 실행을 더 정확하고 안전하게 만드는 데 활용돼요. • 이를 통해 사람의 판단이 필요해 자동화하기 어려웠던 반복 업무까지 AI에게 위임할 수 있게 해요. 직원은 반복적인 처리와 검토에서 벗어나, 자신의 전문성이 더 필요한 일에 집중할 수 있어요. • AI가 업무를 돕는 시대에서, 업무를 맡는 시대로. krewa는 AI가 기업 운영의 한 축이 되는 미래를 만들고 있어요. [krewa 를 만들어온 여정] • AI를 평가하는 데서, 실행을 통제하는 데까지 -- AI가 내린 판단과 업무 수행 과정을 검증하는 일은 콕스웨이브가 2021년부터 풀어온 문제예요. -- AI Agent 성능 평가 솔루션을 운영하며 300개 이상의 글로벌 고객사에 품질 평가와 분석 기능을 제공했어요. -- 금융 고객사의 실제 업무 데이터를 월 수십만 건 규모로 분석하고 평가하고 있어요. -- 독자 파운데이션 모델의 지시 이행 성능을 평가하는 기준을 만들고, 평가 데이터의 품질을 검증했어요. -- 2025년부터 AI의 이상 행동을 탐지하는 기술을 개발하고 있어요. -- AI 실행 통제 관련 국가 표준화 작업에 참여하고 있어요. -- 행정안전부, 국가인공지능위원회 등 여러 기관에 AI Agent 통제 기술을 자문했어요. • 연구를 넘어, 제품과 시장에서 증명해 왔어요 -- 우리는 기술을 연구하는 데서 멈추지 않고, 실제 제품과 고객의 성과로 연결해 왔어요. -- 국내 최초의 생성형 AI 서비스 매각 사례를 만들었어요. -- 2023년부터 Microsoft의 Agent Orchestration 오픈소스 프로젝트에 코어 컨트리뷰터로 참여하고 있어요. -- Meta, PwC 등 글로벌 기업의 AX 프로젝트를 수행하고, 현대차를 비롯한 여러 기업에 AI Agent 연구와 개발을 자문했어요. -- NVIDIA, Anthropic, OpenAI 등 글로벌 기술 기업과 협업하고 파트너십을 구축했어요. -- Anthropic, OpenAI와 서밋과 해커톤을 공동 개최하며 국내 AI 생태계의 성장을 함께 만들어 왔어요. [지금 krewa 팀에 합류한다는 것] • krewa는 아이디어만 있는 단계도, 답이 모두 정해진 단계도 아니에요. 고객사와 실제 Agent 를 만들며 반복적으로 나타나는 문제를 발견하고, 그 해법을 표준 Krewa와 Trust System의 공통 기능으로 발전시키는 단계에 있어요. • Agent는 여러 단계에 걸쳐 판단하고 도구를 사용하기 때문에 최종 결과만 확인해서는 어디서 왜 실패했는지 알기 어려워요. 형식이나 정책을 위반할 수 있고, 근거 없이 판단하거나 잘못된 도구를 호출할 수도 있어요. 개별 판단은 맞더라도 전체 실행 흐름이 의도와 다르게 진행될 수도 있어요. • 우리는 이런 실패를 사후에 평가하는 데서 멈추지 않으려고 해요. Agent의 실행을 관찰하고, 위험을 탐지하고, 원인을 추적하고, 필요한 경우 실행을 중단하거나 사람의 판단을 요청할 수 있는 Trust System을 만들고 있어요. • Trust System은 특정 Agent Framework에 종속되지 않는 독립적인 시스템을 지향해요. krewa뿐 아니라 다른 Agent Workflow에도 연결할 수 있도록 공통 실행 정보와 판단 인터페이스를 설계해야 해요. 동시에 고객 현장의 구체적인 실패를 실제로 해결하면서, 어떤 기술이 제품에서 유효한지 증명해야 해요. [이런 분과 함께하고 싶어요] • 사람과 조직을 관리하는 데 집중하는 역할이 아니에요. 직접 논문을 읽고 연구 가설을 세우며, 실험 코드와 제품의 핵심 기능을 구현해요. 동시에 연구자와 엔지니어가 같은 문제와 기준을 보고 움직일 수 있도록 기술 방향을 제시하고 중요한 의사결정을 이끌어요. • 고객 환경에서 발견한 Agent의 실제 실패를 일반화 가능한 연구 문제로 정의하고, 재현 가능한 benchmark와 탐지·통제 기술로 발전시켜요. 검증된 결과는 Trust System와 Krewa에 적용하고 독창적인 성과는 탑티어 학회 논문과 특허로 남겨요. • 엔지니어들과 함께 연구와 제품 개발의 경계를 오가며 아이디어가 논문이나 PoC에 머물지 않고 실제 고객 환경에서 작동하도록 만들어요. [합류 후 기대하는 역할] • 고객사의 실제 Agent 기반 업무 수행에서 반복적으로 발생하는 실패 유형을 정의하고, Trust System의 기술 로드맵과 우선순위를 수립해요. • Agent의 실행 정보를 수집하고 위험을 탐지하며, 필요한 경우 실행을 중단하거나 사람의 승인을 요청할 수 있는 Trust System을 고도화해요. • 실제 제품 문제에서 연구 의제를 발굴하고, 재현 가능한 실험과 benchmark를 구축하여 탑티어 학회 투고로 연결해요. • 연구자와 엔지니어의 실험 및 설계를 리뷰하고, 연구 결과를 안정적인 프로덕션 시스템으로 연결하는 기술 기준을 만들어요.
주요업무
• Trust System 기술 전략 및 아키텍처 -- Agent의 어떤 실패를 우선 다룰지, 어떤 실행 정보와 신호로 판단할지, 언제 Trust System이 개입할지를 정의해요. -- krewa와 외부 Agent 서비스에 연결할 수 있는 공통 trace, event schema, 판단 API 및 제어 지점을 설계해요. -- 탐지 정확도뿐 아니라 오탐과 미탐, 응답 지연, 비용, 설명 가능성, 운영 안정성 사이의 기준과 trade-off를 결정해요. • Agent 오류 탐지 및 실행 통제 -- 규칙과 정책 기반 검증, LLM 기반 평가, ML 기반 이상 탐지 등을 조합하여 Agent의 오류와 의도하지 않은 행동을 탐지해요. -- 환각, 추론 오류, 정책 위반, 잘못된 도구 호출, 일관성 오류 등 주요 실패의 원인을 실행 단계별로 추적해요. -- 위험 수준과 근거에 따라 실행 허용, 중단, 재시도, 대체 경로 또는 Human-in-the-loop로 연결되는 제어 방식을 구현해요. • 평가 체계 및 개선 루프 -- Agent의 실패를 일관되게 분류할 수 있는 failure taxonomy와 benchmark 데이터셋을 구축해요. -- Grader, human evaluation 및 자동화된 평가 파이프라인을 설계하고 평가 결과의 신뢰도와 재현성을 검증해요. -- 실행 결과와 사람의 피드백을 prompt, retrieval, memory, workflow와 Trust System 개선으로 반복하는 체계를 만들어요. • Research-to-Production -- 연구 아이디어를 빠르게 구현하고 실험하여 실제 제품 문제에 유효한지 검증해요. -- 연구자 및 엔지니어와 함께 실험 코드를 테스트 가능하고 관찰 가능한 프로덕션 시스템으로 발전시켜요. -- 고객사별 구현에서 공통 원리와 재사용 가능한 기능을 찾아 표준 Krewa와 Trust System의 제품 자산으로 만들어요. • 논문 및 지식재산화 -- Agent Reliability, failure attribution, online auditing, anomaly detection, runtime control 등 제품과 연결되는 연구 문제를 발굴하고 연구 계획을 수립해요. -- 실험 설계와 분석, 논문 작성 및 투고를 주도하여 NeurIPS, ICML, ICLR, ACL, EMNLP 등 주요 학회 수준의 연구 성과를 만들어요. -- 업무 과정에서 발견한 독창적인 기술을 특허와 기술 보고서 등으로 남겨 팀의 장기적인 기술 자산으로 발전시켜요. • Hands-on 기술 리더십 -- 중요한 연구 및 시스템 설계에 직접 참여하고 핵심 기능을 구현해요. -- 연구자와 엔지니어의 실험 설계, 코드 및 아키텍처를 리뷰하고 기술적 의사결정을 이끌어요. -- 불확실한 문제를 구체적인 가설과 실행 계획으로 전환하고, 결과와 근거를 바탕으로 다음 우선순위를 정해요.
자격요건
• LLM 또는 Agent 시스템의 연구와 프로덕션 개발을 수행하고 중요한 기술적 의사결정을 주도해 본 경험이 있어요. • 모호한 제품 문제를 연구 가설, 실험 설계, 평가 지표와 구현 가능한 시스템으로 구체화해 본 경험이 있어요. • LLM Workflow를 직접 설계하고 실제 환경에서 운영하며 실패를 분석·개선해 본 경험이 있어요. • AI 시스템의 평가 체계를 설계하고 검증해 본 경험이 있어요. • Python과 ML Framework를 활용하여 연구용 prototype과 프로덕션 코드를 모두 작성할 수 있어요. • 성능, 안정성, 비용과 개발 속도 사이의 trade-off를 판단하고 시스템 설계에 반영할 수 있어요. • 여러 연구자와 엔지니어의 기술적 판단에 영향을 주고, 공통 방향과 기준을 만들어 본 경험이 있어요. • 새로운 연구 문제를 정의하고 재현 가능한 실험을 설계하여 논문 수준의 결과물로 완결해 본 경험이 있어요. • 복잡한 기술적 판단과 연구 결과를 논문, 설계 문서 및 기술 문서로 명확하게 설명할 수 있어요.
우대사항
• Agent 평가, reliability, safety, observability, runtime control을 연구하거나 제품에 적용해 본 경험이 있어요. • 복잡한 Agent Workflow 또는 Multi-Agent System을 프로덕션 환경에서 운영해 본 경험이 있어요. • NeurIPS, ICML, ICLR, ACL, EMNLP 등 주요 학회에 주저자 또는 핵심 기여자로 논문을 투고하거나 게재한 경험이 있어요. • 대규모 비정형 문서를 OCR, layout detection, table extraction, multimodal model 등을 활용해 구조화하고 품질을 평가해 본 경험이 있어요. • Agent Memory의 검색, 충돌 해소, 버전 관리, provenance 및 lifecycle을 설계하거나 운영해 본 경험이 있어요. • 평가 결과와 사용자 피드백을 prompt, retrieval, memory 또는 workflow 개선으로 연결하는 자동화된 loop를 구축해 본 경험이 있어요. • 고객사 프로젝트에서 발견한 문제와 해법을 여러 고객과 업무에 적용할 수 있는 공통 제품 기능으로 일반화해 본 경험이 있어요. • 자신의 기술적 성과를 특허로 출원하거나 등록해 본 경험이 있어요. • 컴퓨터공학, 인공지능 또는 관련 분야의 석·박사 학위를 보유했거나 그에 준하는 연구·개발 경험이 있어요.
혜택 및 복지
• 자율 출근제(오전 8시~11시) 및 재택 근무(주1회) 제도 운영 • 최신 업무 장비 제공 • 근로계약 외 별도 식대 소정 제공 • 간식 및 음료 제공 • 월간 팀 회식비 지원 • 경조사 지원 및 근속 연차별 포상 제도 운영 • Claude 등 AI 도구 구독 지원 • 업무 관련 도서 지원 • 업무 유관 컨퍼런스 참가비 지원