인기 검색

AI개발자 - 음성 관련 채용
공고 원문
소개
음성 대화 에이전트 엔지니어, 어떤 일을 하나요? 🎙 사람과 AI를 구분할 수 없는 목소리, 그 밑단을 직접 만들어갈 동료를 찾습니다! 안녕하세요! 저희는 텍스트로 바꾸지 않고 음성을 음성 그대로 처리하는 4세대 AI 음성 에이전트 MIRVO를 만들고 있어요. "상담원 연결"만 외치게 되는 콜봇 대신, 실제 전화망(SIP/텔레포니) 위에서 100~300ms 초저지연으로 자연스럽게 대화하는 엔진을 함께 개발할 분을 찾습니다. 📞 텔레포니·음성 파이프라인 SIP·Asterisk로 실제 전화망과 연동하고, VAD로 음성을 실시간 분할해 대화의 흐름을 끊김 없이 이어가요 🗣 STT/TTS 엔진 음성을 텍스트로, 다시 자연스러운 음성으로 — 화자 일관성과 prosody(억양·리듬)까지 살리는 음성 합성을 다뤄요 🧠 LLM 파인튜닝 & 서빙 LoRA로 우리 데이터에 맞게 파인튜닝하고, vLLM·SGLang·llama.cpp로 실서비스에 올려 커스터마이징해요 🔧 대화형 백엔드 & RAG Python으로 툴 호출 백엔드를 구성하고, RAG로 고객사 데이터를 실시간 대화에 연결해요 이런 밑단부터 실제 통화 품질까지 책임지고 싶은 분을 찾고 있어요. 논문 속 데모가 아니라, 초저지연·턴테이킹·바지인까지 실제 전화 통화에서 살아남는 엔진을 만들고 싶다면, 저희와 함께 다음 18년을 만들어가지 않을래요?
담당업무
SIP·Asterisk 기반 텔레포니 연동 및 실시간 음성 파이프라인 구축 VAD 기반 실시간 음성 분할 및 스트리밍 처리 시스템 개발 STT/TTS 모델 적용 및 음성 합성 품질(화자 일관성, prosody, intelligibility) 개선 LLM LoRA 파인튜닝 및 vLLM·SGLang·llama.cpp를 활용한 모델 서빙·커스터마이징 Python 기반 툴 호출 백엔드 구성 및 RAG 파이프라인 구축 ITN(역텍스트정규화) 등 대화 정확도 개선 로직 개발
자격요건
실시간 음성 분할(VAD) 처리 경험 SIP 연동 및 Asterisk 운영 경험 STT/TTS 모델 개발 또는 적용 경험 LLM LoRA 파인튜닝 경험 LLM 서빙 및 커스터마이징 경험 (vLLM, SGLang, llama.cpp 중 1개 이상) 음성 합성 데이터 처리 경험 (화자 일관성, prosody, intelligibility 등) ITN 처리 경험 Python 기반 백엔드(툴 호출 구성) 개발 경험 RAG 구축 경험
우대사항
스트리밍 STT/TTS 및 종단 레이턴시 최적화 경험 턴테이킹 / 엔드포인팅 / 바지인(barge-in) 처리 경험 텔레포니 오디오 처리 경험 (8kHz, G.711 μ-law/a-law, Opus, 샘플레이트 변환, AEC·노이즈 억제) 다이얼로그 상태관리 경험 화자 분리(diarization), 구두점 복원 경험
혜택 및 복지
유연근무제 — 본사 근무 시 자율적으로 선택해서, 본인 신체 리듬에 맞춰 출퇴근할 수 있어요. 쾌적한 근무환경 — 층고 4m 개방감 있는 올화이트 인테리어(실평수 120평)와 카페테리아를 갖추고 있어요. 회식 강요 없음 — 음주 위주 회식 대신, 팀 단위 자발적 회식을 지원해요. 수평적 소통문화 — 영어 닉네임 호칭을 쓰고, 리더들이 집단지성으로 함께 의사결정해요. 성과 보여주기식 문화 없음 — 보고를 위한 회의 대신, 문제 해결을 위한 수시 회의에 집중해요. 안정적인 도전 — 18년 연속 흑자, 외부투자 없는 자력 성장 기업이라 조급함 없이 마음껏 실험할 수 있어요.
기술스택
Python, 인공지능(AI), RAG, LLM
기타
한 번 거쳐 가는 회사가 아니라, 평생 일하고 싶은 회사. 18년간 함께 빛나 온 사람들이 그 증거입니다. 이제 당신과 함께 다음 18년을 만들어가고 싶습니다.
에스알포스트 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요