인기 검색

[R&D] AI Research Engineer, Speech, STT, TTS
공고 원문
소개
휴멜로는 "목소리의 미래"를 만드는 음성 AI 기업입니다. 음성 합성(TTS), 음성 변환(Voice Conversion), 음성 분석 등 음성 기술의 핵심 영역을 연구·제품화하고 있으며, 자체 개발·운영하는 TTS 엔진 DIVE를 중심으로 B2B·B2C 제품을 전개하고 있습니다. DIVE는 짧은 레퍼런스 음성만으로 화자의 목소리를 복제하고, 48kHz 스튜디오급 음질을 실시간 스트리밍으로 합성하는 휴멜로의 자체 TTS 엔진입니다. 단발 발화 합성에서는 이미 프로덕션 검증을 마친 단계이며, 현재는 멀티턴 대화 환경에서도 맥락을 읽고 자연스럽게 말하는 Conversational TTS로 확장하는 연구를 진행하고 있습니다. 휴멜로는 2018년 창립 이후 꾸준한 연구개발을 통해 voice cloning, zero-shot TTS, prosody control, streaming synthesis 등 음성 AI 기술을 제품으로 연결해 왔습니다. KT의 AI Voice Studio / 마이 AI 보이스, SM엔터테인먼트 AI 아티스트 나이비스(nævis), 스마일게이트 협업, 밀리의서재 오디오북 등 다양한 실제 서비스 환경에서 기술을 검증해 왔고, 현재는 개발자용 음성 AI API·SaaS와 B2C 오디오 스토리 제품까지 검증 루프를 넓혀 가고 있습니다. B2B 축에서는 개발자용 TTS API·SaaS인 Prosody Console과 상담·콜센터용 온프레미스 AICC 솔루션 TiVA를 개발하고 있습니다. Prosody Console은 DIVE의 합성 파이프라인을 외부 서비스에 내장하는 진입점이며, 고객사의 실제 트래픽을 통해 TTFB·RTF·사용량·피드백 지표를 수집합니다. TiVA는 AICC·IVR·콜센터 시나리오를 겨냥한 차세대 대화형 음성 AI 솔루션입니다. B2C 축에서는 AI 캐릭터와 음성으로 대화하는 인터랙티브 오디오 스토리 서비스 Tikita를 웹·iOS·Android로 운영하고 있습니다. Tikita는 실제 사용자의 멀티턴 대화 데이터와 음성 사용 지표를 확인할 수 있는 제품이며, DIVE의 다음 연구 주제를 발견하고 검증하는 실사용 환경입니다. 휴멜로의 연구는 논문에서 끝나지 않습니다. 모델 구조, 데이터, 평가 방법을 설계하고, 그 결과를 Prosody Console·Tikita에 배포해 실제 사용자의 피드백과 지표로 검증합니다. 연구 성과는 1저자 논문 투고와 특허 출원까지 이어지는 것을 목표로 합니다. 주요 고객사·파트너 KT · LG전자 · LG U+ · LG CNS · 삼성SDS · SM엔터테인먼트 · 스마일게이트 · 카카오페이 · KBS · MBC 보이저엑스(Vrew) · 이스트소프트(Perso) · 팀벨(AICC 파트너) · 밀리의서재 · 딥브레인AI · 셀렉트스타 · 비디오스튜 주요 성과 및 인정 * 2026 딥테크 TIPS 선정 * 2025 글로벌 K-FAST 얼라이언스 선정 * 2024 Post-TIPS 선정 * 2023 KOREA AI STARTUP TOP100 선정 * 2022 KT Partner Award 대상 * 2022 KT DIGICO 공모전 선정 주요 투자사 FuturePlay · KT인베스트먼트 · 카카오인베스트먼트 · KDB캐피탈 관련 보도 * [Let's 스타트업] 휴멜로, 대화 맥락·감정까지 살린 보이스 AI로 승부 (매일경제, 2026) * "맥락 파악해 목소리 톤·템포 조율…보이스 AI 시대 열겠다" (매일경제, 2025) * 휴멜로, TTS 음질 '48kHz 스튜디오'급으로 업샘플링하는 기술 공개 (바이라인네트워크, 2025) * AI 기업 휴멜로, LLM 아닌 '니치'에서 길 찾았다…보이스에 집중해 자체 파운데이션 모델 (테크M, 2025) * [쫌아는기자들] 감정을 표현하고 노래도 하는 음성합성 엔진, 휴멜로 (조선일보, 2021)
주요업무
DIVE의 차세대 대화형 TTS를 함께 설계·구현합니다. 멀티턴 대화 환경에서도 자연스럽게 동작하는 TTS로 확장하는 것이 다음 단계 목표이며, 이 과정에서 아키텍처·평가·데이터 전반의 의사결정에 주도적으로 참여합니다. DIVE는 화자·운율·언어를 분리된 조건으로 다루는 모듈화 구조를 지향합니다. Kyutai Moshi, NVIDIA PersonaPlex 같은 full-duplex 계열과 Qwen-Omni, Step-Audio, MiniCPM-o 같은 S2S·omni-modal 계열은 대화 맥락 인지에서 강점을 보이지만, 일체형 end-to-end 구조에서는 화자·운율·감정 제어가 어려운 경우가 많습니다. 휴멜로는 DIVE가 가진 세밀한 제어 가능성을 유지하면서, 멀티턴 맥락 인지와 full-duplex·barge-in·turn-taking 같은 대화 상호작용까지 안정적으로 확보하는 방향을 탐색합니다. 또한 자체 Bandwidth Extension(BWE) 모델을 고도화합니다. DIVE는 임의 샘플레이트 음성을 48kHz 스튜디오급으로 복원하는 자체 BWE 모델을 보유하고 있으며, 현재 모델은 내부 벤치마크 기준 실시간 처리 요건을 충분히 만족하는 속도를 확보했습니다. 이번 과제에서는 이를 실시간 대화 스트리밍 흐름에 더 자연스럽게 결합되도록 점진 처리에 최적화된 구조로 재설계하고, 복원 품질을 한 단계 더 끌어올립니다. 연구 문제 1. 맥락 인지와 제어 가능성의 양립 * 멀티턴 대화 맥락을 반영하면서도 화자·운율·감정·언어 조건을 외부에서 제어할 수 있는 TTS 구조 * end-to-end S2S 모델의 맥락 인지 강점과 cascaded/modular TTS의 제어 가능성을 함께 가져가는 아키텍처 * 48kHz 스튜디오급 음질과 내부 벤치마크 기준 TTFB 300ms 이하의 실시간 스트리밍 수준 유지 2. 대화 상호작용을 위한 스트리밍 구조 * full-duplex, barge-in, turn-taking 환경에서 안정적으로 동작하는 TTS 디코딩 흐름 * VAD, turn-taking policy, streaming scheduler, tokenizer, vocoder가 함께 맞물리는 저지연 음성 대화 파이프라인 * Prosody Console·Tikita 실사용 트래픽 기반의 latency, quality, user feedback 검증 3. 자체 BWE 모델의 고도화와 스트리밍화 * 임의 샘플레이트 음성을 48kHz 스튜디오급으로 복원하는 자체 Bandwidth Extension 모델 개선 * 배치 모델 수준의 복원 품질과 실시간 대화 스트리밍에 적합한 점진 처리 구조의 양립 * BWE 품질 지표와 실제 제품 청취 품질 사이의 평가 루프 설계 구체 업무 * 멀티턴 맥락을 조건으로 입력받는 TTS 아키텍처 설계·구현 * Full-duplex·barge-in·turn-taking 안정성을 위한 스트리밍 디코딩, 음성 토크나이저·보코더, VAD/turn-taking policy, latency scheduling 구조 개선 * 자체 BWE 모델의 복원 품질 고도화와 스트리밍 흐름에 맞춘 구조 재설계 * Prosody Console·Tikita 트래픽 데이터와 자체 코퍼스를 활용한 학습·검증 파이프라인 설계 * 연구 결과를 Prosody Console·Tikita에 A/B 배포하고 TTFB·RTF·사용량·피드백 지표로 검증 * 연구 성과의 1저자 논문 투고 및 핵심 기법의 특허 출원
자격요건
* 음성합성(TTS)·음성인식(ASR)·대화 시스템·LLM 중 하나 이상에서 석사 이상 또는 박사과정 수준의 연구 경험 * 석사 학위자 기준 관련 연구·개발 경력 3년 내외 이상 * 박사 학위 소지자 또는 박사 졸업 예정자 연차 유연 검토 * PyTorch 등 딥러닝 프레임워크로 모델을 직접 설계·학습·추론해 본 경험 * 수백~수천 시간 규모의 음성 데이터를 학습에 활용해 본 경험, 또는 그에 준하는 데이터 정제·증강·평가 파이프라인 경험 * 딥러닝과 음성 신호처리의 기초 이해(STFT, mel-spectrogram, F0, prosody) * 영어 논문을 독해·재현할 수 있는 역량과 1저자 논문 작성 의지
우대사항
핵심 연구 역량 * Full-duplex / conversational / streaming TTS 중 한 축 이상의 연구·구현 경험(barge-in, turn-taking 포함) * LLM 기반 TTS 모델 이해·구현 경험(VALL-E, NaturalSpeech, XTTS, Bark, Spark-TTS, CosyVoice, F5-TTS 계열) * Discrete audio codec / neural vocoder 구현 경험(HiFi-GAN, BigVGAN, Vocos, SoundStream, Encodec 등) * Voice cloning, speaker adaptation, emotional·prosodic TTS 관련 경험 * Top-tier 1저자 논문 실적(Interspeech, ICASSP, TASLP, NeurIPS, ICML, ICLR, ACL, EMNLP 등) 제품화·최적화 역량 * 추론 최적화 경험(양자화 GGUF·GPTQ·AWQ·INT8, torch.compile, vLLM, llama.cpp 등) * 대규모 음성 데이터셋 정제·필터링·평가 자동화 경험 * 오픈소스 기여 이력(PyTorch, HuggingFace, ESPnet 등) * 관련 기술 특허 발명자 이력 도메인 이해 * 한국어 음운론 실무 경험(자·모음 체계, 분절음·초분절음, 운율) * AICC·IVR·콜센터 도메인 이해 * B2C 음성 대화 제품 또는 캐릭터 음성 제품 경험
혜택 및 복지
연구 인프라 * A100 기반 자체 학습 클러스터 — 추론 서버와 분리된 실험·학습 환경 * 10만 시간 규모의 자체 다국어 학습 코퍼스 접근 권한 — 한국어 중심, 자체 수집 + 라이선스 + 공공데이터 * Prosody Console·Tikita 실사용 트래픽 기반 A/B 배포 경로 — 연구 결과의 실제 서비스 환경 검증 * 실시간 TTFB·RTF·사용량·사용자 피드백 수집 데이터베이스 * NVIDIA GPU 클러스터와 x86/ARM(Apple Silicon) CPU 다중 아키텍처 벤치마크 환경 * 국내외 학회 참가비·출장비 전액 지원 — 1저자 논문 투고·발표 전 과정 지원 * 사내 리뷰·콜로키움 세션 — 논문 작성 전 피드백 및 공동 저자 협업 지원 제품 검증 환경 * Prosody Console — 개발자용 음성 AI API·SaaS와 고객사 프로덕션 트래픽 * Tikita — AI 캐릭터와 음성으로 대화하는 B2C 인터랙티브 오디오 스토리 서비스 * TiVA — 상담·콜센터 시나리오를 겨냥한 온프레미스 AICC 솔루션 * 연구 결과를 실제 제품에 빠르게 이식하고 지표로 검증하는 B2B·B2C 듀얼 루프 근무 환경 * 전문연구요원 편입 가능 * 시차출퇴근제 — 출근 7:00-11:00, 회의·협업 시간 11:00-16:00 중심 * 주 1회 재택근무 * 과학기술인공제회 퇴직연금 가입 * 4대 보험 * 경조사비, 설·추석 상여금 * MacBook Pro, 듀얼 모니터, GPU·연구 장비 지원 * Claude Code·Codex·Cursor 등 AI 개발 도구 사내 라이선스 * 강남역 4번 출구 도보 3분 근무지
휴멜로 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요