
AI 음성이 빠르게 달라지고 있습니다. 이제는 단순히 글자를 자연스럽게 읽는 수준을 넘어, 사용자가 어떤 말투로 이야기했는지와 대화 분위기까지 반영해 다음 음성을 만들어내는 방향으로 발전하고 있습니다. 인월드 AI가 공개한 Realtime TTS-2도 바로 이 지점을 겨냥한 모델입니다. 다만 기사 제목처럼 “아티피셜 애널리시스 1위”라고만 보면 오해할 수 있습니다. 실제로는 특정 조건의 음성 품질 평가에서는 1위지만, 다른 평가에서는 2위입니다.
실시간 TTS-2, 무엇이 가장 달라졌나
인월드 AI 공식 설명에 따르면 Realtime TTS-2의 핵심은 이전 대화의 실제 오디오를 입력으로 활용한다는 점입니다. 단순히 “무슨 말을 했는가”만 보는 것이 아니라 사용자의 말투, 속도, 감정 상태 같은 음성적 특징을 다음 응답에 반영합니다.
예를 들어 똑같은 “다음에는 뭘 할까요?”라는 문장이라도 직전에 웃으며 대화했는지, 좋지 않은 소식을 들었는지에 따라 음높이와 속도, 표현 방식을 다르게 만들 수 있다는 설명입니다.
이전 TTS가 대부분 “텍스트 입력 → 음성 출력” 구조였다면, TTS-2는 “대화 맥락 → 감정 상태 → 음성 연출”까지 포함하는 방향으로 확장된 셈입니다.
자연어로 감정을 지시할 수 있다는 점도 핵심
개발자가 음성 스타일을 조절하는 방식도 달라졌습니다.
기존 음성 모델에서는 ‘happy’, ‘sad’, ‘angry’ 같은 미리 정해진 감정 옵션을 선택하는 경우가 많았습니다. 반면 TTS-2는 [speak sadly, as if something bad just happened]처럼 자연어 문장으로 구체적인 연출을 지시할 수 있습니다.
또 [laugh], [sigh], [breathe], [clear_throat], [cough] 같은 태그를 문장 중간에 넣으면 실제 웃음, 한숨, 호흡 같은 비언어적 표현을 음성으로 생성할 수 있습니다.
이 기능은 게임 캐릭터, AI 상담원, 언어 학습 서비스처럼 감정 전달이 중요한 서비스에서 특히 유용할 가능성이 큽니다.
“200개 이상 언어 지원”은 어디까지 사실일까
이 부분은 공식 자료에서도 표현이 조금씩 달라 주의해서 볼 필요가 있습니다.
출시 당시 인월드 공식 블로그에는 동일한 음성 정체성을 100개 이상의 언어에서 유지할 수 있다고 적혀 있습니다.
반면 현재 인월드 제품 페이지와 최신 안내에서는 지원 범위를 200개 이상의 언어로 확대해 안내하고 있으며, 언어가 바뀌어도 같은 목소리 특성을 유지하는 크로스링구얼 기능을 제공한다고 설명합니다.
따라서 현재 기준으로 “200개 이상 언어 지원”은 공식 자료로 확인됩니다.
다만 기사에 나온 “500개 이상의 방언”이라는 수치는 현재 확인한 인월드 공식 발표와 문서에서는 명확하게 확인되지 않았습니다. 이 숫자는 추가 근거가 확인되기 전까지는 블로그에서 단정적으로 쓰지 않는 편이 안전합니다.
목소리 복제는 5~15초면 가능
Realtime TTS-2는 음성 복제도 지원합니다.
인월드 공식 설명에 따르면 깨끗한 단일 화자의 음성 샘플을 약 5~15초 정도 제공하면 별도 장기 학습 없이 새로운 음성 ID를 생성할 수 있습니다.
또 Advanced Voice Design 기능을 사용하면 참고 음성 파일 없이 글로 원하는 목소리를 설명해 새로운 음성을 설계할 수 있습니다.
예를 들어 “차분하고 낮은 톤의 라디오 진행자 같은 목소리”처럼 설명하면 그 특성에 맞는 음성을 생성하는 방식입니다. 이 기능은 게임 캐릭터나 콘텐츠 제작에서 성우 음색을 빠르게 실험할 때 활용도가 높을 수 있습니다.
아티피셜 애널리시스 1위, 맞지만 조건이 있다
기사 제목의 “1위 등극”은 사실이지만 평가 종류를 정확히 구분해야 합니다.
Artificial Analysis의 Controlled Voice Arena에서는 Realtime TTS-2가 Elo 1123점으로 1위를 기록했습니다. Cartesia의 Sonic 3.6은 1119점으로 뒤를 이었습니다.
이 평가는 모든 모델에 동일한 복제 음성을 적용해 음질을 비교하는 방식입니다.
즉 모델 자체의 음성 생성 능력을 비교하기에는 상대적으로 공정한 조건이라고 볼 수 있습니다.
하지만 Provider Voice Arena에서는 결과가 달라집니다.
각 업체가 자체적으로 제공하는 대표 음성을 사용하는 이 평가에서는 Cartesia Sonic 3.6이 Elo 1282점으로 1위, Inworld Realtime TTS-2가 1252점으로 2위를 기록했습니다.
따라서 정확한 표현은 “Controlled Voice Arena 1위, Provider Voice Arena 2위”입니다.
모든 TTS 평가에서 종합 1위를 차지했다고 표현하는 것은 과장에 가깝습니다.
실시간이라는 이름답게 속도도 강점
음성 AI에서는 자연스러움만큼 중요한 것이 응답 속도입니다.
사람끼리 대화할 때 상대방이 매번 몇 초씩 늦게 대답하면 어색하기 때문에 음성 에이전트에서는 첫 음성이 얼마나 빨리 나오느냐가 매우 중요합니다.
인월드 현재 공식 페이지는 Realtime TTS-2의 첫 바이트 응답 시간을 100ms 미만으로 소개하고 있으며, Flash 모델은 약 25ms 수준을 강조하고 있습니다.
다만 기사에 나온 “99번째 백분위 기준 100ms 미만”이라는 구체적인 조건은 현재 공개된 공식 페이지에서는 동일한 표현으로 확인되지 않았습니다.
따라서 블로그에서는 “인월드가 공식적으로 sub-100ms TTFB를 내세운다” 정도로 쓰는 편이 정확합니다.
가격은 무조건 20.83달러가 아니다
기사에서는 Realtime TTS-2 가격을 100만 문자당 20.83달러라고 소개했습니다.
이 값은 Artificial Analysis의 비교 페이지에서 사용하는 대표 API 가격과 비슷합니다. 실제 Controlled Voice Arena에도 약 20.8달러로 표시됩니다.
하지만 인월드의 현재 공식 가격표는 요금제에 따라 다릅니다.
On-Demand 요금은 100만 문자당 25달러이며, Creator는 20달러, Builder는 17.5달러, Developer는 15달러, Growth는 12.5달러 수준입니다. 엔터프라이즈 대규모 사용에서는 더 낮아질 수 있습니다.
따라서 “TTS-2의 공식 가격은 20.83달러”라고 하나의 숫자로 단정하는 것은 부정확합니다.
더 정확하게는 “사용량과 요금제에 따라 100만 문자당 약 25달러에서 대규모 사용 시 5달러 수준까지 낮아질 수 있다”고 보는 것이 맞습니다.
우리에게 실제로 중요한 변화는
이번 모델에서 가장 중요한 변화는 목소리가 단순 출력물이 아니라 ‘대화 상태를 전달하는 인터페이스’가 되고 있다는 점입니다.
지금까지 음성 AI는 텍스트 챗봇의 답변을 읽어주는 부가 기능에 가까웠습니다. 하지만 사용자의 말투와 감정을 듣고, 다음 답변의 분위기까지 바꾸는 기술이 발전하면 AI 상담원, 게임 NPC, 교육 서비스, 음성 비서의 경험은 상당히 달라질 수 있습니다.
특히 고객센터에서는 화난 고객에게 더 차분한 목소리로 답하고, 게임에서는 플레이어의 반응에 따라 캐릭터 말투를 바꾸며, 언어 학습 서비스에서는 같은 AI 교사가 여러 언어를 같은 목소리로 사용할 수 있게 됩니다.
다만 감정을 “이해한다”는 표현은 사람처럼 감정을 실제로 느끼거나 이해한다는 뜻은 아닙니다. 음성 신호에서 말투·속도·억양 같은 패턴을 분석해 감정 상태를 추정하고 음성 생성에 반영하는 기술에 가깝습니다.
결국 TTS 경쟁도 음질에서 ‘대화 경험’으로 이동 중
Realtime TTS-2의 의미는 단순히 목소리가 더 자연스러워졌다는 데 있지 않습니다.
앞으로의 음성 AI 경쟁은 누가 가장 사람 같은 목소리를 내느냐보다, 누가 사용자 상태를 빠르게 파악하고 적절한 말투로 반응하며, 비용까지 낮출 수 있느냐로 이동할 가능성이 큽니다.
현재 Realtime TTS-2는 동일 음성 조건의 Artificial Analysis 평가에서는 1위 수준의 경쟁력을 보였고, 자체 음성을 사용하는 평가에서도 상위권을 기록하고 있습니다. 다만 “TTS 전체 압도적 1위”, “500개 이상 방언 지원”, “고정 가격 20.83달러” 같은 표현은 공식 자료 기준으로 조금 더 신중하게 볼 필요가 있습니다.
확인한 자료
Inworld AI Realtime TTS-2 공식 발표
Inworld AI Realtime TTS-2 현재 제품 안내
Inworld AI 공식 가격표
Artificial Analysis Controlled Voice Arena
Artificial Analysis Provider Voice Arena
당신을 위한 3줄 요약
인월드 Realtime TTS-2는 이전 대화의 실제 음성을 분석해 말투·속도·감정 상태를 다음 음성에 반영하는 실시간 TTS 모델입니다.
Artificial Analysis의 Controlled Voice Arena에서는 1위지만 Provider Voice Arena에서는 Cartesia Sonic 3.6에 이어 2위입니다.
현재 공식 자료상 200개 이상 언어와 5~15초 음성 복제를 지원하지만 가격은 요금제에 따라 달라 20.83달러로 고정돼 있지는 않습니다.
3 line summary for you
Inworld Realtime TTS-2 uses prior audio context to adapt tone, pacing, and delivery in realtime conversations.
It ranks first in Artificial Analysis' Controlled Voice Arena, but second in the Provider Voice Arena behind Cartesia Sonic 3.6.
It supports 200+ languages and short-sample voice cloning, while actual pricing varies by usage tier.
📘 외국어 학습, Loglingo로 시작하세요
Loglingo는 외국어 학습에 특화된 AI 일기 플랫폼입니다.
모국어와 학습어를 선택하면, 학습어로 작성한 일기의 문법과 표현을 정확히 교정해줍니다.
🌍 전 세계 라디오로 듣기 연습
🗣 말하기 연습 모드 제공
📊 AI가 학습 레벨을 자동 분석해 맞춤 피드백 제공일기를 쓰는 순간, 실력이 쌓입니다.
https://www.loglingo.com
Loglingo
AI-powered language learning diary
www.loglingo.com
모두의 박물관
새로운 지식과 흥미로운 디지털 콘텐츠를 한곳에서 만나보세요.
배우고, 체험하고, 생각을 확장하는 온라인 공간.
블록체인 박물관
금융 박물관
대한민국 실패 박물관
다이어트 박물관
재난 박물관
AI 박물관
성수 박물관 ( 2026년 9월1일 개관 )
🌐 https://maccrey.com
Museum for Everyone
Explore seven interactive digital museums through one multilingual 2D and 3D experience.
maccrey.com
'Development News > AI' 카테고리의 다른 글
| GPT-6 아스트라 코드 아레나 1위, 정말 클로드를 넘었나? 웹개발 성능 팩트체크 (0) | 2026.09.07 |
|---|---|
| AGI 시대, 왜 스테이블코인이 필요할까? AI가 경제활동을 시작하면 ‘돈’도 바뀐다 (2) | 2026.09.04 |
| GPT-6 아스트라 공개, 정말 AGI 시대 시작됐나? 성능·가격·챗GPT 출시 일정 팩트체크 (0) | 2026.09.04 |
| 메타 뮤즈 스파크 1.3 공개, GPT-5.6 Sol과 맞먹었다…진짜 주목할 것은 ‘가격과 속도’ (0) | 2026.09.03 |
| 구글 제미나이 3.8 플래시 공개, 코딩·AI 에이전트 확 달라졌다…가격은 2027년 두 배 (0) | 2026.09.03 |