AI AI工具情报站
国内AI动态 ai-models

TTS 实时语音合成模型

📰 公众号:通义实验室(千问) 📅 2026-07-20

核心亮点

通义实验室发布 Qwen-Audio-3.0-TTS,包含 Flash 与 Plus 两个版本。其中 Plus 版本在 Artificial Analysis 榜单夺冠,支持 16 种语言与 20 种中文方言;Flash 版本主打低延迟,首包延迟约 300ms,平均字错率(WER/CER)低至 3.87,Plus 的说话人相似度最高可达 82.75。这标志着国产 TTS 在实时性与自然度上双双逼近实用天花板。

具体能力或事件经过

TTS 实时语音合成的关键矛盾是“快”与“真”。Flash 版本把首包延迟压到约 300ms,意味着用户说话后几乎瞬时就能听到合成语音,适合实时对话、语音助手等场景;Plus 版本则把质量拉满,在权威榜单上超越一众国际对手,尤其在中英文混合、方言与多说话人场景下表现稳定。20 种中文方言的覆盖,使它在下沉市场与本地化服务中具备独特优势——粤语、四川话、闽南语等都能自然发声。

技术细节

低字错率依赖于更精准的韵律建模与音素对齐,Plus 把 WER/CER 控制在 3.87 左右,意味着长文本朗读也极少出现漏字、错读。说话人相似度 82.75 说明音色克隆保真度较高,仅需少量参考音频即可复刻特定人声。Flash 的 300ms 首包,则来自流式生成与语义分块的工程优化,让合成与播放几乎并行,消除等待感。

与竞品对比

对比国际主流 TTS,Qwen-Audio-3.0-TTS 的差异化在于“双版本覆盖全场景”:Flash 对标低延迟实时交互,Plus 对标广播级音质。多数竞品难以在同一体系内兼得速度与质量。在中文方言这一细分维度上,20 种的支持广度更是多数海外模型不具备的,凸显了对本地市场的理解深度。

行业影响或适用场景

说白了,语音合成正在从“能听清”走向“听不出是机器”。它可以赋能有声书、智能客服、直播配音、无障碍阅读、车载语音等海量场景。方言能力让县域与银发用户也能获得亲切的本地化交互;实时低延迟则让语音助手真正“接得住话”。对国内企业,这意味着可以用国产模型替代昂贵的海外 TTS 方案,在成本与合规上双重受益,也为多语言出海产品提供了高质量语音底座。