AI AI工具情报站
模型动态X:通义千问 / Qwen (@Alibaba_Qwen)

Next

📰 X:通义千问 / Qwen (@Alibaba_Qwen)📅 2026-09-23T09:11:23.000Z

核心亮点

阿里通义千问发布 Qwen-Audio-3.1,统一覆盖 ASR(语音识别)、TTS(语音合成)与 Realtime(实时语音),并新增音频创作模型 TTS-Next 与音频理解模型 ASR-Next,五个模型横跨理解、生成、交互与创作。同时全线大幅降价,ASR 最高降 95%。

具体能力或事件经过

这次发布把音频能力做成了完整矩阵:ASR-Next 强化理解,TTS-Next 强化创作,Realtime 则支持"边说边听、随时打断"的自然对话。最值得注意的是 Realtime 的情感感知——检测到低落情绪时会放慢语速并给出共情回应,让机器对话更接近真人陪伴而非机械问答。

技术细节

Qwen-Audio-3.1 在单个系列内统一了识别、合成与实时交互,降低了多模型拼装的复杂度。价格方面,TTS 约 7 折、Realtime 约 1.5 折、ASR 最高 0.5 折,降幅之大说明底层推理成本已被显著摊薄,厂商选择把红利直接让给开发者。

与竞品对比

相比 OpenAI 的音频系列与专门的 TTS 厂商,Qwen 的打法是用一个统一家族覆盖全链路,并打出"降价到几乎免费"的牌。对国内开发者尤其友好:中文场景优化、合规可控、调用成本极低,利于把语音能力嵌入海量边缘场景。

行业影响或适用场景

超低价音频 API 会催生大量此前因成本被劝退的应用:客服、教育陪练、无障碍朗读、车载语音、情绪陪伴都可低成本落地。当 ASR 接近免费,语音将像文本一样成为可被随意调用的基础能力,进一步拉低交互门槛。

延伸视角

Realtime 的情感响应是个被低估的亮点。它暗示语音模型的竞争正从"听清说对"升级到"读懂情绪并恰当回应",陪伴与心理健康类应用可能因此获得更自然的交互基底,而不仅是功能性的问答。

关键结论

Qwen-Audio-3.1 的意义不只是又一组模型,而是把语音能力以"低价全家桶"的形式推向基础设施层。当音频成本趋近于零,真正的瓶颈会转向"如何设计好的语音交互体验",而非"能不能用得起"。

实操建议

如果你在做语音产品,建议优先用 ASR-Next 替换原有高成本识别链路,并在对话场景启用 Realtime 的情感模式做 A/B。落地时注意设置情绪响应的边界与降级策略,避免敏感场景下的过度"共情"造成用户体验分裂。

风险与边界

情感感知涉及用户心理状态推断,存在隐私与伦理边界。陪伴类应用若过度依赖模型的情绪回应,可能让用户产生不恰当的依赖;同时超低价的 API 也可能被滥用于语音克隆与骚扰电话,需要配套的鉴权与水印机制。

全局视角

音频能力的"免费化"是生成式 AI 普惠化的最新一环。继文本、图像之后,语音也正从高价能力变成水电般的基础设施,这将显著加快语音交互在消费级与产业级的渗透速度。