AI AI工具情报站
模型动态公众号:腾讯混元

真正懂上下文的语音识别

📰 公众号:腾讯混元📅 2026-08-04T08:12:36.000Z

核心亮点

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,它基于混元大模型与 MoE(混合专家)架构,把高精度识别与语义理解融合到一起。说白了,它不只是“听清你说的话”,还能结合上下文判断你到底想表达什么,在噪声、口音和专有名词等真实场景下更稳,已上线腾讯云并率先在元宝 App 免费开放。

具体能力或事件经过

在公开评测集中,Hy ASR 3.0 的中文普通话词错率(WER)做到 3.34%,英语 2.62%,粤语 3.12%,三项都处在行业靠前水平。更关键的是它支持上下文纠错:模型会结合前后文修正同音词与歧义;支持热词注入,让“混元”“元宝”这类专有名词不再被写错;还覆盖了高噪声环境下的耳语识别,对通话、车载、会议等场景很实用。多语种与方言的统一处理也降低了接入成本。

技术细节

模型采用 MoE 架构,让不同专家子网络分别处理声学、语言与语义层面的信息,从而在识别之外保留对语义的理解能力。上下文纠错并非简单后处理,而是与识别过程联合优化,使纠错和转写共享同一套表示。热词注入通过偏置关键词得分实现,无需重新训练即可生效,方便业务方随时增补品牌词与术语,部署灵活度明显提升。

与竞品对比

相比传统 ASR 只追求字准、把语义交给下游大模型的做法,Hy ASR 3.0 把理解前置,减少了级联误差。它与 Whisper 系列、各大云的识别服务同台竞争,优势在中文与粤语等本土语种、以及上下文纠错带来的可用性;不足之处在于 preview 阶段接口与生态仍在完善,企业级私有化部署路线还有待明确,迁移成本需结合实际评估。

行业影响或适用场景

语音识别正从“转写工具”升级为“带理解能力的入口”。对会议记录、客服质检、车载语音和无障碍辅助等场景,上下文感知能显著提升可用性,减少人工校对。腾讯把它放在元宝与腾讯云上免费开放,既是在为自家智能体生态补课用户体验,也把高质量中文语音能力以低门槛方式推向开发者,有望加速语音交互在中文世界的普及。