AI AI工具情报站
国内AI动态 ai-models

Streamer v0.2,端到端响应延迟仅 550ms

📰 公众号:通义实验室(千问) 📅 2026-07-17

核心亮点

通义实验室发布 Wan-Streamer v0.2,这是一款把「听、看、说、演」统一进单个扩散模型架构的端到端全模态模型。它的端到端响应延迟只有 550ms,几乎做到了「你开口、画面就动」的实时感,是全模态交互走向可用的重要一步,也把数字人从动嘴念稿拉到了能实时对戏的层级。

具体能力或事件经过

相比 v0.1,v0.2 最直观的升级在画质与帧率:输出分辨率从 192×336 提升到 640×368,帧率稳定在 25FPS,画面终于从「能看」变成「看得清」。更重要的是它把语音、视觉、语言、动作生成收进同一套模型里端到端完成,用户说话的同时,模型就在实时生成对应的口型、表情与动作,而不需要先识别、再生成、再对齐的三段式拼接,中间没有任何明显的卡顿空档。

技术细节

v0.2 采用 Thinker-Performer 双通路架构:Thinker 负责「想」,做高层语义理解与决策;Performer 负责「演」,把决策落地成具体的画面与动作。两条通路解耦后,模型可以在不牺牲画质的前提下压住延迟,因为重思考不必和重渲染挤在同一个时间预算里。扩散模型架构则保证了生成画面的连贯与自然,避免出现跳变和闪烁。

与竞品对比

相比把多个单模态模型串起来的传统方案,Wan-Streamer 的端到端一体化在延迟和一致性上天然占优。550ms 的端到端延迟已经接近真人对话的体感,这在数字人、实时直播、虚拟陪伴等场景里是能否「用得下去」的分水岭,也意味着它第一次有了替代真人出镜的实用可能。

行业影响或适用场景

说白了,全模态实时模型把「数字人」从念稿播音员变成能听会演的对话伙伴。对直播带货、在线教育、智能客服和虚拟主播来说,这种低延迟、高画质、一体化的能力,意味着真人感交互的门槛被大幅下降,落地成本也随之摊薄,过去只能靠真人完成的实时出镜任务,现在可以由模型稳定接手。