AI AI工具情报站
模型动态字节 Seed:Research Feed(网页内嵌数据)

字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

📰 字节 Seed:Research Feed(网页内嵌数据)📅 2026-08-04T16:00:00.000Z

核心亮点

字节 Seed 团队发布 SeedRealtime,一个统一架构原生融合音频、视频与文本的全双工大模型。目标很明确:让 AI 像人一样"边看、边听、边说",而非先听再想再说的分步流水线。全双工意味着模型能同时收发音视频流,用户可随时插话、打断,对话不再有僵化轮次感。据官方介绍,相比级联方案,它把音视频对话的节奏问题减少一半,交互自然度明显提升。

事件经过

SeedRealtime 已在豆包 App 全量上线,说明它不是实验室 Demo,而是跑在千万级用户产品里的生产模型。字节把它直接铺到旗舰应用,意味着底层延迟、稳定性和成本都已过关。这也是业界首次把音视频全双工技术规模化落地,给"全模态实时交互"立了可参照的标杆。

技术细节

SeedRealtime 的关键在于"原生融合"而非"拼接"。级联方案把语音识别、视觉理解、语言模型、语音合成串成几段,任一环延迟都会累积,导致卡顿、抢话或冷场。SeedRealtime 用统一架构把三模态塞进同一模型,输入输出同步,从根本上压低端到端延迟。全双工还要求具备打断检测和节奏预测,否则用户一开口就与 AI 撞车。

与竞品对比

相比 GPT-4o 的语音能力或 Gemini 的实时视音频,SeedRealtime 的差异化在于把视频也实时纳入双工回路,而非仅语音。相比国内同类语音助手,它强调"看得到画面"的实时对话,更贴近面对面交流。不过 Google、OpenAI 在实时多模态同样投入巨大,竞争远未结束,字节领先更多在中文场景的规模化落地速度。

行业影响

简单来说,SeedRealtime 把"能看会说的实时 AI 伴侣"从概念推到日常可用。对教育、陪伴、直播助理这类边看边聊的场景,全双工带来的自然打断和即时回应是质变。随着豆包全量铺开积累的真实数据反哺模型,字节有望在实时全模态赛道拉开身位,也倒逼行业加快从"语音助手"向"全感官伙伴"的升级。