腾讯混元开源 AngelSpec 投机解码框架
核心亮点
腾讯混元今日正式开源 AngelSpec,这是一个端到端的投机解码框架,训练与部署两个环节都被纳入其中。在腾讯自研的 Hy3-A21B 模型上,其 DFly 方案相比传统自回归解码实现了 1.98 到 2.40 倍的端到端加速,系统吞吐量相比另一方案 DFlash 还要高出 10.5% 到 11.8%。更关键的是,训练代码以及 Hy3-A21B 的 MTP 与 DFly 草稿模型权重已经全部放出,开发者无需从零复现就能直接上手。
具体能力 / 事件经过
投机解码的底层逻辑并不复杂:先让一个体积更小的草稿模型一口气猜测出接下来若干个 token,再交回主模型一次性并行校验,把原本必须串行等待的过程变成批量验证。AngelSpec 的差别在于它把训练和部署串成了一条完整链路。也就是说,你既可以用它训练出贴合自己业务的草稿模型,也能直接加载官方开源的权重做线上推理,不必在两套工具之间来回切换。
技术细节
Hy3-A21B 是腾讯混元体系下一个约 210 亿参数的混合专家模型。AngelSpec 为其准备了 MTP(多 token 预测)和 DFly 两套草稿模型方案。从公开数据看,DFly 在端到端实测中表现更稳定,相比逐 token 自回归解码拿到接近两倍的加速区间,且在吞吐量上仍对 DFlash 保持两位数的领先。框架选择开源,意味着研究者能复现全部实验、替换底座模型,甚至针对特定语料微调草稿模型以提升接受率。
与竞品对比
和 DFlash 这类主流投机解码方案相比,AngelSpec 的 DFly 在吞吐指标上多出 10% 以上,差距并不小。对比闭源的商业推理加速服务,开源框架最大的优势是透明与可控:延迟、显存占用、草稿接受率都摆在明面上,团队可以按需调参,而不是被黑盒定价牵着走。
行业影响 / 适用场景
大模型进入落地阶段后,推理成本往往占到总开销的大头。投机解码这类技术每提升一点效率,都能直接摊薄单位 token 的价格。对于需要长上下文、高并发的企业级对话和智能体场景,毫秒级延迟的下降会带来可观的成本节省。做智能体的团队每一步推理都涉及多轮生成,投机解码把单轮延迟压下来,整体体验会更顺。腾讯把训练代码和权重一同开源,等于向社区交出一条可复现的加速路线,对补全国产开源生态在推理侧的短板有实际意义。