AI AI工具情报站
AI资讯ai-models

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face:Blog(RSS)2026-08-20T16:52:57.000Z

核心亮点

Hugging Face 今日发布 LFM2.5 系列的 DSpark 草稿模型检查点,覆盖三款模型。借助投机解码(speculative decoding)技术,这些草稿模型在不改变输出质量的前提下,把高端 GPU 的吞吐最高提升 3.18 倍,端侧设备最高提升 2.87 倍。更关键的是,在 LFM2.5-2.6B 的智能体(工具调用)场景中,平均延迟下降 57%,这对实时交互意义重大。对已经上线智能体的公司,这次更新几乎可以即插即用。

具体能力或事件经过

所谓草稿模型,是用一个约 300M 参数的小模型先"打草稿",由大模型并行验证,从而一次生成多个 token,减少自回归的串行等待。DSpark 是 LiquidAI 与 Hugging Face 合作推出的草稿模型方案,专门针对 LFM2.5 系列调优。它已开源,开发者可在 llama.cpp 与 SGLang 上直接加载,无需改动现有推理流程,就能给原模型免费提速,也不必重训主模型。这种方案对中小团队尤其友好,因为不需要自有算力做蒸馏。

技术细节

投机解码的核心是"猜想—验证":草稿模型并行产出候选 token 序列,主模型一次性判断是否接受。由于草稿仅 300M 参数,其计算开销远低于主模型,因此净收益明显。LFM2.5-2.6B 在工具调用这类多轮、长上下文的智能体任务中收益最大,因为每一步都要等模型吐字,延迟对交互体验的影响最直接,提速的感知也最明显。验证阶段若草稿出错,主模型会回退到自回归,保证结果不变。

与竞品对比

相比动辄靠堆算力换速度的做法,DSpark 走的是"小模型辅助大模型"的低成本路线,且完全开源、框架无关。Medusa、EAGLE 等方案也做投机解码,但 DSpark 针对 LFM2.5 做了联合优化,在端侧与智能体场景的提速更突出,性价比更高,部署也更省心。在开源社区,这类轻量加速层正快速成为部署标配。

行业影响或适用场景

对需要在手机、笔记本等端侧跑大模型的应用,2.87 倍的吞吐意味着同样硬件能服务更多用户,也更省电。对构建智能体的团队,57% 的延迟下降直接改善交互手感,让工具调用更顺滑。说白了,这是一次几乎零成本的免费提速,而且人人可用。对于想把大模型塞进 App 的开发者,这是雪中送炭。