AI AI工具情报站
AI资讯ai-models

Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失

Hugging Face:Blog(RSS)2026-08-19T13:48:49.000Z

核心亮点

Liquid AI 发布了一套名为 LFM2.5 的 QAD Q4_0 量化检查点,包含 230M、350M、1.2B-Instruct 和 2.6B 四款模型。最亮眼的数据是:在保持原生 Q4_0 内存占用与推理速度的同时,它把 BF16 平均精度损失恢复了 97%。

具体能力或事件经过

QAD 全称是量化感知蒸馏,说白了就是一种"瘦身技术"——让一个大模型当老师,把能力"教"给一个被量化压缩的小模型。过去量化(比如压到 Q4_0)虽然省内存、跑得快,但往往伴随明显的精度掉点;LFM2.5 的做法是用蒸馏把这部分损失补回来,让小模型既轻又快还不怎么"变笨"。

技术细节

Q4_0 是 GGUF 格式里最常见的一种 4 位量化方案,优势是体积小、几乎所有本地推理框架都支持。LFM2.5 的四款检查点覆盖了从嵌入式设备(230M)到桌面级应用(2.6B)的跨度,1.2B-Instruct 还针对指令跟随做了优化,更适合直接对话与 Agent 场景。恢复 97% 精度损失意味着,用户几乎可以用"四分之一的存储",拿到接近原模型的体验。

与竞品对比

在端侧小模型赛道,Liquid AI 的对手包括微软的 Phi 系列、谷歌的 Gemma 以及 Meta 的 Llama 小尺寸版本。LFM2.5 的差异化在于把"量化加蒸馏"打包成开箱即用的 GGUF 检查点,省去了开发者自己折腾量化方案的麻烦。相比单纯发布 BF16 权重,这种"已经帮你压好并补好精度"的交付方式,对本地部署更友好。

行业影响或适用场景

这套检查点最直接的价值,是让笔记本、手机甚至树莓派级别的硬件,也能流畅跑起够用的语言模型。对隐私敏感、网络受限或需要离线运行的场景——比如本地助手、工控终端、边缘设备——尤其实用。随着端侧 AI 成为兵家必争之地,Liquid AI 用一套"轻量但不将就"的模型,给开发者和硬件厂商提供了新的选择,也降低了前沿能力下沉到终端的门槛。