AI AI工具情报站
模型动态X:蚂蚁百灵 (@AntLingAGI)

flash开源权重

📰 X:蚂蚁百灵 (@AntLingAGI)📅 2026-08-04T15:03:43.000Z

核心亮点

蚂蚁集团百灵大模型团队(AntLingAGI)正式放出 Ling-3.0-flash 的开源代码与可免费使用的模型权重。这次开源不仅提供完整的模型权重,还同步给出了官方 BF16 与 FP8 两种压缩版本,让开发者能根据手头硬件和性能需求灵活选择,把部署门槛进一步压低。

具体能力或事件经过

Ling-3.0-flash 是蚂蚁百灵大模型家族中的轻量高速成员。团队在社交平台宣布,代码已公开、权重可免费使用,任何人都能自行下载部署。与此同时,官方 BF16 版本与原生 FP8 压缩版本现已可用——BF16 兼顾精度与兼容性,适合大多数 GPU;FP8 则把显存占用和推理开销压到更低,适合追求吞吐与成本的场景。用户可结合自己的硬件条件、性能要求和上线部署需求,挑选最合适的版本。

技术细节

FP8(8 位浮点)是近年大模型推理压缩的热门方向,相比传统的 FP16/BF16,它在数值位宽上近乎减半,能显著降低显存占用并提升计算密度,代价是动态范围更窄,需要更细致的缩放与量化校准。蚂蚁同时放出 BF16 与 FP8 两套权重,实际上是在“精度优先”和“效率优先”之间给了开发者明确的选择支点,而不必自己从头做压缩。

与竞品对比

国内大模型开源潮里,很多团队只放 BF16 权重,FP8 往往要用户自行处理。Ling-3.0-flash 直接提供官方 FP8 版本,省去了社区二次量化的麻烦,对想上低成本推理卡、做高并发服务的团队更友好。和同档位的轻量开源模型相比,它的卖点在于“开源即带压缩版本”,降低了从下载到上线的距离。

行业影响或适用场景

免费可商用的轻量权重,对企业私有化部署、科研复现和个人开发者做原型都很有价值。FP8 版本的提供尤其利好显存受限的边缘与推理场景,能让更多中小团队以更低成本用上大模型能力。随着开源权重生态成熟,这类“开箱即跑”的轻量模型会继续成为落地应用的主力。