124B 总参数 MoE 模型,支持 API、单机与高性能三种部署
核心亮点
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash。该模型采用 124B 总参数、5.1B 激活参数的 MoE(混合专家)架构,在保持大模型效果的同时,把单次推理的算力开销压到很低。它提供 FP8、FP4、INT4 等多种量化版本,并支持 API 调用、单机部署与高性能集群三种使用方式,让不同规模的团队都能用得上。对国内开发者来说,这是继多家大厂之后又一个可私有化部署的高性价比选择,进一步丰富了本土开源模型矩阵,也呼应了当下对 AI 基础设施自主可控的关注。
具体能力或事件经过
Ling-3.0-flash 是蚂蚁百灵面向生产环境打磨的混合推理模型,最大的特点是"既能跑在云上,也能跑在本地"。开发者可以直接调用官方 API,快速接入现有业务;也可以把量化后的版本部署在单台机器上做私有化推理;算力充足的团队还能组高性能集群,做更大并发的服务。说白了,它把"效果、成本、部署灵活度"三个常被牺牲的维度,尽量兼顾到了,不让用户为了便宜就牺牲质量,也不必为了质量就承受高昂账单。这种平衡,正是多数小团队从原型走向真实服务时最需要的。
技术细节
模型总参数 124B,每次推理仅激活 5.1B,靠 MoE(混合专家)结构实现稀疏计算,这是它便宜的关键。FP8、FP4、INT4 三档量化让显存占用和带宽压力进一步下降,小显存设备也能跑。原生混合推理意味着模型可按任务选择快思考或深思考链路,简单请求走轻量路径,复杂请求走更完整的推理链路,从而在同一套权重下兼顾速度与深度,不需要为不同场景维护多套模型,从快速分类到长文分析都能覆盖。
与竞品对比
相比同级别稠密模型,Ling-3.0-flash 用更少激活参数达到接近的效果,单位 token 成本更低。对比纯云端闭源方案,它给出单机与集群两条私有化路径,数据不出域,更适合金融、政务等敏感场景。多档量化也给了开发者在"精度 vs 成本"上更大的调节空间,不必被单一价格档位绑定,可以随业务淡旺季弹性切换,应对一天内起伏的流量。
行业影响或适用场景
对企业来说,开源加多部署形态降低了把大模型嵌进业务的门槛,中小企业不必为推理账单发愁。金融、政务、医疗等看重数据主权的行业尤其受益,可在内网完成关键推理。随着国产大模型在性价比上持续突破,本土 AI 基础设施的生态会进一步丰富,也会倒逼云服务价格下行,最终惠及整个开发者群体,减少对国外托管服务的依赖。