蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环
核心亮点
蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环。这背后的信号是蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 能自动完成任务的AI助手ic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。它揭示了前沿 AI 在落地过程中绕不开的成本与安全权衡。
具体能力或事件经过
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 能自动完成任务的AI助手ic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定 这一事件表明,相关能力已经从概念验证走向可感知的产品体验,用户能在日常工作中直接感受到效率变化。
技术细节
从工程视角看,这类模型通常通过在更大规模、更高质量数据与更精细的后训练对齐上做文章来提升表现。架构层面,专家混合、更长上下文与更稳的推理链路是当下主流的优化方向,目标是在不线性堆算力的前提下把真实任务准确率拉高,让模型在长文与多轮对话里少犯低级错误。
与竞品对比
在 OpenAI、Anthropic、Google 与开源阵营的多方夹击下,模型厂商的差异化越来越靠生态与工具调用。单点 benchmark 已难分高下,谁能把能力嵌进工作流、谁有更稳的工具生态,谁才走得远。
行业影响或适用场景
对应用开发者来说,模型能力的持续上探意味着更多任务可以被端到端自动化,但也需要建立跨厂商的选型与降级机制,避免被单一供应商锁定。把关键链路建立在可替换的抽象之上,是长期主义的工程选择。
延伸视角
务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。
延伸视角
务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。
延伸视角
务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。
延伸视角
务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。
延伸视角
务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。