模型动态X:Arena (@arena)
6.1 Sol (Max) 进入 Agent Arena 第 5 名,以更低成本逼近前列模型
核心亮点
Agent Arena 公布最新榜单,OpenAI 的 GPT-6.1 Sol (Max) 冲到第 5 名,净提升 +11.23%,而单个任务的中位成本只有 0.56 美元。更关键的是,它重新刻画了榜单的"帕累托前沿"——用更低的钱拿到了靠前的成绩,这对每天跑大量 agent 任务的团队是实打实的利好。
具体能力或事件经过
Agent Arena 的排名来自大量真实 agent 会话的盲测投票,净提升(net gain)反映相比上一版的真实进步。GPT-6.1 Sol 这次不仅排名靠前,还把"成本—能力"组合往前推了一步,意味着在同等预算下能选到更强的模型。它的定位延续 Sol 系列的"小快灵、便宜"路线,和旗舰 Astra 形成互补。
技术细节
帕累托前沿指的是:在不牺牲能力的前提下,你无法再找到更便宜的选项;或者说在不加钱的情况下,你找不到更强的。GPT-6.1 Sol (Max) 落在这条前沿上,说明它在性价比维度上确实重新定义了基准,也迫使竞品重新思考定价策略。
与竞品对比
同为 OpenAI 家族的 GPT-6 Astra 更偏"旗舰全能",而 Sol 系列走"小快灵、便宜"路线。相比 Anthropic 的 Opus/Sonnet 5.5,Sol (Max) 以远低于对手的单任务成本逼近前列,给企业做大规模自动化提供了更划算的入口,也抢走了不少对价格敏感的工作负载。
行业影响或适用场景
对每天跑大量 agent 任务的团队来说,榜单的意义不只是"谁第一",而是"哪款性价比最适合我的工作量"。GPT-6.1 Sol (Max) 把前沿能力的单位成本压下来,会加速 agent 在客服、运维、数据分析等高频场景的普及,也会倒逼其他厂商在定价上跟进。