AI资讯ai-models
6.1 Sol 与 Gemini 4 Argon 登顶 Coding Agent Index 榜单但成本差异大
核心亮点
Artificial Analysis 发布了 Coding Agent Index 榜单,把"写代码智能体"的能力与成本一起摆上台面。Claude Sonnet 5.5 (max) 在 Claude Code 上以 68 分居首,但每个任务成本最高冲到 14.19 美元——贵得让人皱眉。与此同时,GPT-6.1 Sol 与 Gemini 4 Argon 则登顶了另一组更讲性价比的排行,把"强"和"便宜"拆成了两件事。
具体能力或事件经过
这份榜单的意义在于它不只看"谁分高",还看"每分花多少钱"。Sonnet 5.5 虽然强,但单位任务成本过高,让它在实际选型里未必划算;而 GPT-6.1 Sol、Gemini 4 Argon 在相近能力下把单价压得很低,更适合大规模、高频的代码自动化,也更适合把 agent 接进 CI 跑日常任务。
技术细节
Coding Agent Index 评的是 agent 端到端完成编程任务的成功率与质量,不是单纯跑分。成本差异主要来自模型定价、上下文长度和重试次数——一个爱"反复试"的 agent,账单会悄悄膨胀。换句话说,榜单把"能力"和"预算消耗"这对常被忽视的变量同时亮了出来。
与竞品对比
Claude 系列长期是 coding agent 的默认首选,这次在"能力第一"上依然稳,但"贵"的标签被放大;OpenAI 和 Google 则借性价比榜单抢话语权。选型逻辑从"用最好的"转向"用最划算的",也倒逼模型厂商在定价上更透明。
行业影响或适用场景
对把 agent 接进 CI、做自动修 bug 或生成代码的团队,成本曲线比单点能力更关键。这份榜单会推动大家按"每任务成本"重新核算预算,也可能让低价模型在工程中抢走一部分高端模型的市场。它提醒一句:在 agent 时代,省钱和变强同样重要。