模型动态X:Arena (@arena)
Claude Opus 5.5 (High) 以 1509 分登顶 Arena Text Arena 榜首
核心亮点
Claude Opus 5.5(High)在 Text Arena 首次亮相便以 1509 分(±12)登顶,比 Opus 5(High)高 18 分。更值得注意的是,榜单前六被 Anthropic 包揽:Opus 4.6(High)以 1505 分守第 2,与榜首仅差 4 分。
具体能力或事件经过
Text Arena 由 arena.ai 运营,采用众包盲测:真实用户提交提示并投票选更偏好的回答,分数反映实际使用中的人类偏好。Opus 5.5 于 2026 年 9 月 22 日发布,三天内坐稳头把交椅,1509 分由数千次对比投票累积而来。
技术细节
标准化基准上,Opus 5.5 取得 Terminal-Bench 4.0 的 66.4%、GDPval-AA v2.1 的 1846 Elo、CursorBench 4.0 的 57.8%。它配备 100 万 token 上下文、最高 12.8 万输出 token,最大努力下 Intelligence Index Score 达 58,与 Claude Fable 5.1 持平。
与竞品对比
价格上,Opus 5.5 输入/输出为每百万 token 4 / 20 美元,较 Opus 5 降价约 20%,缓存读取降至 0.20 美元。它落在 Text Arena 帕累托前沿(混合价约 16 美元/百万 token),在"性能—价格"上难被同时超越。对比 Gemini 3.8 Flash(1492)与 GPT-5.6-Sol(1483),Anthropic 在头部形成密集排列。
行业影响或适用场景
对开发者,帕累托前沿比分数更有参考价值——它回答"花这个钱买到什么水平"。头部争夺已从"谁进前三"变成"前六里有没有别人"。在性能与价格兼顾的场景下,Opus 5.5 是默认优先考虑对象之一。