国内AI动态 ai-products
我花了54个小时,做了一个可能更公平的AI大模型排行榜。
核心亮点
公众号「数字生命卡兹克」的作者花了 54 个小时,做了一个并免费开放的 AI 模型综合排行榜 LatentRank。说白了,他嫌现有榜单各自为政、口径不一,干脆把多家可信榜单聚合起来,用一套统一算法重新算分,想给出一个“更公平”的排名。目前榜单前五里,Opus 5 超过了 Fable 5 排在前列。
具体能力或事件经过
LatentRank 的做法是先把多个权威榜单的原始结果汇总,再用 Bradley-Terry 成对比较算法把不同榜单的胜负关系映射到同一把“分数尺”上。针对小样本模型、榜单规模不同、领先幅度参差、以及某些模型在某榜缺失的问题,作者还加入了先验限制来稳定估计,避免被个别榜单带偏。最终输出一个跨榜单可比的综合排序。
技术细节
Bradley-Terry 模型的核心是:已知 A 胜 B 的概率,就能反推两者实力分差。把这些成对胜负当作观测,用最大似然估出每个模型的分数。先验限制则相当于“给冷门模型加一点保守预期”,在小样本时防止分数剧烈抖动。作者把代码和榜单都免费开放,等于把评分方法也交给了社区检验。
与竞品对比
和 LMArena、各厂商自建榜单比,LatentRank 不自己造数据,而是做“元榜单”——站在已有榜单肩膀上做再排序。好处是口径统一、不易被单家口径操纵;代价是上限受源榜单质量约束。它更像一面“校准镜”,而不是新的裁判。
行业影响或适用场景
对开发者和选型的人,这类聚合榜降低了“看榜看到眼花”的成本,提供一个可交叉验证的参考。对行业,它也提示一个趋势:当榜单越来越多,如何公平地综合它们,本身正在变成一门值得认真做的学问。免费开放则让小团队也能用上更稳的参考系。
在一个月冒出几十个新模型的年代,能交叉验证的榜单,往往比任何单一权威都更值得信任。