AI模型多榜综合排名:LatentRank共识分背后的算法

这个周末,我在家完成了一个AI大模型聚合排行榜工具,测试下来效果超出预期,因此决定免费开放给所有用户使用。
这个项目的灵感来自一位用户的评论,当时有朋友希望能有一个统一的大模型评分汇总页面,方便实时对比不同模型的性能表现。
现在市面上的大模型评测排行榜、评测集数量繁多,每个人都可以基于自己的评测集生成榜单,有的覆盖全面,有的专注垂直场景,整体体量非常庞大。我自己也曾搭建过一套自用的评测集,用来快速验证大模型的实际表现,但这套工具仅能作为参考,完全达不到对外公开的专业标准。
面对海量的评测榜单,用户往往会陷入选择困难:到底该参考哪一份榜单?不同来源的排名差异该如何取舍?我以往的解决方法是筛选出自己信任的评测机构,只参考他们的排名和跑分,再结合自身需求做综合判断。这其实和行业里筛选可信信源的思路一致,在信息爆炸的时代,筛选信源比筛选信息本身更重要。
看到那条评论后,我萌生了开发聚合工具的想法,计划将我认可的多个排行榜聚合在一起,清晰展示大模型的综合能力。最初我以为这很简单:比如一个模型在多个榜单中的排名取平均值,就能得到综合排名,几个小时就能完成开发,放在专属平台上免费给大家使用。
但实际动手后才发现,远没有想象中简单。从周五晚上11点吃完晚饭开始,我整整两天都没有出门,一直忙碌到周一凌晨5点才完成初步版本。原本以为只是简单聚合数据,却发现有无数细节需要打磨,甚至为此恶补了贝叶斯相关的知识。
最初的平均排名思路存在很多致命问题:比如同样是排名第5,在仅有10个模型的榜单中只能算中游水平,但在拥有200个模型的榜单中已经属于顶尖梯队,两者的含金量完全不可同日而语;不同榜单的领先幅度差异也很大,有的榜首比第二名领先30%,有的仅领先0.01分,简单的平均无法体现这种差距带来的参考价值差异。
此外还有一个现实问题:部分榜单更新滞后,或者不支持特定模型,导致同一个模型仅在部分榜单中存在数据。如果直接填0分显然不合理,毕竟未被评测不等于能力为0;如果填平均分又会破坏公平性;仅统计参与过的榜单又会放大该榜单的权重,导致结果不够客观。
此时我才意识到这件事的棘手程度,除了算法问题,不同榜单的模型命名规则、评测标准也各不统一,这也带来了不少工程化的工作量。不过这部分相对容易解决:我们可以建立统一的中心模型名称库,将不同榜单的模型名称映射到统一标准,这部分很快就能完成。唯独排行算法的问题,始终没有找到合适的解决方案。
周六当天,我开始和专业AI工具反复沟通,梳理所有遇到的问题,一边交流一边学习探索解决方案。一开始我尝试在现有代码基础上调整,但效果很差,就像修补一艘漏水的旧船,只能暂时掩盖问题,无法从根本上解决。这时我意识到,我们需要换一个更合适的思路,而不是在旧代码上打补丁。
于是我将所有遇到的问题和项目背景整理清楚,使用专业AI工具进行咨询,希望能找到人类历史上类似的解决方案。我的沟通思路也很明确:不是让工具在现有领域内寻找答案,而是将我的困惑、问题和项目背景完整告知,询问人类历史上是否有类似的场景和解决方案。
这个思路很快打开了我的视野:人类的知识边界本就有限,每个人的能力都有局限,如果仅局限在自身领域寻找方案,很容易陷入死胡同。人类的知识浩瀚如星海,这个领域解决不了的问题,或许可以从其他领域找到灵感。
AI为我推荐了两个高度相关的领域:教育和电竞。
在教育领域,很早之前就遇到过类似的问题:不同学生的试卷难度不同,单纯比较卷面总分并不公平,因此发展出了一套基于答题结果评估潜在能力分数的方法。在电竞领域,为了匹配实力相近的玩家,诞生了Elo评分机制:比如一个刚打几十场且表现出色的玩家,不会被匹配给同样场次的新手,这套机制就是为了公平评估玩家的真实实力。微软还在此基础上开发了更适合团队竞技的TrueSkill系统,进一步优化了多人场景的评分逻辑。
这些思路和我们遇到的大模型榜单问题高度相似,给了我很大的启发。基于这两个领域的思路归纳总结,我们找到了适合当前场景的成对比较方法,并针对大模型评测的特点做了定制化改良。
这套方法的底层采用Bradley-Terry模型,同时加入先验约束来限制小样本数据带来的评分偏差。它的核心是基于模型之间实际的PK结果:只要两个模型同时出现在同一份榜单中,排名更高的一方就算获胜一场,将所有榜单中的胜负平数据整合为一张巨大的关系网络,反向推算每个模型的真实能力值,这本质上就和电竞的Elo评分逻辑一致。
即使两个模型从未在同一份榜单中同时出现过,只要它们分别和同一批对手交过手,通过中间的关联节点也可以推断出它们的相对实力。比如模型A没有在榜单中与模型B直接对比,但在另一个榜单中,A和C对战过,B也和C对战过,当这样的共同对手足够多时,我们就可以通过C来推断A和B的相对实力。
当然,大模型榜单和电竞评分还是存在一些区别:不同评测来源的重叠度不同,小型榜单的偶然性更强,样本量较少的模型可能因为少量对战结果就出现偏差。因此我们又做了多项优化:加入证据预算机制控制样本权重,增加额外的先验约束修正偏差,同时冻结一组锚点模型,将最终评分统一归一到100分制,明确共识分的刻度标准。
最终,这套针对大模型榜单的聚合算法被命名为LatentRank。
目前这个聚合工具已经完成第一版,首批接入了10个我认为有参考价值的评测榜单,后续还会持续增加更多可靠的来源,也欢迎大家推荐优质的新榜单。
你可以通过以下网址访问工具:https://aihot.virxact.com/leaderboard,如果是平台的老用户,也可以在首页左侧的Tab栏找到模型榜入口。
在页面中你可以看到统一聚合评分,点击对应的模型还可以进入详情页,查看每个评测来源对该模型的具体打分和排名。同时工具还集成了所有接入的榜单页面,点击即可跳转至源站查看更多细节。
根据LatentRank算法得出的当前榜单,前五名的表现如下:Opus系列模型的综合得分超过了Fable 5,这一点让我有些意外,不过查看源榜单后发现,Opus在编程评测场景中的表现更为出色,而Fable 5在部分任务中会出现性能降级,拉低了整体得分。
这套算法的完整规则已经公开,你可以通过以下网址查看详细说明:https://aihot.virxact.com/leaderboard/rules。
需要说明的是,这套工具并非绝对的标准,无法完全定义每个大模型的真实能力边界和参数细节。我们只是尽最大努力,基于筛选后的可信信源,尽可能公平地整合数据,为大家提供一个更客观的参考。所有数据都直接暴露在网页中,欢迎大家自由查看、试用。
这只是第一版,后续我们还会持续优化,接入更多优质的评测来源,让榜单更加客观全面。希望这个小工具能对大家有所帮助,也希望大家使用愉快。

