我花了54个小时,做了一个可能更公平的AI大模型排行榜。

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
我花了54个小时,做了一个可能更公平的AI大模型排行榜。
8855点击    2026-08-10 09:02

这个周末,在家里做了一个有趣的东西。


一个非常有意思的AI大模型排行榜。


没想到效果还不错,所以我也觉得,可以免费开放给大家一起玩。


起因是我上周发了文章,然后一位朋友的一条评论被很多朋友都顶的很高。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


希望能做一个各个模型评分排行的汇总,方便实时了解和对比各种模型的性能。


这个是一个非常有趣、且对我自己非常刚需的需求。


因为现在的模型评测排行榜、评测集等等,实在是太多太多了,人人其实都可以做一份自己的评测集,然后来跑一份模型排行榜,有的测的全一些,有的就是个垂直场景的特定任务,这个量级真的特别大。


甚至我自己都搓了一套所谓的模型评测集,方便我自己看一下大模型的效果到底怎么样。


但是我其实根本不敢对外放出来,或者大言不惭的说我这个就是标准啥的,我自己清楚,图一乐可以,如果你要对外,那专业水平还差了八万条街。


但是这么多排行榜还有来源,究竟该看谁呢?我们到底该信谁呢?


我自己的过去的解法就是,找出我相信的那些排行榜或者评测机构,然后我只看他们的排名和跑分,看完以后,综合判断一下,其实我心里就有数了。


其实你看,这个理念和方法,跟AIHOT还有我自己的理念其实是如出一辙的,这个时代,最重要的,其实就是筛选信源,而不是筛选信息本身。


所以,当看到那个用户的评论之后,我就想,不如我就开发一个小功能吧,聚合一些我信任的排行榜,清楚的反映出大模型的综合能力。


而且我想着,反而也不复杂,比如一个模型,在这个榜上第一、在那个榜上第二,在那个榜上又第一,我取个平均数不就好了,估计几个小时就开发完了,然后放在AIHOT上,给大家免费看,这多好啊。


结果,从周五晚上吃完饭回到家里,11点开始,这一做,整个周六周日就再也没出过门了,一直就做到了周一的凌晨5点。。。


我是真没想到,想把这些玩意凑在一块,根本不是取个平均数就完事的,想要做好,想要靠谱,居然能有这么多细节需要考虑,我甚至去恶补了关于贝叶斯的知识。。。


不过还好,皇天不负有心人,在熬了2天之后,我总归还是做出来了。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


网址在此:


https://aihot.virxact.com/leaderboard


或者如果你是AIHOT的老用户的话,你也能在首页左边的Tab上,看到一个新的Tab,就是模型榜。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


在这个界面上,你就能看到,所谓的AIHOT共识分了。


这个分数的背后,其实就是我自己挑选出来的一些我觉得真的有参考意义的一些排行榜了,第一批一共10个,后面还会加,大家如果有觉得非常靠谱的且新的,也可以给我反馈。


这10个来源,我列了一个表格。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


而你点击这个地方,也能进入我们参考的所有排行榜的界面。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


这里把大家的榜单都集成过来了,方便大家查看,当然,也放了跳转源网址的快捷入口,方便大家去源站看其他的信息。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


而你如果回到排行榜首页,每个模型本身也可以点击,去到他们的详情页,看看每个来源,给他们的打分和排行分别是多少。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


大概就是这么个东西。


讲道理,如果不做外面的那个AIHOT的共识分,只做一下集成,把大家的数据放到这,定时更新,其实挑选来源大概2小时,Codex按我的流程现在开发,最多3小时,半天怎么滴也就能搞完了。


但是吧,我自己还是觉得,如果纯粹的只是集成展示,还是不够有意思。


包括这也是我自己一直想知道的,如果把这些排行榜的数据,都汇聚在一起,出一个新的排行榜,就是大家的共识榜,那是不是就肯定有意思多了。


人的很多念头啊,只要你起念的那一刻,那再也不会消下去了。


于是,这一个周末的时间,我几乎把所有的时间都铺在了这个上。


起初我想的特别简单,我觉得这个排名不是挺好算的吗?


就是比如说我有10个榜,比如Kimi K3这个模型,在那个榜单上排第1,在那个榜单上排第2,在那个榜单上排第5,我直接取个平均数,就能算出来它的综合排名2.66,然后所有模型一起来比这个综合排名,不就搞定了。


但是当实际把那些数据拿出来的时候,我才发现,这个方案就纯纯是拍脑袋的呆逼方案,问题实在太多了。


比如,同样是第5,在一张只有10个模型的榜里,只能算中游,但是在一张有200个模型的榜里,已经是最顶尖的了,这两个第5的含金量能是一回事吗?


比如,这个榜的第1领先第2领先了30%,另一个榜单里,第1只比第2多了0.01分,领先的幅度微乎其微,这个领先幅度,能是一回事吗?


还有等等等等,全是坑。


而且还有一个特别现实的事情就是,有的榜他更新就是慢半拍,有的榜他就是不跑某个特定的模型,于是同一个模型,可能在6个榜里是有它身影的,但是在另4个榜里,却处于缺失状态。


那这时候,这个缺失得咋处理呢。。。


如果给它填0分,这肯定不行啊,它只是没测又不是真零蛋,你填平均分,那对其他人也不公平,如果你只平均它参加过的6张榜,又会把这6张榜的影响莫名其妙的放大,导致也不客观。


这个时候,我才发现这个事的棘手程度,而且不止这个算法,我才发现,每一个榜单上,大家的模型名称,还有评测的规则,还有命名规范,全都不一样,这又给我带来了一些工作量,不过这个好解决,就是纯粹的工程化问题。我建一个我们自己的中心模型名称库,然后把其他榜单的名称全部映射过来,就非常快的速度就解决了。


但是唯独这个排行算法。


于是在周六,我就开始跟AI一轮一轮的聊,一轮一轮的去学习和探索。


这个时候你会发现,如果我们只在Codex里面,让它根据我们的代码和项目来去探索,效果是稀巴烂,基本上就是一个快沉的满身漏洞的大船,它疯狂的给你想着怎么打补丁,但是真正的本质是,我们得换一艘不会漏水的船。


所以呢,这个时候我一般会把我自己的坑,还有这些问题给梳理出来。我直接打开ChatGPT的5.6 Sol Pro,来去跟他聊。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


相信我,这个模型,绝对不比Claude Fable 5差,很强,非常强,尤其是在讨论方案上,强的离谱。


然后我一般的方法呢,不是让它在自己的领域里面去找,而是把我的困惑和我的问题,还有这个事情的背景说给它听,同时问它,人类历史上有没有过类似的解决方案。


这个时候你会发现你的思路瞬间就会被拓宽了,人类的局限,很多时候就是因为自己的知识,因为每一个人的能力都过于渺小。而如果你在找一个方案的时候,只局限在自己的领域,你会发现你经常会撞上南墙。


可人类的知识本就浩瀚如星海,你的领域解决不了,那有没有可能,其他的领域是可以解决的呢?


AI给我找了两个领域,一个叫教育,一个叫电竞。


在教育这个事呢,在很久以前就遇到过了。比如说不同的学生,他做的试卷不一样,那题目难度也不一样。单纯的比较卷面的总分,其实是并不公平的。那所以后面我们有了一整套的方法,它可以从你的答题结果里面去评估一个看不见的潜在分数。


在电竞里面也有类似的机制,特别是竞技类游戏,一个可能只打了几十场,把把超神的人,你不可能还给他匹配同样打了几十场的萌新吧?这个机制,被大家亲切的称为Elo机制。


微软也有一个自己的项目,叫TrueSkill,是一种更偏团队更高级的游戏匹配系统。


太像了,跟我们遇到的问题太像了。


那从这两条路去归纳,最后我们找到了一个非常非常适合我们现有数据的成对比较方法,同时又做了一些定制化的改良。


底层叫Bradley-Terry,同时又加了先验来限制小样本结果的评分。


它大概的意思呢,就是我们核心看的是模型之间真正发生过的PK和较量


比如两个模型同时出现在了一张榜单里面,那谁高谁就赢了一场。然后把所有榜单里面真实发生过的一些胜、负、平,最后放到了一张巨大的网里面,反过来推算模型背后真正的那个能力值。


这其实就变成了纯粹的电竞PK。


那有些模型可能互相之间从来没有在同一张榜单里面出现过,那也没有关系,只要它们分别跟同一批对手交过手,那整张大网络仍然可以把它们连起来。


比如某个榜单里面缺了A,就导致A没有直接打过B,但在另一个榜单里面,A打过C,B也打过C,当这样的共同对手足够多以后,这时候我们就可以根据它们的分数大概来去推断A和B的能力值和它们的关系了。


当然,大模型的榜单跟电竞还是有一些区别,因为来源之间会互相重叠,小榜的偶然性会更强,证据太少的模型也可能因为刚好赢了几场,就算出一个特别离谱的能力值。


于是我们又做了很多的工作,比如做了一些叫证据预算的东西,又加了一些先验。而且为了我们归一到100分制,我们又冻结了一组锚点模型,用它们来定义共识分的刻度。


那最终呢,这套榜单我们的实现方式,AI给我取了个名字,叫:


LatentRank。


在这套规则下,前5名就是这几个。


Opus 5超过Fable 5我还是有点意外的,不过看了一下源榜,编程的评测确实更强一些,以及Fable 5有的任务一跑就降级,反而拉低了分,实在是没招。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


同时呢,这套规则,我也完全的公开出来了,在AIHOT中有一个规则页,大家如果感兴趣的话,可以自己去看。


我花了54个小时,做了一个可能更公平的AI大模型排行榜。


网址在此:https://aihot.virxact.com/admin/leaderboard/rules


当然最后我想说,我们做的这套东西,它一定也不是百分百的标准,它更不能定义每一个模型真正的能力的边界和参数。


我只能说,用这种方式,尽可能的在我的理解里,在我的能力的范围里面,尽可能公平的把它们汇总起来,给大家一个可能会更加客观的答案。


所以所有的一切数据,我们都暴露在了网页之上,大家全部都可以进行查看或者玩一玩。


当然这还只是第一版,后面我肯定还会继续去做一些优化的,再补上一些更好、更加客观、更加多样化的评测来源,让我们这个榜单也更加的客观一些。


最后也希望这个小小的功能。


能对大家有用。


玩的开心~



文章来自于微信公众号 “数字生命卡兹克”,作者 “数字生命卡兹克”

AI转型,免费服务,就找AITNT