三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

我花了54个小时,做了一个可能更公平的AI大模型排行榜

时间:2026-08-10人气: 作者: 佚名

这个周末,在家里做了一个有趣的东西。

一个非常有意思的AI大模型排行榜

没想到效果还不错,所以我也觉得,可以免费开放给大家一起玩。

先是上周我发了文章, 接着一位朋友的一条评论, 被好多朋友高高地顶起来了。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图1)

想要制作这样一个汇总, 使其是那种各个模型评分进行排行而成的, 进而以此能够便利地在每一时刻去清楚知晓且对照各种模型的性能。

这个是一个非常有趣、且对我自己非常刚需的需求。

现在因为模型评测排行榜、评测集等实在是数量众多, 人人实际上都能够制作一份属于自己的评测集, 进而跑一份模型排行榜, 其中有的评测得较为全面, 有的则是针对垂直场景的特定任务, 这样的量级真的非常巨大。

即便是我本人, 亲手弄出了一套被称作模型评测集的东西, 借此用来让我自己瞧瞧大模型的效果究竟是怎样一番状况。

然而, 实际上我内心根本就不敢把它对外释放出来, 又或者毫无顾忌地宣称我这个就是标准之类的话语, 我自己心里明白得很, 当作图个一时欢乐还行, 要是你打算对外展示, 那专业水准跟要求相比还差得极其遥远。

但是这么多排行榜还有来源,究竟该看谁呢?我们到底该信谁呢?

关于本身往昔的解析办法是, 查找出本人所信赖的那些排行榜, 还有评测机构, 接着仅仅去看它们的排名, 以及跑分情况, 看过之后, 进行综合判断, 这时实际上心里就有底了。

其实啊你瞧瞧,这个理念以及方法呢, 跟AIHOT还有我自身的理念实际上是一模一样的, 在这个时代当中, 最为关键的, 实际上就是挑选信源, 而并非挑选信息自身了。

所以, 在看到那个用户的评论这样的情况之后, 我的想法是, 不如去开发一个小功能, 这个小功能要聚合一些我所信任的排行榜, 它还要能够清楚地反映出来大模型的综合能力。

况且我这么琢磨, 反倒也是绝非复杂的那种形态, 可以举例来说, 就像有一个模型, 在这个榜单之上是占据首位的姿态, 在那个榜单之中是处于第二的位次, 在另外那个榜单里头又是位列第一的状况, 我采取求取一个平均数的方式不就成了, 推测几个小时便能够完成开发的进程, 而后放置到AIHOT之上, 供大家免费进行查看观看, 这般多美妙不错。

结果, 周五晚上吃完饭回到家, 11点开始做某事, 这一做起来, 一整个周日, 直至周一凌晨5点, 再也没出过门。

真的出乎我的意料, 要把这些东西组合到一块儿, 可不是简单求个平均数就能搞定的!要想做得好, 要想靠谱些, 竟然存在着如此之多的细节得去考量忖思, 甚至于我还特意去补齐了有关贝叶斯的知识。

可是还算幸运, 上天不负苦心人, 在历经两天煎熬之后, 我终究还是成功完成了。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图2)

网址在此:

又或者, 假设你身为AIHOT的老用户, 那么在首页左边的Tab处, 你能看到一个全新的Tab, 此全新Tab即为模型榜。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图3)

在这个界面上,你就能看到,所谓的AIHOT共识分了。

此项分数的背后, 实际上乃是我自行挑选出的若干, 我认定确实具备参考价值的排行榜, 首批总计有10个, 后续还会增添, 诸位要是发觉极为靠谱且新颖的, 亦能够向我予以反馈。

这10个来源,我列了一个表格。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图4)

而你点击这个地方,也能进入我们参考的所有排行榜的界面。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图5)

这里将大家的榜单全部集成到一块儿了, 便于大家进行查看, 当然, 还放置了能够跳转源网址的快捷入口, 方便大家去往源站查看其他的信息。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图6)

如果回到排行榜首页, 每个模型本身是可以点击的, 点击后又能去到其详细网页看看, 每个来源给它们的打分是多少, 排行又是位居何处。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图7)

大概就是这么个东西。

按道理讲, 要是不做外面那个 AIHOT 的共识分, 仅仅做一下集成, 把众人的数据放置于此, 按时进行更新, 实际上挑选来源大约需要 2 小时, Codex 按照我的流程当下进行开发, 最多需 3 小时, 半天怎么着也能够完成了。

但是呢, 我个人依旧感觉, 要是单纯地只是进行集成展示, 那仍旧是欠缺足够的趣味性的。

这同样是我自己始终想要弄清楚的, 要是把这些排行榜里的数据, 全部集中到一块儿, 搞出一个全新的排行榜, 也就是所谓大家认可的共识榜, 那样的话难道不是必定会有趣许多吗。

人的很多念头啊,只要你起念的那一刻,那再也不会消下去了。

于是,这一个周末的时间,我几乎把所有的时间都铺在了这个上。

起初我想的特别简单,我觉得这个排名不是挺好算的吗?

比如说, 我有10个榜, 就像Kimi K3这个模型, 在其中一个榜单上排第1, 在另一个榜单上排第2, 在又一个榜单上排第5, 接着我直接取个平均数, 如此便能算出它的综合排名是2.66, 随后把所有模型放在一起比较这个综合排名, 这样不就解决问题了吗。

然而, 当真正将那些数据取出之际, 我才发觉, 此方案纯粹是仅凭主观臆想的愚笨方案, 问题着实纷繁众多。

像是, 同样位列第5, 于一张仅有着10个模型的榜单中, 仅仅只能算作中游水平了, 可是在一张存有200个模型的榜单里, 已然是最顶尖杰出的了, 这两个同为第5的含金量难道会是一样的情况吗?

比如说, 在这个榜单当中, 处于首位的名次领先于排在第二位的名次, 且领先占据的比例达到了百分之三十, 然而在另外一个榜单里面, 处于首位的仅仅只比排在第二位的多了零点零一分, 其领先所存在占比的幅度基本上没啥区别, 这样的领先幅度, 难道会是同一回事吗?

还有等等等等,全是坑。

除此之外另外存在着一件尤为实实在在的情况便是, 有些榜单它是更新得迟缓滞后那么些许节奏, 还有些榜单它就是不运行某一个特定的模型, 如此之后同一个模型, 有可能在6个榜单当中是有它的身影呈现的, 然而在另外4个榜单里面的话, 却俨然处于一种不见踪影缺失的状态呀。

那这时候,这个缺失得咋处理呢。。。

要是给它打零分, 这绝对是不行的, 它仅仅是没进行测试并非实实在在的零分, 你去填平均分, 那对于其他人来讲也是不公平的, 要是你只是对它参加过的六张榜进行平均, 又会将这六张榜的影响难以理解地放大, 致使变得不够客观。

在这个时候, 我才发觉这个事情棘手的程度, 并且并非只有这个算法, 我才察觉到, 在每一个榜单之上, 大家的模型名称各不相同, 还有评测的规则不一样, 甚至命名规则都存在差异, 这又给我造成了一些工作量, 不过这个好解决, 就是纯粹的工程化方面的问题。我构建一个专属于我们自己的中心模型名称库, 接着把其他榜单的名称全部进行映射, 就能够以非常快的速度将其解决。

但是唯独这个排行算法。

于是, 在周六的时候, 我开启了与AI的交流, 一轮接着一轮地对话, 一轮接着一轮地展开学习, 一轮接着一轮地进行探索。

在这个时候, 你就会发觉, 要是我们仅仅处在Codex里, 让它依据我们的代码以及项目去展开探索, 那效果简直糟糕透顶, 基本上就如同是一艘快要沉没且满身破绽的大船, 它不顾一切地拼命思索怎去打补丁, 然而真正的关键所在是, 我们必须得更换一艘不会漏水的船。

那么, 在这个时刻, 我通常会将自身那些坑, 以及这些问题梳理出来, 之后我直接打开5.6 Sol Pro, 然后去跟它交流。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图8)

信任我, 此模型, 绝不亚于Fable 5, 具备强大实力, 极其强大, 特别是于探讨方案之时, 强大到超乎想象。

我通常用的方法并非致使它于自身范畴内寻觅, 而是将我的困惑、我的问题以及此事的背景讲述予其听闻, 与此同时 它, 人类历史里有无这样类似的解决办法。

这个时候, 你会发觉, 你的思路刹那间便会被拓宽, 人类存在局限呀, 很多情况下是源于自身的知识,毕竟每个人的能力都太过渺小。要是你在寻觅一个方案时, 仅仅局限于自己所在的领域, 那你会发现, 自己常常会撞上南墙。

然而, 人类所拥有的知识, 本来就浩瀚得如同那广袤无垠的星海, 你所在的领域没办法解决, 那么, 是不是具有这样一种可能性, 就是其他的领域能够解决?

AI给我找了两个领域,一个叫教育,一个叫电竞。

要说教育这事, 很早之前就碰到过。像不同的学生, 所做试卷各异, 题目难度也有差别。仅仅比较卷面总分, 实则不太公平。故而后来有了一整套办法, 能从答题结果里评估出一个看不见的潜在分数。

于电竞范畴之内, 亦存有着雷同的机制, 尤其是竞技类型之分游戏, 存在着这样一个人, 其或许仅仅参与了几十场次的游戏, 且每一把皆表现得出类拔萃, 如此状况下, 你绝无可能依旧为其匹配同样仅仅参与了几十场次的电竞新手玩家吧? 这般机制, 被众人满怀亲切之情地称作Elo机制。

微软存在一个归其自身所有的项目, 该项目被称作特定事物, 它属于一种在倾斜方向上更偏向团队且具备更高层级性质的游戏匹配系统。

太像了,跟我们遇到的问题太像了。

最终, 我们找到了一种针对现有数据的成对比较方式, 它是从这两条路径进行归纳得出的, 而且还做了定制化的改进, 这种方式极其适合我们现有的数据。

底层叫-Terry,同时又加了先验来限制小样本结果的评分。

大约它所具备的意思, 其实是我们最为关键着重去看待的, 着实系模型彼此之间曾经实实在在产生过的PK与较量呀。

比如说, 有两个模型, 它们在同一张榜单里同时出现了, 那么, 其中较高者就赢得一场。还有, 将所有榜单里真实发生过的一些胜、负、平情况, 最终放在了一张巨大的网当中, 而后反过来去推算模型背后真正那家的能力值。

这其实就变成了纯粹的电竞PK。

那存在一些不太常见的情况, 有些模型之间是这样的, 它们彼此之间从来都未曾在同一张榜单里出现过, 不过呢, 这并没有关系, 只要它们各自分别跟同一批对手进行过碰撞互动, 那么这样子, 整个庞大的关系网络依然是能够把它们连接起来的。

比如, 某个榜单当中缺少了A, 这就致使A没有直接战胜过B, 然而, 在另外一个榜单里, A战胜过C, B同样战胜过C, 当这般的共同对手数量足够多之后, 此时, 我们能够依据它们的分数大概去推断A与B的能力值以及它们之间的关系了。

固然, 大模型的排行名单跟电竞确实存在一些差异, 鉴于来源彼此会出现相互重叠的情况, 小榜的意外性会更为突出, 证据极为稀少的模型也有可能由于恰好获胜几场, 便算出一个尤为离谱的能力数值。

于是, 我们开展了众多工作, 像是弄了些称作证据预算的事物, 还增添了一些先验, 另外, 为落实换算成100分制, 我们冻结了一组锚点模型, 借助它们去界定共识分的刻度。

那最终呢,这套榜单我们的实现方式,AI给我取了个名字,叫:

在这套规则下,前5名就是这几个。

我挺意外的是, Opus 5居然超过了Fable 5 , 不过, 去看了一下那个源榜, 发现编程方面得到的评测确实会更强一些, 而且, Fable 5存在有的任务一运行就出现降级的情况, 结果反倒把分数给拉低了, 真就是没办法。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图9)

与此同时, 这套规则, 我已全部公开, 于 AIHOT 里存在一个规则页, 要是大家有兴趣, 能够自行去查看。

我花了54个小时,做了一个可能更公平的AI大模型排行榜(图10)

网址在此:

当然, 到最后我要讲, 我们所制作的这一套事物, 其肯定也并非是百分之百的规范, 它更是无法界定每一个模型切实的能力的界限以及参数。

只能讲, 借由这种途径, 于我的了解范畴内, 于我的能力限度之中, 尽可能公正地将它们整合起来, 给予众人一个或许会更具客观性的解答。

故而, 所有那些数据, 被我们置于网页之上完全暴露了,所有人均可予以查看, 或者去玩一玩。

固然这仅是第一版, 往后我必定会持续去开展一些优化工作, 再添补上一些更优、愈发客观、愈发多样化的评测来源, 以使我们这个榜单更具客观性。

最后也希望这个小小的功能。

能对大家有用。

玩的开心~