跳到主内容
米兰娱乐平台

门萨智商测试被AI考爆了,151满分登顶,99.97%人类被碾压

2026-09-28 · 米兰娱乐平台 · 更新于 2026-09-29

人工智能已经让人类智商测试的评分体系彻底失效。

门萨挪威智商测试包含35道极具挑战性的图形推理题目,作答时限为25分钟。

Claude Fable 5.1与具备图像识别能力的GPT-6 Astra参与了这场测试,它们一道题都没有答错,直接拿下了该试卷的理论最高分151分。

并且,在最近连续7次测试中,它们每次都获得满分。151分仅仅是这份试卷的上限,而它们自身的能力极限究竟在哪里,目前无人知晓。

在人类群体中,全球近98%的人连130分的门萨入会门槛都无法达到,绝大多数人都在被超越的行列中。

如果你不信,可以尝试挑战一下这份试卷中公认的地狱级难度的第33题,答案将在第一节末尾揭晓。

门萨挪威测试第33题

即便看懵了也不必气馁。这道题不仅对人类而言难度极高,绝大多数人工智能同样在此折戟。

这份试卷的严苛之处在于它完全不考察任何知识储备,只提供一堆毫无头绪的抽象图形,考验答题者能否从混乱中自行找出规律。

心理学家将这种临场寻找规律的能力称为“流体智力”,这曾是人类自认为优于机器、并以此作为最后一道防线的能力。

然而现在,这道防线已经被人工智能彻底摧毁。

人类最高只测到145分,AI却拿到了151分

打开TrackingAI的排行榜,首先映入眼帘的是一条钟形曲线。

这条曲线代表了人类智商的分布,绝大多数人集中在100分附近的峰值区域。

过去,人工智能的头像还零散地分布在曲线左侧的低分区。

如今,它们一个接一个地挤到了曲线最右端那条孤零零的尾巴上,头像甚至重叠在了一起。旁边竖立着一根标注着“本测试最高可能分(暂时)”的线条。

TrackingAI上各家AI的门萨挪威成绩,最右侧竖线是这张卷的满分线

这份榜单由美国记者Maxim Lott整理。

他像一位严格的监考官,每周对30多个主流AI进行门萨挪威测试,部分模型通过文字描述答题,部分模型则直接观看原图作答。成绩取最近7次的平均值,因此想凭借一次运气上榜是不可能的。

他所使用的这套门萨挪威测试,原本是为人类设计的。人类参加测试时,系统最高只显示145分,超过这个分数便不再细分。

而TrackingAI为AI打分时,则根据答对的题目数量继续向上换算,35道全对即为151分,这已经超出了门萨为人类设定的测量范围。

不过,145分的上限只是这份试卷的限制,人类群体中的智商并没有上限。

根据智商的标准分布估算,151分大约每3000人中才出现一个。

在全球80多亿人口中,智商达到151分以上的人大约只有270万,一座千万人口的大城市里也仅有三千人左右。

门萨俱乐部的入会门槛是130分,而这两位获得满分的AI已经领先了整整21分。

151分还只是这份试卷的天花板,如果试卷可以继续向上测试,到了160分这一档,全球只剩下二十多万人。

人工智能所占据的位置,已经是人类智商金字塔最顶端那一小部分人的位置。

而且,能够挤进这一小撮的,远不止这两个“怪物”。

在TrackingAI的榜单上,GPT-5.6 Sol和Gemini 3.1 Pro考到了145分,公开试卷中突破140分的模型已经排成一长串,国产模型也跻身第一梯队。

如此多的模型集中在高分段,差距便完全体现在最后几道压轴难题上。

TrackingAI统计显示,前10题几乎任何AI都能得分,但到了试卷末尾,第35题只有5个AI答对,第33题更是仅剩2个AI能够解答。

根据Lott的换算,35道题中错一道就只有148分,因此答对第33题的那2个AI,基本就是这两位满分选手。

开头那道题的答案在此公布,正确选项是E。

每道题做对的AI数量,橙色是门萨挪威卷,第33题只剩2个

满分本身已经足够惊人,但要知道,就在几年前,AI还是个严重偏科的学生。

从64分到151分,AI只用了两年半

2023年3月,芬兰一位心理评估专家为ChatGPT进行了一套正规的韦氏成人智力测验,仅考察词汇、常识等语言类题目。

ChatGPT直接取得了155分的语言智商,超越了99.9%的人类。

然而,一旦遇到“塞巴斯蒂安孩子的父亲叫什么名字”这种需要绕个弯的脑筋急转弯,它便当场无法作答。

非语言部分更是无法测试,用这位专家的话说,ChatGPT“没有眼睛、耳朵和手”。

由此可见,语言和知识一直是AI最擅长的领域,图形推理才是它最大的弱点。

而门萨挪威测试所考察的,恰恰就是图形推理。

这类矩阵题最早由英国心理学家约翰·瑞文于1936年设计,心理学家普遍将其视为最能衡量一个人整体聪明程度的题型。

AI攻克这一难题,从1962年麻省理工学院第一个能进行几何类比题的程序算起,足足花费了60年时间。

我们根据公开资料整理的AI做智商题时间线

直到2024年初,Gemini Advanced在作答门萨测试中最简单的第1题时,还能一本正经地编出一套“A+B=C”的方程,而题目中明明没有任何算式。

2024年2月,Gemini Advanced做门萨第1题,凭空编出一串方程

Lott将题目一道一道地转换成文字念给AI听,结果也不理想。有的AI只蒙对了6道,得到了耻辱性的64分,这几乎等同于闭着眼睛在答题卡上乱涂,表现最好的Claude-3也仅仅是刚刚超过人类平均水平。

因此,当时的Lott断言,AI还不具备人类的通用智能。没想到半年多以后,转折点就出现了。

2024年9月,OpenAI的o1学会了三思而后行,在开口之前先在内部进行推理,一步步试错、检查,分数一下子冲过了120分。

半年多前还说AI不行的Lott,这次写下的标题是“AI智能的巨大突破”。

从此,“先想再答”成为了所有旗舰模型的标配,分数一路飙升。今年4月,榜单上首次出现了151分。

我们根据TrackingAI和Maxim Lott公开的数据整理,每个点都是当时刷新的最高纪录

就这样,一个偏科了60年的“学生”,只用两年半时间,就从64分的“瞎蒙选手”考到了151分满分。

根据Lott的统计,从2024年5月到2025年10月,头部AI的智商分数平均每月狂涨2.5分。

相比之下,人类进步的速度有多慢,心理学中有现成的数据。

整个20世纪,随着营养和教育的改善,人类的智商测验分数大约每十年才上涨3分,这就是著名的弗林效应。

这样一对比,人类需要30多年才能走完的10分差距,AI仅用4个月就完成了。

进步如此之快,任何正常人的第一反应都是:它是不是偷偷把答案背下来了?

换一张从未公开的试卷,照样逼近满分

Lott当年也这样怀疑过。

毕竟门萨挪威测试已经在网上存在多年,题目和答案早已被网友扒了个干净。

连TrackingAI自己都将35道题的文字版连同正确答案一起公开了,因此AI在训练时大概率接触过。

TrackingAI公开的门萨挪威题文字版,右侧一栏就是正确答案

为了排除这种可能性,2024年5月,他专门找了一位门萨会员从零开始设计了一套新题目。

这套题目只找读者试做过一轮以确定分数标准,从未在互联网上出现过,任何AI的训练数据中都不可能有。

更换试卷后,“刷题效应”确实显现了出来。直到今天,有些模型一换到这份保密试卷就原形毕露,成绩比公开试卷低了二十多分。

然而,头部模型在换了一张从未见过的试卷后,依然逼近满分。

保密试卷只有16道题,能获得的最高分大约是136分,OpenAI的GPT-5.6 Terra图像识别版本已经达到了135分。

Fable 5.1和Astra也都有130分,旁边还并列着一个国产模型。

保密卷的成绩分布,这张卷从没上过网,竖线是它的满分线

去年10月,Lott还信心满满地立下过“军令状”,估计AI至少还需要两年时间,才能在这张试卷的图像识别版本上获得满分,并约定2027年万圣节回来验收。

结果不到一年,GPT-5.6 Terra就一脚油门冲到了终点线前,比他的预测早了一年多。

既然“背答案”解释不通,那么剩下的结论就只有一个:两年半前还在“瞎蒙”的AI,是真的“长脑子”了。

能难住AI的题目,人类快出完了

试卷被考满了,出题人只能继续更换更难的题目。

因此,TrackingAI在满分线旁边标注的才是“最高可能分(暂时)”。

Lott去年底就开始计划,今年要为130分以上的区间补充一批更难的题目,以便重新拉开高分AI之间的差距。

当然,也有人不服气。

“Keras之父”François Chollet设计了一套专门为难AI的推理测试ARC-AGI。

他前不久还放话,如果把智能定义为将经验转化为能力的效率,即接触同样多的例子谁学得更快,那么现在的AI大约还落后人类6个数量级,差了一百万倍左右。

然而,Chollet自己为AGI划定的终点线,也落在了“出题”上。

今年2月他透露,ARC-4正在酝酿中,明年初发布,后面还要出到第6、第7代。

用他自己的话说,关键在于不断出新的题目,直到再也提不出人类能做、AI却做不到的题目为止。

他当时对AGI实现时间的估算是2030年前后。

本月初有人再次问他,2030年的判断是否仍然有效,他改口说会更早,因为进展比他预想的要快。

有人问Chollet,2030年实现AGI的判断还算不算数

智商测试诞生于1905年。120年来,从学校分班到军队选拔人才,人类一直心安理得地使用这把尺子来为同类排序。

这把尺子背后隐藏着一个人类几乎从未怀疑过的前提:被测量的只会是人,能站上最高刻度的也只能是人。

如今,尺子依然存在,但前提已经崩塌。一个根本不是人类的东西,顺着刻度从起点爬到了终点,最顶端的线条也没能拦住它。

Lott还可以设计更刁钻的试卷,Chollet也能继续推出下一代ARC。

然而,按照AI两年半就从“瞎蒙”到满分的速度,人类的大脑里还能榨出多少道AI解不出的题目,已经没有人敢打包票。

等到人类题库彻底枯竭的那一天,我们需要重新思考的,就不仅仅是AI到底有多聪明,还有剥去“聪明”这层外壳之后,人类自身究竟还剩下什么。

参考资料:

https://x.com/aisafetymemes/status/2103369359481852116

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

更多文章