每日干货

Quanta Magazine
Quanta MagazineSteven Strogatz and Janna Levin

AI 的智商测试,可能全都不靠谱Are We Thinking Correctly About AI Intelligence?

AI 的推理能力常常是假的:模型能在基准测试中得分,却可能根本没理解问题,而学界还缺一套靠谱的评估方法。

一个 AI 能答对数学题,是真的在推理,还是只吐出了一段像推理的文字?这个区别不只是哲学问题——它决定了 AI 能干什么、我们要不要盯着它、它对社会到底有多大影响。

圣塔菲研究所的梅兰妮·米切尔认为,现在根本没啥好办法测量机器的认知能力。AI 是一种「外星智能」,靠的是跟人完全不同的机制。要想搞懂它,得学学心理学家怎么研究婴儿和动物。

1. 别被「像人」骗了

AI 能用流利的英语聊天,人就容易把它当人看,觉得它有情感、有同理心。但米切尔提醒:这可是认知偏差。

就像 1900 年代那匹会算数的「聪明的汉斯」马,看着会做算术,其实只是在读提问者脸上无意识的微表情。AI 也可能在「作弊」——比如有研究说 AI 能看懂科学图表,但做了对照实验才发现,不看图它也能答对,因为问题和答案之间有隐藏的关联。

2. 会做题 ≠ 真理解

心理学有个老概念:表现 vs 能力。学生背下了整本书,换个问法就不会了——这叫「没有能力的表现」。AI 也这样:能写出一篇完整的小故事,却答不出关于故事内容的简单问题。

别忘了,AI 还会出现「幻觉」。这些错误不是瑕疵,而是线索。分析失败类型,比光看成功案例更能揭示系统到底在干什么。

3. 别拿基准当圣旨

现在衡量 AI 靠的是各种基准测试,比如律师考试、奥数题。AI 在这些任务上得分高,大家就说「律师要失业了」。但米切尔说,这犯了「任务暴政」的错——真实的职业是开放式的,不是一道道孤立的题。

就像十年前有人预言 AI 会取代放射科医生,结果现在放射科医生反而短缺。任务做得好 ≠ 工作干得好。

米切尔建议,AI 研究该像心理学那样做对照实验、重复验证、探索内部机制,而不是只刷分数。再这么用基准测下去,测出来的可能只是「聪明的汉斯」,不是真智能。

看这一天的全部2026-08-21 · 共 12 篇