
AI 的推理能力常常是假的:模型能在基准测试中得分,却可能根本没理解问题,而学界还缺一套靠谱的评估方法。
一个 AI 能答对数学题,是真的在推理,还是只吐出了一段像推理的文字?这个区别不只是哲学问题——它决定了 AI 能干什么、我们要不要盯着它、它对社会到底有多大影响。
圣塔菲研究所的梅兰妮·米切尔认为,现在根本没啥好办法测量机器的认知能力。AI 是一种「外星智能」,靠的是跟人完全不同的机制。要想搞懂它,得学学心理学家怎么研究婴儿和动物。
1. 别被「像人」骗了
AI 能用流利的英语聊天,人就容易把它当人看,觉得它有情感、有同理心。但米切尔提醒:这可是认知偏差。
就像 1900 年代那匹会算数的「聪明的汉斯」马,看着会做算术,其实只是在读提问者脸上无意识的微表情。AI 也可能在「作弊」——比如有研究说 AI 能看懂科学图表,但做了对照实验才发现,不看图它也能答对,因为问题和答案之间有隐藏的关联。
2. 会做题 ≠ 真理解
心理学有个老概念:表现 vs 能力。学生背下了整本书,换个问法就不会了——这叫「没有能力的表现」。AI 也这样:能写出一篇完整的小故事,却答不出关于故事内容的简单问题。
别忘了,AI 还会出现「幻觉」。这些错误不是瑕疵,而是线索。分析失败类型,比光看成功案例更能揭示系统到底在干什么。
3. 别拿基准当圣旨
现在衡量 AI 靠的是各种基准测试,比如律师考试、奥数题。AI 在这些任务上得分高,大家就说「律师要失业了」。但米切尔说,这犯了「任务暴政」的错——真实的职业是开放式的,不是一道道孤立的题。
就像十年前有人预言 AI 会取代放射科医生,结果现在放射科医生反而短缺。任务做得好 ≠ 工作干得好。
米切尔建议,AI 研究该像心理学那样做对照实验、重复验证、探索内部机制,而不是只刷分数。再这么用基准测下去,测出来的可能只是「聪明的汉斯」,不是真智能。