每日严选
← 返回
技术NoahpinionRamez Naam2026-09-27

AI自己造自己?数据说还差5到10倍Where’s the “intelligence explosion”?

一个前沿实验室内部数据显示,AI独立完成研究任务的时长约为15分钟,而基准测试和预测给出的数字是4到11小时。

「递归自我改进」这个词说的是:AI聪明到能造出一个比自己更聪明的版本,然后下一代再造下一代,几轮之后就变成远超人类的东西。科幻小说里管这个叫「起飞」。

未来学家 Ramez Naam 写了篇长文给这股兴奋劲泼水。他的结论是:按照目前能量到的数据,这个自我改进的循环得再强5到10倍,才可能自己转起来。

纸面能力,和实验室里的真实进度

METR 有一张被叫做「AI 最重要的一张图」的曲线,测的是模型能独立干完多长的编程任务。按这张图,最好的模型能搞定人类要花三小时的活。

但 OpenAI 自己的内部报告说,在真正的研究任务上,能让模型独立完成的活儿,人类大概15分钟就干完。而且这已经算表现好的情况。

换句话说,公开曲线和实验室里发生的事,差了十几到几十倍。作者认为对外部预测的信任要打折扣。

投入涨了124倍,产出只涨一点

更奇怪的是内部投入的数字。OpenAI 的研究员人均用的 token 是过去的124倍,工程师人均写的代码是过去的7倍。听着很吓人。

但人均跑的试验次数只涨了1.6倍。而试验次数才是真正可能带来发现的东西。

Anthropic 估得更直白:想让全公司的研究进度翻倍,AI 得把员工效率提高大约40倍,而不是现在的4倍。

好点子越挖越少

为什么加码不一定管用?作者打了个摘苹果的比方:AI 能飞快摘走低处的果子,但一个人摘完了,再派一百个同样的 AI 去,也只是重复摘已经空了的枝。

数学这类能自动验证对错的领域确实已经出现超越人类的水平,比如最近有模型给出了纳维-斯托克斯方程的存在性证明。

但开放式研究是另一回事。Anthropic 自己承认,模型在开放式研究上倾向于做小的增量尝试,回避大胆假设;在生物题上它会照抄论文,想不出新方向。

作者最后说:起飞也许会发生,但得先有人拿出证据,证明那个循环真的在变强。到目前,证据还没出现。

为什么值得读

「AI 能不能自己加速自己」决定的不只是技术路线,还有钱往哪投:如果循环需要5到10倍的补强才成立,那么今天按「马上起飞」定价的算力和估值,预支的是一个尚未被数据支持的时间表。

分享到
阅读原文NoahpinionWhere’s the “intelligence explosion”?

你可能还想读

每天 5 篇真正值得读的文章

从全球优质信息源中筛选,几分钟了解当天最值得关注的观点。

每日严选

每天 5 篇真正值得读的文章

从全球优质信息源中筛选,几分钟了解当天最值得关注的观点。