一个前沿实验室内部数据显示,AI独立完成研究任务的时长约为15分钟,而基准测试和预测给出的数字是4到11小时。

「递归自我改进」这个词说的是:AI聪明到能造出一个比自己更聪明的版本,然后下一代再造下一代,几轮之后就变成远超人类的东西。科幻小说里管这个叫「起飞」。
未来学家 Ramez Naam 写了篇长文给这股兴奋劲泼水。他的结论是:按照目前能量到的数据,这个自我改进的循环得再强5到10倍,才可能自己转起来。
纸面能力,和实验室里的真实进度
METR 有一张被叫做「AI 最重要的一张图」的曲线,测的是模型能独立干完多长的编程任务。按这张图,最好的模型能搞定人类要花三小时的活。
但 OpenAI 自己的内部报告说,在真正的研究任务上,能让模型独立完成的活儿,人类大概15分钟就干完。而且这已经算表现好的情况。
换句话说,公开曲线和实验室里发生的事,差了十几到几十倍。作者认为对外部预测的信任要打折扣。
投入涨了124倍,产出只涨一点
更奇怪的是内部投入的数字。OpenAI 的研究员人均用的 token 是过去的124倍,工程师人均写的代码是过去的7倍。听着很吓人。
但人均跑的试验次数只涨了1.6倍。而试验次数才是真正可能带来发现的东西。
Anthropic 估得更直白:想让全公司的研究进度翻倍,AI 得把员工效率提高大约40倍,而不是现在的4倍。
好点子越挖越少
为什么加码不一定管用?作者打了个摘苹果的比方:AI 能飞快摘走低处的果子,但一个人摘完了,再派一百个同样的 AI 去,也只是重复摘已经空了的枝。
数学这类能自动验证对错的领域确实已经出现超越人类的水平,比如最近有模型给出了纳维-斯托克斯方程的存在性证明。
但开放式研究是另一回事。Anthropic 自己承认,模型在开放式研究上倾向于做小的增量尝试,回避大胆假设;在生物题上它会照抄论文,想不出新方向。
作者最后说:起飞也许会发生,但得先有人拿出证据,证明那个循环真的在变强。到目前,证据还没出现。
为什么值得读
「AI 能不能自己加速自己」决定的不只是技术路线,还有钱往哪投:如果循环需要5到10倍的补强才成立,那么今天按「马上起飞」定价的算力和估值,预支的是一个尚未被数据支持的时间表。
从全球优质信息源中筛选,几分钟了解当天最值得关注的观点。