前沿模型已经能在密码破译、文本溯源上做出真结果,但作者发现瓶颈不在模型智商,而在档案库愿不愿意开门。

作者是研究科学史的,平时最头疼的事是辨认古人手稿里的潦草字迹。这次他拿 GPT-6 和 Opus 5.5 试着做一件更大胆的事:让模型去「解决」一些历史学上悬而未决的老问题。
什么样的历史问题,AI 才啃得动
作者列出几个条件。这个问题得是专家们公认需要解答的;相关资料得已经全部数字化、能免费下载;还得用得上模型的强项,比如多语言推理、数学、和在大批文件里自己翻找。最后也最要紧的一条:这个答案必须能被明确地证明是对还是错。
数学之所以被模型拿下,就是因为定理能验证。历史学大部分争论是解释和立场,没有标准答案,所以进展慢得多。剩下能啃的,基本就集中在密码破译、跨语言溯源、把散落在各个小领域里的发现串起来这三类。
它真的做出了新东西
一个例子是 1941 年一封德军密电。模型破译的关键不是密码学本身,而是它自己翻到了德国联邦档案馆一条关于新增电报集的说明,然后把这些信息拼了起来。作者说,连人类专家都没完全看懂它是怎么做到的。
另一个例子更具体。Opus 5.5 从哈特利布档案里下载五千多份原始文件,认出牛顿和哈特利布用了不同的字谜来指同一种炼金材料——匈牙利胆矾。牛顿那份是真字谜,字母重排;哈特利布那份几乎是倒着写。这可能是个新发现,够得上发表。
还有一次,模型解出两封 16 世纪西班牙密信,结果一查,一封在 1530 年代就被人解出来了,另一封 1916 年也解过。作者说这正好说明,没有专业知识,很容易把一百多年前学者的活重做一遍。
真正的堵点不是算力
作者反复讲一件事:这些模型能出成果,是因为有海量志愿者把这些老档案转录、扫描、免费放到了网上。他在测试里最常撞到的墙,就是资料要么没数字化,要么数字化了但只有特批的人能看。
所以他呼吁 AI 实验室和基金会掏钱办三件事:让图书馆和档案馆合作,把没上网的手稿扫上去免费开放;给历史学者免费的算力和接口;让历史学家像数学家那样,一起列一份「千年难题」清单。
他自己在问卷里问同行:你觉得哪些历史悬案值得让 AI 试一把。
作者也不装糊涂。他说让 AI 代写、代想,确实会让人懒得动脑。但用它去问出一个人一辈子读不完的问题,是另一回事。
为什么值得读
同样的模型放在不同领域,效果差得离谱,差别不在聪明程度,而在那个领域有没有「正确答案」这种裁判。这件事真正在提醒的是:档案开不开放,可能比模型升不升级更决定历史研究能走多远。
从全球优质信息源中筛选,几分钟了解当天最值得关注的观点。