news 2026/10/9 6:15:59

深度 | OpenAI 甩出 722 篇数学论文,但黎曼猜想并没有被证明

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
深度 | OpenAI 甩出 722 篇数学论文,但黎曼猜想并没有被证明

深度 | OpenAI 甩出 722 篇数学论文,但黎曼猜想并没有被证明

OpenAI 这次放出的东西,规模大到让「读」这件事本身成了问题:722 篇手稿、372 个成果族、横跨 17 个数学方向,全部塞进github.com/openai/math一个仓库。但翻完最受关注的那几篇,你会发现一个更值得说的事:被喊得最响的「黎曼、霍奇、BSD 全上阵」,一个都没被真正证明。

上图:github.com/openai/math 仓库页面截图,2026-10-08 —— 本文所有篇数与编号均可在此仓库核对(图注日期为抓取日,仓库内容以访问时为准)。

中文媒体的标题先给这件事定了调。量子位写「黎曼霍奇BSD全上阵」,新智元跟着起哄,还有一家直接写成「准黎曼猜想已被证明」。机器之心、今日头条、投中网这三家则老实得多,标题里老老实实写着「准黎曼猜想」。这一个「准」字的差别,就是整场风波的全部。

那个「准」字,才是关键

先说被传得最神的那条。OpenAI 声称证明了:黎曼 zeta 函数和所有狄利克雷 L 函数,在 Re(s) > 7/8 的右半平面里没有零点,编号 F003,据说已经用 Lean 4 形式化;另有一篇独立证明给了更弱的 Re(s) > 11/12 版本,顺带排除了 Landau–Siegel 零点,那篇经过人工编辑重写。

而黎曼猜想要的是 Re(s) > 1/2,整条临界带。7/8 离 1/2 隔着好大一段,最难啃的区域一点没碰。所以这条结果即便全对,也只是朝黎曼猜想迈了一步。罗格斯大学的 Alex Kontorovich 在 X 上那句「如果是人做的,这就是即时菲尔兹奖」,恰恰是从反面说明问题:这个「准」字里藏着的份量,全压在一条弱化版上。

BSD 是「条件版」。F002 声称对 Selmer 群余秩 0 或 1 的椭圆曲线证明了完整的 leading-term 公式,连 Tate–Shafarevich 群有限性都包进去了;F006 则声称证明了二次扭曲下的 Goldfeld 猜想。两者一拼,覆盖的是「每个有理椭圆曲线里密度为一的那批二次扭曲」,不是任意椭圆曲线,所以完整 BSD 依旧开着,而且这两篇都没形式化。

霍奇更直接:OpenAI 证的是 CM 阿贝尔簇和 K3 曲面乘积上的有理霍奇猜想,F032,未形式化。CM 阿贝尔簇是一类对称性极高的特殊对象,离「任意光滑射影簇」的完整霍奇猜想,隔得还很远。上图:三大「全上阵」的猜想,实际证到的都是更窄、更弱的版本。

反倒是一些名气小得多的结果更值得信。机器之心和 36氪挑出的「最重 30 道名题」里,有 L=RL=BPL、唯一博弈猜想、有理数域上的希尔伯特第十问题,还有「π 的无理性测度等于 2」「卡塔兰常数是无理数」这种小而硬、且已经 Lean 形式化的结论。它们的话题性远不如黎曼霍奇,但形式化完整、容易核对,可信度反而最高。

722 篇是怎么来的,又怎么算「合格」

这批手稿都出自一个没发布、没名字的内部模型。它被投喂了约 4000 个开放问题,平均每个保留下来的结果花约 3 小时 ChatGPT Pro 级别的「思考」算力。产出之后,OpenAI 给它们的「合格证」分了档:仓库里的formalization.yaml列了 162 篇主结果经过 Lean 形式化,按成果族算约六成附了 Lean 说明页。

但几个最抓眼球的,恰好都不在形式化名单里:BSD 的 F002/F006、CM 霍奇的 F032、4D 挂谷的 F074、希尔伯特第十问题的 F004。OpenAI 自己也承认,未形式化的结果「可能包含错误」,只能算「声称」。

这里有个容易被忽略的边界:Lean 只证明「我证的那个命题成立」,不证明「那个命题就是你嘴里那个著名猜想」。机器核对的是推理内部一致,核对不了命题和原开放问题是不是一回事,这步还是得人来。所以「Lean 通过」不等于「问题解决」,尤其当模型可能把命题悄悄改弱的时候。

至于独立验证,答案是零:722 篇没有一篇经过正式同行评审,仓库关了 Issues、PR 只对协作者开放,外部没有公开质疑的入口。数学界被要求接住的,是一份七百多篇、大半未经机器校验、全部未经人工评审的「声称包」。

上图:从「声称」到「定理」,中间隔着一整条还没走完的验证链。

数学界为什么没有欢呼,只有联名信

一个月前的那桩前科,把这次的信任提前透支了。9 月 8 日,OpenAI 宣布内部模型「解决」了 Navier–Stokes 千禧年难题,约一万个智能体跑了 88 小时,结果被指出只解决了带外力的版本;克雷数学研究所没发奖,OpenAI 自己还拒领了那 100 万美元。NYU 的 Tristan Buckmaster 公开质疑 OpenAI「截胡」了他和 Anthropic 研究员 Levent Alpöge 近一年的未发表成果,OpenAI 否认。Terence Tao 把这场竞赛说成「狂热的竞争」,担心数学研究被逼进私人公司的黑箱。

带着这段前科看 722,数学界的反应就不难理解了。陶哲轩发起的公开信《人工智能在数学中的严重错位》,9 月 11 日由 25 位菲尔兹奖得主联署,邓煜、Peter Scholze 在首批,到 9 月 12 日约 2500 名学者署名。陶哲轩的比喻是把未经核验的 AI 结果批量倒出来,等于「把生肉尸骸倒在村庄公共餐桌上」;哈佛的 Curtis McMullen 则把 OpenAI 说成「发现登山者营地后,空投机械登山者抢先登顶」的人。

最克制的评价来自 MIT 的 Andrew Sutherland:在模型发布、可复现之前,这些都该视为「未验证」。挂靠普林斯顿高等研究院的 AGMAI 咨询组(成员有 Gowers、De Lellis、Hairer、Witten)给这场发布定的调是「理解的开始,而非完成」,还建议 OpenAI 停止用前沿难题给私有模型当基准,OpenAI 没听。

上图:一个月内,从单点突破到批量放出,数学界的警惕是逐步升级的。

这件事对 AI4S 意味着什么

把 722 篇放进 AI 做数学的谱系里,位置很清楚。2024 年 DeepMind 的 AlphaProof + AlphaGeometry 拿下 IMO 银牌,证明 AI 能「做对题」;今年 8 月 OpenAI 的「十道数学开放问题」只交 10 题,但每题附完整 Lean 4 证书、单题成本约 200 美元。10 月的 722 篇,是同一个策略的规模化:从「10 题加完整证书」,变成「722 篇加约六成形式化、大量未核验」。

这里藏着一个产业级的转折。AI 把「提出一个候选证明」的成本压到了 3 小时算力一个,但「判断它对不对」的成本一点没降,反而因为供给爆炸变得更稀缺。我判断,未来几年 AI-for-Math 的胜负手不在「谁的模型证得更多」,而在「谁能建立一套让数学界愿意信的验证机制」。Lean 形式化只是半套,剩下的半套(命题对应、独立复核、可复现),OpenAI 至今没交。

这条线对国内也有映射。北京 7 月印发的《AI4S 十八条》圈定了高能物理、材料、生命科学等六大领域,鼓励的是「AI 做实验、做发现」的实验范式;OpenAI 展示的是「AI 做纯数学证明」的证明范式。两条腿里,数学恰好是「可验证性」最弱的那条,这也解释了 722 的争议为什么能爆到这个程度:没有一个「跑个实验就能复现」的出口,一切都要回到逐行读证明的人。

至于那个「未发布模型」的策略,动机值得拆:不开放权重、不公开名称,却把成果全摊出来,一边用结果给模型做能力营销,一边用热度招人,再把验证成本转嫁给整个数学界。The Next Web 的标题点得最准:722 篇论文,来自一个它不肯发布的模型。

上图:AI-for-Math 的竞争重心,正在从「能不能证」转向「能不能被信」。

一个月前,我还觉得「AI 攻克千禧难题」至少得等上几年,结果 OpenAI 一下就把话题顶到了「黎曼猜想」的高度。但拆开看,这次真正被打穿的其实不是数学本身,而是证明的生产与验证分工:产出爆炸了,验证的人力一点没变多。看这类新闻,我给自己定了三问:它证的是不是完整版、有没有机器形式化、有没有人独立验过。三个里有一个是「否」,就该标成「声称」,而不是「定理」。


参考来源

  1. OpenAI Math — GitHub 官方仓库(一手)
  2. The most interesting mathematical discoveries in OpenAI’s 722 new papers — New Scientist
  3. OpenAI maths release: 722 papers from a model it has not released — The Next Web
  4. 突发!OpenAI一次放出722篇数学成果,准黎曼猜想、4D挂谷都在列 — 机器之心
  5. 翻完OpenAI的722篇数学手稿,我们挑出了最重的30道名题 — 36氪
  6. How an AI math breakthrough ignited a controversy — Science
  7. 陶哲轩、邓煜等25位菲尔兹奖得主联名示警 — 知乎专栏
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/9 6:15:49

医疗实体识别课程设计:从词典匹配到CRF的完整实践路线

简介:一套面向医疗文本信息抽取的完整项目,基于Python与Jupyter构建,聚焦医疗实体识别模型的训练与语料标注,适用于期末大作业、课程设计及毕业设计。内置疾病、症状、身体部位三类词典,疾病词典整合互联网爬取数据与I…

作者头像 李华
网站建设 2026/10/9 6:15:48

DNS流量异常检测:基于行为建模的僵尸网络识别方法

简介:本资源是一套面向网络安全研究人员与机器学习实践者的DNS流量异常检测实战方案,聚焦僵尸网络识别这一关键防御场景,融合特征工程、传统机器学习与深度学习建模全流程。压缩包共27个文件,含15个核心Python源码(如D…

作者头像 李华
网站建设 2026/10/9 6:15:35

数据链路层帧格式详解:以太网、VLAN Tag与PPP协议实战解析

1. 数据链路层到底在干什么——三个绕不开的基本功能拿到“数据链路层数据帧格式”这个标题,很多刚入门的朋友第一反应是去背帧结构图:前导码、目的MAC、源MAC、类型、数据、FCS……背完就忘。我做了这么多年网络相关的工作,最大的体会是&…

作者头像 李华
网站建设 2026/10/9 6:14:52

基于Spring Boot和微信小程序的扶贫助农系统全栈实战解析

这套基于Spring Boot和微信小程序的扶贫助农系统,是我最近从需求梳理、数据库建表、后端接口开发再到小程序前端联调完整跑下来的一套全栈项目。它面向的是农产品帮扶销售这个场景,整体并不复杂,但胜在链路完整:用户通过小程序浏览…

作者头像 李华
网站建设 2026/10/9 6:14:18

RESTful API设计规范与最佳实践:后端开发实战指南

做后端开发这些年,我见过太多团队在 RESTful API 设计上栽跟头。有的接口文档写得跟天书一样,参数用拼音缩写,状态码永远返回 200;有的把 GET /getUserList 这种 RPC 风格的 URL 叫做 RESTful,上线三个月就改不动了。R…

作者头像 李华
网站建设 2026/10/9 6:14:14

从单机到K8s:高并发架构的8级演进复盘

我见过太多团队在流量翻倍的时候手忙脚乱,也见过不少架构师把“高并发”挂在嘴边,但真正追问下去,发现连第一层瓶颈都没找准。说句实在话,高并发架构不是什么玄学,它是一条被无数业务验证过的演进路径——从单机到集群…

作者头像 李华