news 2026/10/8 6:52:37

OpenAI 把模型写的 722 篇数学论文搬上 GitHub,只有五分之一过了机器验证

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OpenAI 把模型写的 722 篇数学论文搬上 GitHub,只有五分之一过了机器验证

agent 产出的东西谁来验收,是我搭工作流最头疼的一环。OpenAI 昨天端出 722 篇模型写的数学论文,附一整套验收方案。

本周 Top5:Agent-Reach(+6,454)、OpenShell(+5,228)、hyperframes(+3,614)、openrig(+3,327)、openGym(+3,318)。

本期主角不在上面这张表里,它太新了,周增统计还没算到它。openai/math 创建于 10 月 6 日深夜,到本文写作时不到一天,3,615 星、320 fork,Apache-2.0 协议。仓库里是 722 篇数学手稿,出自 OpenAI 一个还没有名字、没有 API、没有定价的内部模型,按 372 个结果家族组织,横跨 17 个数学分支。其中 162 篇的主结果有 Lean 形式化证明,机器能逐行核验,剩下 560 篇只有论文本身,README 原话说部分未形式化的结果可能有问题。这篇讲三件事,这条数学产线怎么跑,机器验收到底验了什么,数学社区为什么盯得这么紧。

图 openai.com 公告页官方横幅

它是什么

打开仓库先看到的是一批研究档案。preprints/ 目录下每篇论文一个文件夹,装着 PDF、LaTeX 源码和引用用的 BibTeX,论文落款日期从 9 月 10 日排到 10 月 5 日,第二天整包发布。lean/ 目录是一个 Lean 4.34.1 形式化库,另附 10 篇推理摘要 PDF,节选模型解特定题目时的思考过程,合计约两百页。整库 5.8 万个文件。

产线流程 README 写得很直白。先给模型出了约 4,000 道开放研究题,理由是原有数学评测已经考不出差距;平均每道题花约 3 小时 ChatGPT Pro 档位的思考算力;产出按显著性筛选后聚成家族,一个家族收主结果、伴生论证、推论和另证。4,000 道题出 722 篇论文,这个比例别读成解题率,筛选标准没有公开,OpenAI 自己也承认哪些结果够格是它自己判的。固定流程之外有两个例外,zeta 函数零点自由区域的工作和 CM 阿贝尔簇上的 Hodge 猜想证明;zeta 那篇 Re(s)>11/12 区域的行文还经过人工润色。

为什么有意思

机器验收只覆盖一小半,但验收方式是新的

162 篇有 Lean 形式化的论文是这批材料里唯一的硬通货。Lean 是证明助手语言,证明写成代码后由内核逐行检查,通过与否机器说了算。OpenAI 配的核验工具叫 Comparator,配置里只放行 propext、Quot.sound、Classical.choice 三个标准公理,证明不许引别的。外部评测 kingy.ai 逐条看过配置后提醒了一个关键区分,Lean 核的是形式化陈述,形式化陈述跟论文里那句话是不是一回事,仍然要人对照。好在这两者都被摊开了,每篇论文的 PDF 和对应 Lean 文件并排放着,引用条目和版本修订全部留档,改过的旧版本不删。

跑一遍验证本身是个工程活

lean/README 特意提醒,整库编译会撞上 Linux 的 vm.max_map_count 上限,建议只编小局部;要全量编译得用 -DMMAP=OFF 重编 Lean,再加一组 glibc 环境变量。换句话说,想亲手核验这批证明,先得过一道系统调优的门槛。这个细节比任何宣传语都诚实,形式化验证到今天仍然是有成本的活。

治理是这次发布的另一半

8 月 1 日 OpenAI 发过一批十大数学进展,当时数学圈火气不小,有数学家指出模型的关键论证与他 2016 年的论文撞车而发布稿没有标出处,科学美国人把研究不端写进了标题。9 月 29 日,设在高等研究院的数学与人工智能顾问组发布行为准则,要求实验室别拿数学发布当模型营销,别在专有模型上刷开放难题,发布后要出钱资助人类数学家去理解这些结果。这次 722 篇的发布被普遍读作对那份准则的照做,问题数、算力开销、推理摘要、版本制度都按建议给了,还承诺出钱办研讨班。两条没做到,产生结果的模型没放出,仓库还挂在 OpenAI 自己账下而准则希望社区托管,OpenAI 说还在找。另外这个仓库的 issue 区是关闭的,外人发现证明有问题,没有公开入口提交。

边界与局限

这批材料的可信度分三层看。最硬一层是 162 篇 Lean 主结果,机器核过,但陈述与论文的对应关系还等着人工抽查。次一层是其余 560 篇纯论文,README 明说可能有错。推理摘要只覆盖 10 个家族,372 分之 3 都不到,想看模型怎么想的,基本只能从证明文本反推。

头条级结论全部未经同行评审。π 的无理数指数恰为 2、自由群因子全部同构、有理数上的希尔伯特第十问题无解,这几个大结论都还没有 Lean 形式化。有个所有狄利克雷 L 函数在 Re(s)>7/8 无零点的结果倒是形式化了,外部给它起名叫准黎曼猜想,但它离真正的黎曼猜想还差半个平面,别读成黎曼猜想被证明。想自己跑验证的除了 mmap 那道坎,还要有版本意识,OpenAI 说在找社区托管方,这个仓库地址将来可能变。

对谁有价值

数学和理论计算机方向的研究者现在就值得深读,从 10 篇推理摘要和 162 个 Lean 文件下手,那是全部材料里能独立核验的部分。做 AI 基础设施的人可以把这份发布当验收流程的参考设计读,问题集、显著性筛选、形式化、版本制度、外部顾问,链条齐全,直接能抄。写论文想引用结论的人,只认有形式化的那 162 篇,其余当普通预印本对待。等模型放出再玩的人可以再等等,OpenAI 说了会负责任地放,没给时间表。

我的用法很明确,引用只认有 Lean 形式化的那 162 篇,其余 560 篇当预读材料。AI 产出怎么验收,这个仓库是目前最完整的一份公开答卷。

数据截至 2026-10-07,来源 GitHub API(openai/math 元数据、formalization.yaml 逐条计数、lean/README 与 lean-toolchain)、openai.com 公告页、外部评测(CellCog 2026-10-06、kingy.ai 2026-10-06、theclarity.today 2026-10-06、orcarouter 2026-10-07、Scientific American 2026-08-06)

GitHub 仓库 https://github.com/openai/math

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 6:52:15

Camera EIS后处理

技术方案与特点 技术清单 原理解读 合并策略与验证方法 版本 V31 日期 2026年10月6日 适用无 OIS 的 Android 设备 方案概览 V31 将 V29 的实时运动响应和曝光优先策略,与 V30 的后处理平滑、视觉漂移抑制和裁切回收策略合并。系统以 IMU 估计旋转,以图像光流补偿剩余运动,通…

作者头像 李华
网站建设 2026/10/8 6:51:43

一键清掉C盘30G!更新残留、软件缓存、临时文件全搞定!

Windows系统在经过长时间使用之后,各种系统更新残留、软件缓存文件、临时文件会越积越多,最终C盘出现空间不足提示,导致系统出现各种卡顿,蓝屏等情况,那么今天我就来给大家分享一款C盘清理神器,帮你安全释放…

作者头像 李华
网站建设 2026/10/8 6:51:29

OpenShell:让Windows 11找回经典开始菜单的免费开源神器

如果你最近把 Windows 系统升到了 11,大概率会遇到一个很尴尬的问题:点开开始菜单,里面一会儿是“推荐”,一会儿是“固定应用”,想找一个控制面板还得折腾半天。我身边不少人装了 OpenShell 之后,第一句话就…

作者头像 李华
网站建设 2026/10/8 6:49:37

算法-生活中的动态规划及实现

package mainimport ("fmt" )// // 动态规划常见题型 Go 实现合集 // // 通用思路: // 1. 定义状态 dp[...] 表示什么 // 2. 找状态转移方程 // 3. 确定初始化 // 4. 确定遍历顺序 // 5. 返回最终答案 // // ------------------------------------------…

作者头像 李华