椰椰木知AI 日报
← 返回日报

AI 日报 · 2026-10-07:OpenAI 一次放出 722 篇 AI 数学手稿,Erdős 问题站暂停证明认领——证明来得比验证快

OpenAI 公开 722 篇内部模型写的数学手稿(部分有 Lean 形式化,README 承认未形式化结果可能有误),其中「低于 n log n 的整数乘法」为 OpenAI 声称、未经同行评审与形式化、改进幅度极小;同日 Erdős 问题站冻结证明认领;副线 Mistral Large 4 预览(1T/49B,月底开放权重,跑分自报);玩法:prompt-motion 动效提示词、Shaders 开源 WebGPU 组件(MIT)、Incredible / Gumloop / Claude for Google Workspace。

AI数学形式化验证开放权重

# AI 日报 · 2026-10-07:OpenAI 一次放出 722 篇 AI 数学手稿,Erdős 问题站暂停证明认领——证明来得比验证快

10 月 6 日(美东时间)发生了两件撞在一起的事。OpenAI 在 GitHub 上一次性公开了 722 篇由内部未发布模型写成的数学手稿,其中一篇声称推翻了整数乘法 n log n 最优的经典猜想;同一天,数学家 Thomas Bloom 宣布,他维护的 Erdős 问题网站冻结新的题目评论和证明认领,因为网站已经被「不加解释的 AI 证明」淹没。两件事指向同一个瓶颈:AI 写出证明的速度,已经远远超过人类读懂、检查、标清出处的速度。本期先读一手材料,分清「OpenAI 声称」和「已被验证」;副线是 Mistral Large 4;玩法是三组「AI 做视觉 / AI 替你动手」的工具。

一、OpenAI 的 722 篇手稿:仓库里写了什么

以下来自 OpenAI 官方博文 和 GitHub 仓库 openai/math 的 README:

  • 规模:722 篇手稿,归为 372 个「结果族」(一族包含主结果、配套论证、推论或替代证明)。绝大多数由同一个未发布的内部模型按同一流程产出;评测期间模型被提了约 4,000 个问题,再按「足够重要」筛选、汇总。
  • 算力:平均每个结果约相当于 ChatGPT Pro 思考 3 小时(OpenAI 自报的平均值,不是逐题数据)。
  • 验证状态:README 原话是「这批结果处在不同的验证阶段,并非都有 Lean 形式化」,并直说「部分未形式化的结果可能有问题」。仓库的形式化目录目前收录 162 篇论文;Lean 能让电脑逐步检查证明逻辑,但不能自动保证形式化陈述与论文陈述完全一致,也不说明结果是否新颖。
  • 透明度:附 10 份推理摘要、平均算力估算和尝试题数统计;OpenAI 说参考了普林斯顿高等研究院独立的「数学与 AI 顾问组」的建议,并将资助围绕 AI 结果的研讨会。
  • 例外:README 写明,黎曼 ζ 函数零点自由区域和 CM 阿贝尔簇上的 Hodge 猜想两项工作不完全走固定流程,其中一份写作经过人工编辑。

HN 讨论(约 371 分)

二、「低于 n log n 的整数乘法」:能说什么,不能说什么

这篇预印本(署名 OpenAI,日期 2026 年 9 月 23 日)摘要称:给出一个确定性算法,在固定有限字母表、有限条一维纸带的多带图灵机上,以 O(n(lg n)^(1−κ)) 的最坏情况时间完成两个 n 位整数的精确乘法,κ = 2^−182,并「在该模型中推翻了 Schönhage 和 Strassen 的 n log n 最优性猜想」。

背景(论文引言自述):Schönhage 和 Strassen 1971 年给出 O(n log n log log n) 算法,并提出 n log n 是最优增长阶;Harvey 和 van der Hoeven 2019 年做到了无条件的 O(n log n)。

我们能确认的与不能确认的:

  • 这是 OpenAI 的声称:没有经过同行评审;在仓库的目录里,这一族没有附 Lean 链接,形式化目录也没有收录这篇;截稿时我们没有找到独立数学家公开确认或否定它。
  • 即便成立,也几乎没有实用加速:节省的因子是 (lg n) 的 2^−182 次方。哪怕对十亿位的整数,这个因子也只比 1 多出不到 10^−50,还没算大 O 里隐藏的常数。它的意义在理论层面:说明 n log n 不是这个模型下的极限。
  • 模型限定:结论限定在多带图灵机这一经典计算模型;别把它说成「电脑乘法从此变快」。

HN 讨论(约 43 分)

三、数学界的反应,以及 Erdős 问题站按下暂停

二手报道(Scientific American,10 月 6 日):

  • OpenAI 发言人称,几乎每个结果都是给单个 agent 一个提示词得到的,但也承认部分结果可能尝试了多次;还说公司自己的数学家也还没完全看懂许多新结果。
  • MIT 数学家 Andrew Sutherland:在模型公开、别人能复现之前,「单 agent 一次解出」的说法都应视为未验证,「我们应该要收据」。
  • 多伦多大学的 Daniel Litt 持相反看法:公开总比藏着好,「对数学是好事」。
  • 顾问组的建议是公开模型、具体提示词和每题算力;OpenAI 这次只给了平均算力,没有提示词,并表示不受这些建议约束。

一手(Erdős Problems 站长博文,Thomas Bloom,10 月 6 日):

  • 网站 2023 年上线,现收录 1,221 道问题、9,000 多条评论、近 2,000 名注册用户,日均 1 万到 2.5 万独立访客。
  • Bloom 写道,现在公众与网站互动的主要方式,是张贴 AI 生成、往往不加解释的证明,用来登记一个「越来越没有意义」的优先权;绝大多数新评论都是这类,人工审核不可持续。
  • 改动:冻结新的题目评论和证明认领(一般讨论帖和博客评论保留);不再显示「已解决 / 未解决」状态和解题比例;今后描述结果不再使用「某某证明了」这类归功语言;转而重点征集高质量的证明讲解,Lean 形式化建议在 Palomar 登记后再提交链接。他说这些是实验性措施,暂停多久还不确定。
  • 注意:这篇文章没有提到 OpenAI,讲的是这一年 AI 证明的整体浪潮。两件事只是发生在同一天。HN 讨论(约 91 分)

两份材料放在一起看:证明的生产已经近乎工业化,平均 3 小时算力一个结果;而验证、理解、标注出处仍是手工活,可能要几个月。Bloom 的做法是让网站退回「讲清楚」的那一侧;OpenAI 的做法是先全部放出来,再补形式化。对读者来说,最实用的一条是:看到「AI 解决了某某猜想」,先问有没有形式化、有没有同行评审、有没有独立专家表态。

四、副线:Mistral Large 4 公开预览

据 Mistral 官方博文(10 月 6 日;HN 今日第一,约 1,580 分):

  • 1 万亿总参数、490 亿激活参数的原生多模态模型,现可在 Mistral Studio 试用预览 API;权重承诺本月底发布,官方页面未写明许可证。
  • 在欧洲自有数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从零训练;强化学习还在继续。
  • 官方自报:DeepSWE v1.1 61.7%、Terminal-Bench 4 28.3%、Cybench 93%。Mistral 称在 Artificial Analysis 网安指数的一项测试中,Claude Opus 5.5、GPT-6 Astra 因拒答接近 0 分。以上均为厂商口径。
  • 发权重前,Mistral 正与网安机构、经审核的合作方和政府机构做真实场景红队测试,这些伙伴可用审核更宽松的版本。

对照:同日 Anthropic 扩大网络安全验证计划,改为防御、红队、专项三档准入,按资质申请;最高一档面向关键基础设施等安全系统测试,Anthropic 称会与美国政府共同逐家审核。两家路线不同:一个开放权重、自主部署,一个按身份分级放开。

五、玩法 1:prompt-motion——200 多个 Opus 5.5 动效视频,附提示词

Prompt Motion(X · @p4nthera_)自述是「用 Claude Opus 5.5 做的动效视频合集,附背后的提示词和 skill」。发帖时收录 226 个,站点仍在增加,可按「Prompt / Skill」筛选。

可执行点:挑一个接近你需求的条目,把提示词复制进 Claude,替换成你的产品名和配色,先做一段 10 秒的产品介绍动画。

六、玩法 2:Shaders 开源 200 多个 WebGPU 效果组件

Shaders(X 官宣)宣布开源:

  • 200 多个 WebGPU 效果,以组件形式使用:渐变、噪声、玻璃、金属、光效、扭曲、转场、模糊、鼠标特效等,可嵌套、混合、遮罩。
  • 一个包、多框架:npm install shaders,提供 React、Vue、Svelte、Solid 和原生 JavaScript 入口。
  • 许可:GitHub 仓库 shader-effects-inc/shaders 的 LICENSE 为 MIT(Copyright 2026 Shader Effects Inc.),npm 包同为 MIT。注意 X 帖里的 shader-effects/shaders 路径打不开,组织名是 shader-effects-inc。另有付费的 Shaders Pro。
  • README 里还有「配合 AI 使用」一节,包里带 llms.txt,方便编码 agent 读懂组件用法。

可执行点:让 Claude Code 或 Codex 在你的落地页装上 shaders,加一个 MeshGradient 背景加鼠标拖尾效果;注意检查旧浏览器的 WebGPU 兼容回退。

七、玩法 3:让 AI 替你动手——桌面、云端浏览器、谷歌文档

  • Incredible(官网):macOS / Windows 桌面应用,按住 fn 说出任务,它在浏览器、文件和应用里点击、输入。官网写明:发送任何内容前会先征求你同意,可随时停止;只在你激活后才查看屏幕。
  • Gumloop Agent Browsers(官方博客 · 文档):在 Gumloop 云端为 agent 开浏览器,处理没有 API 或 MCP 的网站。支持凭据库和 1Password(文档称 agent 看不到密码明文)、会话回放、可复用的 Recipes。它还宣传「隐身代理会话」——用之前想清楚目标网站的使用条款和机器人规则。
  • Claude for Google Workspace(Anthropic 官方 · 帮助中心):所有付费方案公测。在 Docs / Sheets / Slides 侧边栏读你打开的文件、看你选中的内容并直接修改;另有 Docs / Sheets / Slides 连接器(beta),可从 Claude 对话里新建和编辑谷歌文件,权限跟随你现有的共享设置。据 9to5Google,有「编辑前询问」模式可先预览改动。

可执行点:三者都是「把手交给 AI」,先从最小权限开始。用 Claude 改表格时保持「编辑前询问」;给 Gumloop 一类工具单独建一个只放必要账号的密码库。

后续

  • OpenAI 回应维基媒体:据 Ars Technica(10 月 6 日约 20:21 北京时间),OpenAI 以声明回应:感谢维基媒体分享详细调查结果,正与其合作审查,并纳入整体调查。OpenAI 称同样没有发现 agent 留言协调的证据,也不能断定大量请求导致了 5 月的部分宕机。昨天那期写的「OpenAI 未立即回应」反映的是截稿时的情况。
  • 日期提醒:Claude Code 云端会话赠金的领取截止日为 10 月 7 日(据 BleepingComputer,以 Claude 官网显示为准,只在官网或 CLI 里领,别点社交平台的「领取链接」);10 月 9 日起 Gemini App 免费用户只剩 Flash-Lite(据 9to5Google / The Verge)。

今天可以做什么

  • 读到「AI 证明了某某猜想」:先查三件事——有没有 Lean 形式化、有没有同行评审、有没有独立专家表态。
  • 想用 AI 做视觉:从 prompt-motion 抄一个提示词,或用 shaders 给页面加一个背景。
  • 让 AI 替你操作:先开「编辑前询问」,再逐步放权。

来源与提示

OpenAI 数学部分来自官方博文、GitHub README / CONTENTS 与预印本原文;「推翻 n log n 猜想」为 OpenAI 声称,未经同行评审、未见 Lean 形式化、未见独立确认。数学界反应来自 Scientific American(二手)。Erdős 站改动来自站长 Thomas Bloom 本人博文。Mistral Large 4 参数与跑分均为官方自报,权重未发布、许可证未写明。Anthropic 网安分级来自官方博文。prompt-motion、Shaders(MIT 许可已核对仓库 LICENSE)、Incredible、Gumloop、Claude for Google Workspace 来自各自官网 / 官方文档。今日没有 Reddit 素材。未采用:Claude Projects 挂载本地文件夹(仅见 X 转述);花叔动画 skill 与滚动动画术语表(未逐条核);HeyGen HyperFrames、Oki Home、微信记录同步 Obsidian 项目(作者自述 / 未核);openTPU(README 自报);OpenAI Decisions API、EmbeddingGemma 2、韩国银行入侵、犹他 AI 处方、佛州「Claude 日记」报警、融资消息(偏离主线或未独立核实);Meta Muse(不重复报道)。

<!-- social drafts (local only): xhs=/workspace/ai-daily/work/2026-10-07/out/xhs.md wechat=/workspace/ai-daily/work/2026-10-07/out/wechat.md -->