专题 · TOPIC

AI 数学

当大模型开始做数学:推理、证明与发现

AI 与数学的交汇前沿:从 IMO 奥赛金牌到形式化定理证明,从神经网络的数学基础到 AI 自己发现新数学。本专题收录研究向文章,追踪机器数学能力的每一次跃迁。

已收录 5 篇 · 持续更新 · 关键词:#AI 数学 #数学推理 #定理证明 #形式化数学 #Lean
导读 · 研究前沿

AI 做数学研究走到了哪一步:奖牌、轰炸与「数学 2.0」之争

从 IMO 奖牌级表现到一次发布 372 项结果引爆抵制,AI 证明在 2026 年接连突破也接连越界。本文梳理 AlphaProof、Gemini Deep Think 与 OpenAI 最新成果、Lean 形式化生态的进展,厘清机器辅助证明当前的能力边界,以及数学社区围绕「数学 2.0」的核心争论。
来源:原创2026-10-10阅读 2·访客 2
阅读全文 →

系列文章

ARCHIVE 共 5 条
AI 做数学研究走到了哪一步:奖牌、轰炸与「数学 2.0」之争
从 IMO 奖牌级表现到一次发布 372 项结果引爆抵制,AI 证明在 2026 年接连突破也接连越界。本文梳理 AlphaProof、Gemini Deep Think 与 OpenAI 最新成果、Lean 形式化生态的进展,厘清机器辅助证明当前的能力边界,以及数学社区围绕「数学 2.0」的核心争论。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
AI 开始发现新数学了吗:从 FunSearch 到 AlphaEvolve
从 FunSearch 把 cap set 下界从 496 推到 512,到 AlphaEvolve 五十六年来首次改进 4×4 矩阵乘法,再到陶哲轩带着 AlphaEvolve 一次测了 67 个问题——AI 正在从「解出已知的题」走向「产出人类未知的新构造」。本文梳理这条机器发现路线的方法演进与代表结果,也整理 METR 与陶哲轩本人最直接的质疑:这到底是数学发现,还是高级暴力搜索。
研究前沿 精选 · 原创 · 今天 阅读 1·访客 1
AI 数学能力到底怎么测:基准、污染与「会考试不等于会研究」
FrontierMath 发布时最好的模型不到 2%,一年半后最高分冲到约 52%;可同一时期,GSM1k 证明部分模型的高分有背题成分,FrontierMath v2 修正了四成多题目,25 位菲尔兹奖得主联名批评「竞逐名题」。本文梳理数学评测五年演进、数据污染的实锤机制、FrontierMath 资助风波,以及 2026 年评测范式向证明题与开放问题的转向。
研究前沿 精选 · 原创 · 今天 阅读 1·访客 1
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
研究前沿 精选 · 原创 · 3天前 阅读 24·访客 24
深度学习的数学基础:我们知道它能用,却说不清为什么
2017 年 Ali Rahimi 领奖时说「机器学习变成了炼金术」,LeCun 当场反驳;八年过去,模型能力涨了几个数量级,「为什么泛化」的数学解释仍然是一堆可解模型里的定理。本文盘点深度学习数学基础的现状:随机标签实验、双下降、NTK、grokking、scaling laws 各自被解释到了哪一步,哪一步仍然卡住,以及 2026 年「学习力学」的学科宣言算不算转折点。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2