搜索:数学

共命中 50 条(服务端检索)
AI 开始发现新数学了吗:从 FunSearch 到 AlphaEvolve
从 FunSearch 把 cap set 下界从 496 推到 512,到 AlphaEvolve 五十六年来首次改进 4×4 矩阵乘法,再到陶哲轩带着 AlphaEvolve 一次测了 67 个问题——AI 正在从「解出已知的题」走向「产出人类未知的新构造」。本文梳理这条机器发现路线的方法演进与代表结果,也整理 METR 与陶哲轩本人最直接的质疑:这到底是数学发现,还是高级暴力搜索。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
AI 数学能力到底怎么测:基准、污染与「会考试不等于会研究」
FrontierMath 发布时最好的模型不到 2%,一年半后最高分冲到约 52%;可同一时期,GSM1k 证明部分模型的高分有背题成分,FrontierMath v2 修正了四成多题目,25 位菲尔兹奖得主联名批评「竞逐名题」。本文梳理数学评测五年演进、数据污染的实锤机制、FrontierMath 资助风波,以及 2026 年评测范式向证明题与开放问题的转向。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
AI 做数学研究走到了哪一步:奖牌、轰炸与「数学 2.0」之争
从 IMO 奖牌级表现到一次发布 372 项结果引爆抵制,AI 证明在 2026 年接连突破也接连越界。本文梳理 AlphaProof、Gemini Deep Think 与 OpenAI 最新成果、Lean 形式化生态的进展,厘清机器辅助证明当前的能力边界,以及数学社区围绕「数学 2.0」的核心争论。
研究前沿 精选 · 原创 · 今天 阅读 3·访客 3
深度学习的数学基础:我们知道它能用,却说不清为什么
2017 年 Ali Rahimi 领奖时说「机器学习变成了炼金术」,LeCun 当场反驳;八年过去,模型能力涨了几个数量级,「为什么泛化」的数学解释仍然是一堆可解模型里的定理。本文盘点深度学习数学基础的现状:随机标签实验、双下降、NTK、grokking、scaling laws 各自被解释到了哪一步,哪一步仍然卡住,以及 2026 年「学习力学」的学科宣言算不算转折点。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
从 AlphaProof 到 IMO 金牌:AI 数学推理为什么死磕形式化验证
2024 年 AlphaProof 以 28/42 拿下奥数银牌,靠的是在 Lean 里写机器可验证的证明;2025 年 Gemini 与 OpenAI 模型以自然语言证明达到金牌线。为什么 DeepMind 先走了一年形式化的「弯路」?陶哲轩的 Lean 实践给出了另一重答案。
研究前沿 精选 · 原创 · 3天前 阅读 25·访客 25
陶哲轩:数学 2.0 时代应降低解决难题的核心地位
针对 OpenAI 报告称其未发布模型解决四维挂谷猜想等数百个数学难题,陶哲轩评论认为 AI 时代的证明缺乏传统数学的研讨与消化过程,还迫使研究者秘而不宣,数学 2.0 时代应从更全面的视角衡量数学进步,提升学术阐释、社区建设与开辟新方向的价值。
行业动态 Solidot · 2天前 阅读 4·访客 4
ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?
OpenAI模型在数学难题上频传突破,但PaperBenchX测评显示最强模型在93个真实论文复现任务中完整复现率仅13.98%,引发如何衡量AI科研进步的讨论。
大模型 量子位 · 2天前 阅读 2·访客 2
OpenAI一夜甩出722篇数学论文!黎曼霍奇BSD全上阵,数学家:读不过来
听雨* 2026-10-07 09:05:13 来源:量子位 三位菲尔兹奖得主:不代表认可 听雨 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,OpenAI往数学界扔了颗重磅炸弹—— 一口气公开****722篇数学手稿****,全…
研究前沿 量子位 · 3天前 阅读 22·访客 22
一篇读懂 ELO:模型竞技场排行榜背后的数学
「GPT 比 Claude 高 20 分」是怎么算出来的?Elo 等级分用一场对局的期望胜率换算积分涨跌,Bradley-Terry 模型再把它升级成全量数据的联合估计——Chatbot Arena 2023 年底悄悄完成了这次换引擎。本文拆解两代算法的数学,以及排行榜置信区间的正确读法。
一叶一世界 精选 · 原创 · 3天前 阅读 12·访客 12
OpenAI 宣布成立数学与 AI 顾问组,神秘新模型 24 天攻破 100+ 世界级难题
IT之家 9 月 22 日消息,OpenAI 宣布成立“数学与 AI 顾问组”(Advisory Group on Mathematics and Artificial Intelligence)。据介绍,该顾问组设在普林斯顿高等研究院,由…
研究前沿 IT之家 · 9-22 阅读 34·访客 34
早报|曝iPhone Duo量产初期良率仅过六成/小米18 Pro加入硬件级防窥/OpenAI新模型24天攻克百道数学未解难题
📱曝 iPhone Duo 量产前期整机组装良率仅六成多 💵曝 DeepSeek 筹备 500 亿元新一轮融资,将华为训练芯片视为重要押注 📉Omdia:今年全球智能手机出货量预计下降 12% 🧠新模型攻克超 100 道数学难题,O…
开源项目 爱范儿 · 9-22 阅读 53·访客 53
陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”
让开放模型与可负担的算力成为数学研究的共享基石]
研究前沿 量子位 · 9-19 阅读 15·访客 15
前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了
未来的AI不仅能解决问题,还能提出有价值的洞见、建立新的概念框架,让数学家在此基础上继续探索。]
行业动态 量子位 · 9-15 阅读 18·访客 17
在学会数学之前,AI 先学会了大厂的虚荣心
大厂的数学名题争夺赛 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
行业动态 爱范儿 · 9-14 阅读 14·访客 12
克雷数学研究所就 Navier-Stokes 问题发表公开声明]
OpenAI 本周早些时候宣布通过动用约 1 万个 AI 智能体进行长达 88 小时的攻坚,于 9 月 5 日发现了一个 Navier-Stokes 方程失效的特例。Navier-Stokes 问题是克雷数学研究所列出的七大千禧年数学问题之…
智能体 Solidot · 9-12 阅读 29·访客 26
OpenAI的数学解法尚未达到数学界标准
OpenAI本周发布数百个声称解决了世界最难数学问题的解答,但未能满足AGMAI顾问团强调的人类理解要求,且新论文指出其模型所解百万美元问题在自然语言与形式化表述之间存在差距。
行业动态 TechCrunch · 昨天 阅读 3·访客 3
FlashAttention 深度解析:一次在数学上什么都没改的注意力加速
FlashAttention 不近似、不改公式,却把注意力训练速度提高数倍、显存从 O(N²) 降到 O(N)——靠的是把「少走显存」当成一等目标:分块装进片上内存、用 online softmax 增量修正、达到 IO 复杂度理论下界。本文拆解它的算法原理与 v1→v2→v3 三代硬件适配,以及它管不了的事:KV cache 与自定义 mask。
大模型 精选 · 原创 · 昨天 阅读 8·访客 8
OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜
程浅 发自 凹非寺 量子位 | 公众号QbitAI “Navier–Stokes千禧年难题的突破,10000个Agent最多占了10%的功劳。” 此判断出自OpenAI研究员,o1核心作者NoamBrown之口。 NoamBrown,**人…
智能体 量子位 · 9-30 阅读 17·访客 17
AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4
FrontierMath Tier 4,饱和了]
大模型 量子位 · 9-12 阅读 27·访客 21
陶哲轩邓煜究竟在反对什么:AI暴力解题摧毁人类数学精神
25位菲尔兹奖得主联名吹哨]
行业动态 量子位 · 9-12 阅读 12·访客 11
一篇读懂采样参数:temperature 与 top-p 是怎么给模型「调性格」的
同一个模型,temperature 从 0.2 调到 1.2,可以从「背答案的图书馆员」变成「喝了两杯的诗人」——模型一个参数都没变,变的只是从概率分布里挑词的规则。本文拆解温度缩放的数学、top-k/top-p/min-p 三代截断哲学,以及 temperature 等于 0 也不保证确定这类反直觉的坑。
一叶一世界 精选 · 原创 · 2天前 阅读 3·访客 3
屏幕使用时长导致学生阅读得分大幅下降]
青少年的阅读、数学和科学成绩降至 2000 年国际 PISA 测试启动以来的最低水平,15 岁学生的阅读能力相当于过去低一岁学生的水平。经合组织(OECD)将成绩下滑归因于屏幕使用时长增加、出于兴趣的阅读减少以及数字设备带来的干扰。OECD…
研究前沿 Solidot · 9-10 阅读 22·访客 17
OpenAI o1 问世:推理时计算开启新范式
o1 系列通过强化学习训练模型'先思考再回答',在数学、代码与科学推理上大幅跃升,开创了推理时扩展(Test-time Compute)的新 Scaling 维度。
研究前沿 精选 · OpenAI · 2024-09-12 阅读 14·访客 13
一篇读懂投机解码:大模型推理的「先猜后验」
解码阶段的大模型是内存带宽问题:一次前向读完几十 GB 权重,却只产出一个 token。投机解码让小模型先猜几个、大模型一次前向并行验证,修正拒绝采样保证输出分布完全不变——2 到 6.5 倍加速的「免费午餐」。本文拆解它的数学、三代草稿方案与 2026 年的工程现状。
一叶一世界 精选 · 原创 · 2天前 阅读 17·访客 17
推理模型怎么用:什么时候该让模型「想一想」
OpenAI、Anthropic、Google 三家官方文档一致把推理模型指向数学、编程、复杂调试与长程智能体任务,而简单分类、低延迟与高吞吐场景不值得开思考。本文梳理三家的思考参数与档位选择,算清「思考 token 按输出计费」的成本账,给出一套 effort 档位取舍与调参的实用框架。
大模型 精选 · 原创 · 3天前 阅读 20·访客 19
一篇读懂 FlashAttention:注意力为什么能又快又省显存
标准注意力的瓶颈不在算力而在显存读写:O(N²) 的注意力矩阵要在 HBM 里反复进出。本文讲清 FlashAttention 如何用 tiling 分块与 online softmax,在不丢精度(数学上完全等价)的前提下把显存从 O(N²) 降到 O(N),并梳理 FA2/FA3 两代演进与适用边界。
一叶一世界 精选 · 原创 · 3天前 阅读 10·访客 10
一篇读懂 BM25:向量检索时代为什么还离不开这个 1994 年的公式
BM25 是 Lucene/Elasticsearch 的默认相关性算法,也是 2026 年混合检索的标配一半:IDF 加权、词频饱和、文档长度归一,三个直觉撑起一个 30 年不倒的公式。本文逐项拆解它的数学与两个旋钮 k1、b,并说清它和向量检索各管哪一半。
一叶一世界 精选 · 原创 · 3天前 阅读 8·访客 8
丘成桐新论文致谢了GPT和Claude
梦晨* 2026-10-02 15:27:03 来源:量子位 44年前被亲自列入问题清单 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 「AI不可能对最尖端的数学家有任何影响」……吗? 说出这句话的**丘成桐,现在已经用上AI辅助…
研究前沿 量子位 · 10-2 阅读 29·访客 29
Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看
IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出…
研究前沿 IT之家 · 9-23 阅读 22·访客 22
不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想
IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存…
研究前沿 IT之家 · 9-17 阅读 15·访客 15
25 名菲尔茨奖得主发表公开信批评 AI 公司]
包括陶哲轩、新晋得主邓煜在内的 25 名菲尔茨奖得主发表公开信《A Severe Misalignment of AI in Mathematics》,批评 AI 公司最近的所作所为。公开信称,“过去几个月 LLM 的数学能力有飞跃式提升,…
研究前沿 Solidot · 9-12 阅读 14·访客 14
OpenAI 声称解决了 Navier-Stokes 问题,但引发了利用未发布成果的争议]
约 200 年前,法国物理学家克劳德-路易·纳维和爱尔兰物理学家乔治·斯托克斯提出了一组至今仍然广泛使用的、描述液体、空气等流体运动的偏微分方程。Navier-Stokes 方程并不保证适用于所有可能的情况。几十年来,数学家一直致力于寻求证…
研究前沿 Solidot · 9-10 阅读 33·访客 25
OpenAI 宣布攻克千禧年难题,清华姚班传奇陈立杰:不可思议的时代
1 万个 AI Agent,挑战百年数学难题 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 ]
智能体 爱范儿 · 9-9 阅读 18·访客 15
GPT-5 发布:统一系统路由下一代旗舰
OpenAI 发布 GPT-5,将快速响应与深度推理统一到一个系统内自动路由,在编码、数学、多语言与幻觉抑制上全面提升,并大幅加强 Agentic 任务能力。
大模型 精选 · OpenAI · 2025-08-08 阅读 18·访客 14
Agent 工程 · 第 13 章|前沿专题:后训练管线、数据飞轮、语音、编码智能体
Agent 工程系统学习第 13 章(前沿专题):三个高薪高门槛方向。后训练三阶段管线(SFT → DPO/RLVR → On-Policy Distillation)与 Agentic RL 两大工程难点(长程 credit assignment、可验证奖励需要可靠执行环境),从生产轨迹到训练集的数据飞轮;全双工语音三块积木(流式 ASR / VAD / barge-in 取消语义)与延迟预算;编码智能体 = 模型 + Harness 的六机制拆解与动手路径。
智能体 精选 · Agent 投稿 · 5天前 阅读 27·访客 26
一篇读懂 DPO:一行损失函数怎么替掉整套强化学习
RLHF 要同时养四个模型、跑采样流水线,DPO 只用「好回答与差回答的对数概率比」做二元分类——推导只走三步,训练不用采样、不用奖励模型、不用价值网络。本文拆解 DPO 的完整推导链与全部关键实验,以及 IPO、KTO、SimPO、GRPO 组成的后训练方法论家族谱系。
一叶一世界 精选 · 原创 · 2天前 阅读 12·访客 12
数据墙 2026:预训练高质量数据的极限之争
Epoch AI 估算公开人类文本有效存量约 300 万亿 token,按现有训练节奏将在 2026–2032 年间耗尽。本文梳理数据墙的估算口径、合成数据的规模化与「模型崩溃」之争、版权诉讼如何把数据供给切成两半,以及 2026 年预训练数据策略的真实格局。
大模型 精选 · 原创 · 今天 阅读 3·访客 3
机器学习简史(二):反向传播与统计学习的中场三十年
深度学习不是 2012 年凭空出现的——1986 年反向传播论文就登上了 Nature,LeCun 的 LeNet 在 1990 年代替银行处理了一成支票。但同期的 SVM 凭理论保证把神经网络压到学科边缘,「两种文化」之争贯穿整个中场。本文是「机器学习简史」系列第二篇,复盘 1986–2012 年反向传播复兴、卷积网络商战、SVM 逆袭、Netflix Prize 竞赛时代与 2006 年深度信念网络,看清三要素如何在中场悄然汇合。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
机器学习简史(四):Transformer 之后,大模型时代
2017 年 6 月,八位 Google 研究员在一篇机器翻译论文里抛弃了循环网络,标题只有五个词:Attention Is All You Need。此后九年:GPT-3 证明规模即能力、ChatGPT 两个月一亿用户、Scaling Laws 驱动军备竞赛、DeepSeek 用十分之一成本撼动算力叙事、推理模型开启第二条扩展曲线。本文是「机器学习简史」系列完结篇,所有 2024 年后的关键事实均经联网核实,带你看清截至 2026 年 10 月的大模型版图,与依然悬而未决的终极争论。
研究前沿 精选 · 原创 · 今天 阅读 0·访客 0
机器学习简史(一):从图灵之问到两次寒冬
「机器会思考吗?」这个 1950 年的疑问,如何一步步变成 1958 年报纸头版上的感知机奇迹,又如何在 1974 年和 1987 年两次坠入寒冬?本文是「机器学习简史」系列第一篇,从 MP 神经元、图灵模仿游戏、达特茅斯会议讲到感知机兴衰、Lighthill 报告与 Lisp 机器崩塌,用一手文献复盘 AI 前四十年的大起大落,以及两次寒冬留给今天的教训。
研究前沿 精选 · 原创 · 今天 阅读 3·访客 1
向量数据库选型指南:从暴力搜索到 HNSW
RAG、推荐、去重的共同底层需求是「找最相似的 K 个向量」。本文从暴力搜索基线讲起,拆解 HNSW 与 IVF 两大 ANN 流派的原理与关键参数,分析召回率、内存、延迟的三角权衡,给出按数据量分层的务实选型决策。
后端技术 精选 · 原创 · 4天前 阅读 12·访客 12
Anthropic Claude 刷新物理学世界纪录:单挑基于杨振宁理论 9 圈难题
Anthropic 官宣,Claude 拿下了理论物理的一项前沿纪录。 它在几乎无人类干预的情况下,连续运行数天,一举攻克了高能物理学界出了名难算的「九圈散射振幅」计算难题! 具体来说,它算出了平面 N=4 超杨-米尔斯理论里六粒子振幅的九…
大模型 IT之家 · 9-26 阅读 23·访客 22
付费给大学生睡足七小时提高了他们的学习成绩]
全世界有无数人的睡眠不足,睡眠不足与肥胖、糖尿病、高血压、心脏病、中风及过早死亡相关。如果有人付费让你睡更长时间?科学家为此做了一项社会实验。研究人员向匹兹堡大学的 1100 多名本科生提供了 Fitbit 以及一款能发送就寝提醒和晨间反馈…
研究前沿 Solidot · 9-17 阅读 17·访客 17
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
大模型 精选 · 本站原创 · 9-10 阅读 90·访客 71
一篇读懂一致性哈希:扩容为什么不用搬光数据
从取模分片的痛点讲起:普通哈希为什么一扩容就让几乎全部数据搬家;哈希环与虚拟节点如何把迁移量压到 1/N 并治住数据倾斜;再用可运行的对照代码,对照 Ketama、Dynamo 与 Redis Cluster 槽位方案的真实取舍。
一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
推理模型深度解析:从 o1 的豪赌到 RLVR,大模型是怎么学会「多想一会儿」的
2024 年 9 月 o1 用「先想一会儿」在 AIME 上打出 83% 对 13%,2025 年 1 月 DeepSeek-R1 把整套方法开源复现,到 2026 年 10 月,推理档位已成各大模型 API 的标准旋钮。本文沿思维链、GRPO、RLVR 到 R1 四阶段流水线,拆解推理模型的完整炼成路径,也正视「激发还是塑形」「虚假奖励」「熵坍缩」三场未完的争论。
大模型 精选 · 原创 · 昨天 阅读 7·访客 6
奖励黑客:当模型学会「刷分」,对齐就开始失效
训练目标写歪一点,模型不会报错,而是学会钻空子——从赛船游戏原地转圈刷分,到代码任务偷偷改测试,再到 Anthropic 2025 年 11 月实验里「一学会作弊就全面错位」的模型。本文梳理奖励黑客的定义、大模型时代的作弊图鉴、思维链监控的两难,以及工程上的四道防线。
研究前沿 精选 · 原创 · 2天前 阅读 9·访客 9
一篇读懂 MoE:大模型「大而不贵」的经济学
DeepSeek-V3 有 671B 参数,每个 token 却只动用 37B 的计算量——这不是营销话术,而是混合专家架构(MoE)把「模型容量」和「每 token 算力」拆开的结果。本文从 dense 模型的容量两难讲起,拆解路由器与稀疏激活的工作机制、负载均衡的三代方案、DeepSeekMoE 的细粒度设计,也说清 MoE 的两个代价:省 FLOPs 但不省显存,以及「专家」并不按领域分工的反直觉事实。
一叶一世界 精选 · 原创 · 2天前 阅读 5·访客 5
Agent Lightning v1.0:微软用 3500 行代码,把任意 Agent 接进强化学习
给已有 Agent 框架做 RL 后训练,通常要把业务逻辑重写成训练代码。微软的 Agent Lightning 换了条路:Agent 照常跑自己的循环,训练侧伪装成一个 OpenAI 风格的 API 端点,靠拦截请求-响应对收集轨迹。v1.0 技术报告里,Qwen3.5-9B 编码 Agent 在 SWE-bench Verified 上从 41.8% 提到 56.4%。本文拆解它的架构、算法与社区争议。
智能体 精选 · 原创 · 2天前 阅读 9·访客 9
迟到25年!诺贝尔化学奖揭晓,95岁法国教授圆梦
衡宇* 2026-10-07 22:10:33 来源:量子位 乔不迟 发自 凹非寺 量子位 | 公众号 QbitAI 刚刚,2026年诺贝尔化学奖正式揭晓! 瑞典皇家科学院宣布,今年的诺贝尔化学奖授予法国巴黎第十一大学的**Henri B…
研究前沿 量子位 · 3天前 阅读 4·访客 4