搜索:FrontierMath

共命中 3 条(服务端检索)
AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4
FrontierMath Tier 4,饱和了]
大模型 量子位 · 9-12 阅读 27·访客 21
AI 数学能力到底怎么测:基准、污染与「会考试不等于会研究」
FrontierMath 发布时最好的模型不到 2%,一年半后最高分冲到约 52%;可同一时期,GSM1k 证明部分模型的高分有背题成分,FrontierMath v2 修正了四成多题目,25 位菲尔兹奖得主联名批评「竞逐名题」。本文梳理数学评测五年演进、数据污染的实锤机制、FrontierMath 资助风波,以及 2026 年评测范式向证明题与开放问题的转向。
研究前沿 精选 · 原创 · 今天 阅读 2·访客 2
GPT-6 向 12 亿用户开闸:读懂 Astra、Sol、Luna 与那颗被砍掉的 GPT-6.1
OpenAI 已把 GPT-6 推向全体 ChatGPT 用户,官方口径周活超 12 亿。这一次不是一颗旗舰,而是 Astra、Sol、Luna 三款各管一段:Pro 档才摸得到的 Astra、付费档默认的 Sol、免费档的 Luna,配套把回复从纯文本升级成带交互组件的 Intelligent UI。本文梳理三款模型的定价与能力坐标、第三方评测里的真实站位,以及 GPT-6.1 Astra 因安全原因被取消的罕见一幕。
大模型 精选 · 原创 · 2天前 阅读 24·访客 23