43道研究级数学题被AI全部解完,基准饱和引25位菲尔兹奖得主发声

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

9月中旬,非营利研究机构Epoch AI给出确认,OpenAI的GPT-6 Astra解出了FrontierMath最高难度档Tier 4中此前唯一一道从未被任何AI模型解出的难题。至此,这个包含43道研究级高难度数学题的题组被彻底打穿,官方公布的Astra单次成绩为97.6%;而按不同模型、不同时间尝试累积计算,该测试集的所有题目都已被AI至少解出过一次,基准整体宣告饱和。FrontierMath由Epoch AI联合60余位数学家于2024年11月推出,初衷正是为了避免传统数学基准被AI过快刷穿。

几乎同期,陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主作为最初签署人,联合发布了一份名为《人工智能在数学中的严重错位》的声明。一边是基准被解完,一边是学界发出警告,两件事放在一起,恰好把AI数学能力究竟走到了哪一步、对工程实践有什么用、又该警惕什么,推到了最值得讨论的位置。

一套为防刷穿而生的基准,为何只撑了一年零两个月

FrontierMath的设计逻辑和普通数学测评完全不同,它的特点是三句话:研究生级、防作弊、需要原创推理。题目由数学研究者原创,网上找不到现成答案,杜绝了背题;很多题没有标准套路,需要真正的推导演绎;最高档Tier 4的难度接近专业数学研究本身,一道题往往需要专业数学家用数小时甚至数天才能解决。Tier 4于2025年7月推出时共50道题,2026年6月经修订后保留43道,覆盖数论、拓扑、组合数学、代数几何等领域,一度被视作大模型数学推理的试金石。

结果只过了一年零两个月,这一整层题库就被完全攻克。Epoch AI联合60余位数学家设计这套基准,本身就是为了给AI留一道足够高的墙,让评测不至于在几年内失效。现在这道墙被推平,意味着在解出已知数学问题这件事上,最强模型已经摸到人类顶尖水平的天花板,同时也意味着评测行业需要更难的下一阶测试。有研究者把这种状态称为评测线的到头:当一个基准的所有题目都能被解出,它作为能力标尺的区分度就归零了。

97.6%的成绩单背后,是累积解出而非单次通关

需要说清楚的是,97.6%是Astra在单次作答中的官方成绩,而基准饱和这个结论来自累积口径。也就是说,把不同模型、不同时间、不同尝试次数全部计入,43道题里的每一道都至少被解出过一次,但没有任何一个模型能在单次跑分中全部拿下。这两个数字的差别,恰恰是当下大模型数学能力最真实的写照:能力上限已经被证明足以覆盖全部题目,稳定性与一次通过率仍有缺口。

与之配套的另一组结果同样值得注意。在Andon Labs的Vending-Bench智能体基准中,Astra在经营任务里的营收能力约为Claude Fable 5.1的近三倍,并拒绝接受对方提出的非法价格操纵协议;在无人机控制测试中,Astra成为首个在全部五个子任务上超越人类基线的模型。数学推理、长程规划与工具调用这三项能力正在同一批模型上同步抬升,这也是基准饱和这件事在能力层面并不意外,却在评测层面格外刺眼的原因。

25位数学家的公开信,担心的不是AI太强而是验证太慢

《人工智能在数学中的严重错位》这份声明的核心并不是AI太强了,而是AI批量生产结论的速度可能快过人类验证的速度。声明提到,过去几个月内大语言模型的数学能力急剧提升,模型能够以越来越快的速度给出真或假的结论,而人类逐条核对证明的时间并没有相应缩短。对数学这门以严格证明为生命的学科来说,产出的速度一旦远超校验的速度,孕育思想的沃土就可能被大量未经核实的结论淹没。

这种担忧并非空想。此前OpenAI内部前沿模型通过约1万个并发智能体运行约88小时,解决了被称为千禧年大奖难题的纳维-斯托克斯存在性与光滑性问题,但外界在复核近百页证明过程时发现,人类可以通过工具检查形式化结果,搜索过程、中间推理以及为何选择特定路径的思维过程却完全不可见。随后该事件还演变为学术争议,有数学家公开表示模型使用了他们此前传递的研究路径。黑箱与优先权,构成了这次学界发声的两个关键词。

数学推理变强之后,工程团队能拿到什么实际好处

抛开数学家慌不慌的情绪,数学能力抬升对写代码的人其实有非常直接的工程红利。第一是算法与数值计算的提效:过去需要手推递推公式、验证数值方法收敛性的工作,现在可以让模型把推导过程铺开,再拿去代码里跑验证,建模、仿真、量化这类强数学场景受益最直接。第二是形式化验证的助攻:数学推理变强意味着模型更擅长写带证明性质的规约、检查边界条件,对支付、权限、并发这类安全敏感系统是实打实的帮助。

第三是自动化的猜想与验证闭环:研究级推理加上代码执行,能让智能体自己提出假设、写程序验证、再根据结果修正,这比单纯补全代码高出一个维度。但声明也给出了清醒的提醒:模型说这个推导是对的,不等于真的对,工程里必须自己跑测试、做边界检查;暴力解题和真正理解是两回事,模型可能给出一个看起来完美的答案,逻辑链却站不住。把数学能力的提升当作工具升级而不是判断力替代,才是这份公开信最实用的读法。

素材来源:南方周末、腾讯新闻、量子位、博客园 发布时间:2026-09-15