中关村在线

热点资讯

GPT-6 Astra首破5道未解Erd?s数学难题,创AI数学推理新标杆

2026年9月5日,OpenAI正式发布其品牌历史上能力最强的模型——GPT-6 Astra。该模型被官方定义为当前全球智能水平最高、对齐效果最优的生成式人工智能系统。

模型的预训练工作在美国得克萨斯州Stargate超算中心完成,总计调用超过十万张GPU,并首次在旗舰级模型研发中大规模引入前代模型参与监督训练过程。

其实际能力如何?近期,Epoch AI与曼彻斯特大学联合发布的FrontierMath Erd?s(FME)基准测试结果提供了关键验证。在这一专为评估前沿数学推理能力设计的严苛测试中,GPT-6 Astra是唯一提交有效解题成果的大语言模型。

测试涵盖68道迄今尚未被人类解决的Erd?s数学难题,全部题目均无已知标准答案,杜绝模型依赖训练数据“记忆作答”。所有参测模型必须以Lean语言输出形式化证明,由验证内核自动判定逻辑正确性;每轮测试统一限定预算300美元、时限72小时,确保评估环境完全公平。

在标准测试条件下,GPT-6 Astra成功完成其中2道题目的形式化证明;在放宽算力限制的扩展实验中,又额外攻克3道,包括1931年Erd?s18岁时提出的“解离集猜想”——他本人曾称此为“人生第一个正经问题”,以及极值图论领域久负盛名的Erd?s-Sós猜想。这两道题多年来始终未能被任何数学家完整解决。

五项成果中,既有通过构造反例推翻原有命题的突破,也有对全新命题给出严格形式化证明的进展,整体难度远超常规数学推理任务。

据测算,GPT-6 Astra为完成这五次解题尝试共消耗算力逾22万美元,而单次标准测试仅投入约2万美元。按300美元单次运行、3%成功率估算,模型每成功解答一道重要开放性数学问题,期望成本约为1万美元。

值得注意的是,相关研究也指出:模型可能已形成正确解题思路,却受限于形式化表达能力,无法将其转化为可验证的Lean证明;此外,数学探索不仅在于求解既有问题,更在于提出新问题、构建新框架。此次测试所列68道难题中,仍有63道未被触及。尽管有观点认为这标志着通用人工智能时代开启,但距离真正实现高阶数学领域的全面自主研究,仍存在显著差距。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具