中国医生用GPT-5.6破解22年数学难题,Crouzeix本人确认正确

IT之家
Aug 14

8 月 14 日消息,2025 年,一连串的协和 4+4 博士引发关注和热议,其中就包括金山木事件。时隔一年之后,金山木这个名字再次引发热议。

据《南华早报》今日报道,北京协和医院神经外科博士后、住院医师金山木利用 OpenAI 的 GPT-5.6-Sol 模型,只用了约 16 小时就成功证明了自 2004 年以来困扰数学界长达 22 年的 Crouzeix 猜想。

美国康奈尔大学数学家 Alex Townsend 与华盛顿大学数学系教授 Anne Greenbaum 公开发表文章,披露了他们与这位中国医生的邮件往来,使得这一突破性成果为公众所知。

Townsend 和 Greenbaum 表示,他们两人以及猜想提出者、法国数学家 Michel Crouzeix 本人均已审阅了论文手稿,并确认证明正确无误。

金山木的学术背景与数学相去甚远。百度百科显示,其本科为北京大学地质学专业,2016 年通过自主招生加分(高考成绩 622 分,北大录取线 660 分)进入地质学类。2019 年参与南阿尔卑斯山地质考察后,于 2020 年通过协和医学院“4+4 试点班”转入临床医学,2024 年成为神经外科博士后。

据称,他之所以闯入数学领域,源于其在经颅超声研究中的实际需求 —— 试图用超声波穿透复杂的人体颅骨结构时,他在这一过程中接触到了矩阵分析,并在自学过程中偶然了解到 Crouzeix 猜想。

金山木在接受采访时表示,他所接受的正式数学教育仅限于理工科本科生的基础课程,其余数学知识均为自学。

Crouzeix 猜想由法国数学家 Michel Crouzeix 于 2004 年提出,其核心内容为:对于任意矩阵和任意多项式函数,矩阵经函数作用后的范数不超过该函数在矩阵数值域上最大值的两倍。

该猜想表述简洁但证明难度极高。2007 年,Crouzeix 本人仅证明了常数在 11.08 时成立;2017 年,全球顶尖专家在美国数学研究所专题研讨会上一周苦战后,才将常数降至 2.414。此后该问题再无实质进展。

在该研究中,金山木采用了一种非常规的解题路径。他没有进行传统的纸笔推导,而是借助 GPT-5.6-Sol 模型在 ChatGPT Work 平台上完成了证明。

他借鉴了 OpenAI 此前攻克 Cycle Double Cover 猜想时的提示词策略:要求模型在物理断网环境下进行纯粹原创思考,启动大量智能体沿不同路径发散探索并防止过早收敛,对候选策略进行对抗性审计,并指令模型在获得完整证明前不得放弃。

金山木在设定完成后即离开,全程未进行任何干预。GPT-5.6-Sol 在约 16 小时的自主运行中,经历了数万次假设、推翻与重建,最终给出了证明。

多位数学家们评价称,AI 并未采用人类预想中的繁杂硬估计,而是通过巧妙的采样策略简化出简洁的正性条件。Townsend 和 Greenbaum 在审阅证明后以“震惊”形容自己的感受。

金山木已将全部研究资料开源,在 GitHub 仓库中公开了最终论文、提示词、历次迭代手稿、Lean 4 形式化证明代码及公理审计报告。

值得一提的是,在该预印本发布仅 8 天后,数学家 Emiel Lorist 和 Felix Schwenninger 于 2026 年 8 月初发布了一篇仅 5 页的独立证明,思路截然不同,将经典双层势表示法与 2-扩张扰动引理相结合。两人坦言在探索证明策略时同样使用了 ChatGPT 5.6。

此次突破正值前沿 AI 系统在数学领域日益发挥关键作用之际。2026 年 5 月,OpenAI 称其内部通用推理模型自主解决了匈牙利数学家 Paul Erdős 于 1946 年提出的平面单位距离问题。

2026 年 8 月初,OpenAI 披露下一代模型 Astra 的内部版本已在 10 项数学与理论计算机科学难题上取得突破。

此外,Anthropic 于 2026 年 8 月 11 日宣布,其未公开的研究版 Claude 模型在尝试攻克黎曼猜想过程中,将黎曼 ζ 函数临界线上零点比例的已知下界从 41.6% 提升至 67.2%。

Disclaimer: Investing carries risk. This is not financial advice. The above content should not be regarded as an offer, recommendation, or solicitation on acquiring or disposing of any financial products, any associated discussions, comments, or posts by author or other users should not be considered as such either. It is solely for general information purpose only, which does not consider your own investment objectives, financial situations or needs. TTM assumes no responsibility or warranty for the accuracy and completeness of the information, investors should do their own research and may seek professional advice before investing.

Most Discussed

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10