张大妈

AI破解困扰数学界70年难题:人机协作新模式改写研究范式

源自96位全网作者

05-21 20:27

内容由AI生成

精选参考来源

1. 谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA

2. 23岁门外汉携ChatGPT,攻克60年数学猜想!陶哲轩:我们全走偏了

3. 刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文

4. 领跑!30B模型登顶OpenAI科研榜单,UniPat AI冲上开源科研最前线

5. DeepSeek开源IMO金牌模型,OpenAI和谷歌如何接招?

6. 突发|ChatGPT 版应用商店正式上线

7. DeepSeek-Math-V2数学模型开源,成绩碾压OpenAI和谷歌同类模型

8. 当AI开始泡在数学项目里:DeepMind的48%突破意味着什么?

9. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

10. 如何看待姚班大神陈立杰官宣入职 OpenAI?

11. 30年数学难题,AI仅6小时告破!陶哲轩:ChatGPT们都失败了

12. OpenAI推出Prism工具,助力科学家加速AI驱动的科研发现1月28日,OpenAI宣布推出全新免费工具“Prism”,这是一个专为科学家设计的AI原生协作工作空间,旨在大幅简化科研论文撰写、协作与修订流程,并进一步推动AI在科学发现中的应用。Prism基于OpenAI最新模型GPT-5.2构建,后者被OpenAI称为“在数学和科学推理方面最先进的模型”。该工具采用LaTeX原生格式——这是科研界撰写包含复杂公式论文的标准系统——将传统上分散在多个软件中的工作流整合到一个云端平台中,包括文本编辑、公式处理、参考文献管理、图表插入与AI辅助修订等功能。Prism的核心亮点在于其“全文档上下文”能力:AI能够同时理解论文的周围文本、方程式、引文、图表及整体结构,从而实现更精准的草稿生成、修改建议、公式重构与跨元素推理。科学家可直接在界面中与AI对话,让其帮助起草段落、优化论证逻辑或检查一致性,而无需频繁切换工具或手动复制粘贴。OpenAI表示,此举是其“OpenAI for Science”倡议的重要一步。该倡议旨在将前沿AI模型与真实科研环境深度结合,目标是将原本可能耗费数十年的人类发现过程压缩至数年。OpenAI高管强调:“2025年,AI彻底改变了软件开发;2026年,我们预计科学领域将迎来类似变革。”Prism对所有拥有ChatGPT个人账户的用户免费开放,支持无限协作者与项目,无需额外订阅。这一低门槛设计有望吸引全球广大科研人员尝试。OpenAI同时指出,虽然当前AI在数学证明、生物实验设计、材料模拟等领域已展现出“人类专家水平”甚至超出的表现,但仍建议研究者将其作为协作助手,而非完全自动化研究——人类判断在问题定义、假设验证与最终洞见提炼上依然不可或缺。近年来,OpenAI持续加大在科学领域的投入,包括与美国能源部国家实验室合作、发布数学与生物学前沿成果等。Prism的推出被视为公司从通用聊天工具向专业科研基础设施转型的标志性产品,也反映出AI巨头之间在“AI for Science”赛道的激烈竞争——谷歌DeepMind等公司也在同期推进类似的多智能体“AI co-scientist”系统。目前,Prism已通过网页应用形式上线,用户可直接登录ChatGPT账户访问。OpenAI表示,将根据科研社区反馈持续迭代该工具,并计划未来扩展至更多学科与更深层次的发现辅助功能。

13. 美国AI霸主一夜易主!这对中国意味着什么? #大有学问 #红衣聊AI #openAI #anthropic #华尔街

14. 第1个获得数学奥赛金牌的开源模型!DeepSeek新模型获网友盛赞:公开技术文件,了不起!

15. 菲尔兹奖得主用AI解出博士级数学题,然后他开始为博士生们发愁了

16. GPT-5.5 Instant 正式发布!免费可用,实测到底强多少?OpenAI 五大升级一次看懂! | 零度解说

17. 爱因斯坦、费曼在智能体世界「复活」:30分钟刷新Erdos经典数学问题记录

18. DeepSeek推出DeepSeekMath‑V2 模型,主攻自验证数学推理能力

19. OpenAI震撼发布GPT-5.2 ,号称霸榜全球,如何看待? 有哪些突破性进展?

20. AI搞科研,算得准不如想法多。 #大咖观察 #红衣聊AI #科研 #Meta #创新创业

21. 创意多样性,决定了AI科研的天花板。 #大咖观察 #红衣聊AI #科研 #创意

22. 目前最强OpenClaw安装分享!对接飞书!普通人最该体验的AI Agent项目

23. Meta的秘密项目居然偷师千问?偷早啦!千问发布旗舰推理模型Qwen3-Max-Thinking#Qwen3 #千问 #科技改变生活 #AI新星计划 #玩个很新的东西

24. 阿里甩出 AI 王炸! Qwen3-Max-Thinking 高调对标 GPT-5.2-Thinking,是真硬刚还是博眼球?这款阿里旗舰推理模型拿下 19 项国际基准测试高分,自带自适应工具调用,能自主搜信息、做计算,主动解决问题,还成了阿里全生态的技术底座,打通电商、本地生活等全场景实现智能闭环。 有人说它缩小了中外 AI 差距,坐稳中文 AI 头把交椅,让阿里 AI 生态形成良性循环,未来可期;也有人质疑,对标全球顶尖模型只是纸面数据,落地商业场景的实际能力仍需检验。 阿里这次的 AI 大招,到底是技术突破的里程碑,还是营销造势的噱头?这款模型的真实实力究竟如何,一起来聊聊吧!#微博超有用视频大赛##上微博涨知识##AI创造营##科技先锋官# http://t.cn/AXqpEa95

25. 如何评价 OpenAI 最新发布的 GPT-5.5 模型?

26. AI Builders Digest — 2026年4月11日🎙️ 播客Unsupervised Learning · Ep 84OpenAI 首席科学家 Jakub Pachocki 对谈:持续学习、RL 在编程之外的扩展、以及对齐方向核心洞察:Jakub Pachocki 接受 Redpoint 合伙人 Jacob Efron 采访,坦率分享了 OpenAI 内部研究进展与思路。他透露,Codex 已经成了 OpenAI 工程师的"主力编程工具",大多数代码工作已由 AI 完成;数学研究能力也在快速逼近 IMO 金牌水平,并正向更高难度的科研数学推进。Pachocki 还透露,GPT-5.2 Pro 已经产出了令他本人惊讶的小型研究 idea,“虽然还很初步,但这是重要的信号”。在 RL 扩展方向上,他认为 RL 的核心优势在于可验证奖励(比如单元测试通过与否),这也是编程和数学率先突破的原因。但他相信 RL 的范式会扩展到医学、法律等更难评估的领域——关键在于让模型学会判断阶段性进展,而不是只等最终结果。关于对齐研究,Pachocki 展示了一个关键洞察:思维链(Chain of Thought)不应被监督,这是 O1 发布时隐藏 CoT 的核心原因——如果把 CoT 也纳入训练目标,模型会学会"表演"安全而非真正安全。他将这个方法与机械可解释性类比,认为 CoT 天然是英文的、可读的,是理解模型行为的强大工具。金句:“We are at a transition point where the short term immediate quality of the model is about to be a quite determining factor for the pace of our research progress.”模型正从"研究对象"变为真正的"研究伙伴"——这个转变比大多数人想象的更快。🔗 网页链接🐦 X / TwitterAndrej Karpathy · 前 OpenAI 创始成员、特斯拉前 AI 总监Karpathy 指出当前存在一种"AI 认知鸿沟":大多数人用的是去年免费版的 ChatGPT,这让他们对 AI 能力的判断严重落后。他将这种认知差异命名为"AI Psychosis"——尤其在编程、数学、研究领域,Claude Code 和 OpenAI Codex 能在数小时到数天内完成过去需要数周的工作,其能力提升幅度与普通用户的感知完全脱节。说 AI 很强和说 AI 很弱的人,描述的是完全不同的东西。网页链接Sam Altman · OpenAI CEOAltman 罕见发推力挺 Codex 产品线,并透露 OpenAI 正在推出 $100/月的 ChatGPT Pro 套餐——回应了市场强烈的付费需求。网页链接Aaron Levie · Box CEOLevie 最核心的观点:软件自动化的需求被严重低估——不是说手机上多一个 App,而是那些每天替企业跑流程、整合数据、消除重复劳动的 AI Agents,这才是最大的一块市场。关于提示词,他认为"清晰表达指令"本身就是高杠杆技能,"prompts"本质上就是给 Agent 完整的上下文,没有它就没有好的执行。网页链接网页链接Guillermo Rauch · Vercel CEORauch 提出了一个前瞻判断:Agentic Infrastructure 是云计算的下一个形态。他将 Pages → Agents 类比为当年从静态网站到动态 Web 应用的转变——长时运行计算、沙盒隔离和 Token 级传输网络将成为基础设施层。同时他贴出实时数据:每秒执行一次 npx shadcn init,展示了 AI 驱动软件创建的速度量级。网页链接#科技先锋官##How I AI#

27. Deepseek团队为什么把大量精力花在IMO这种对普通人和商业应用都没有用途的地方?

28. 推翻150年数学直觉:数学家烧坏几台笔记本,解决几何拓扑难题

29. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

30. OpenAI翻车,会把全球第一的宝座拱手让人吗? #大咖观察 #红衣聊AI #OpenAI #人工智能

31. 给AI投毒,一场关于“最终答案”的信任战争

32. 陶哲轩亲自曝光:AI破解数学难题,竟全是「抄」的?

33. 【OpenAI发布新一代模型GPT-5.5 冲刺AI超级应用】AI巨头持续加码智能体。美国当地时间4月23日,OpenAI宣布推出最新大模型GPT-5.5,该模型被OpenAI称为其迄今为止最智能和易用的模型,主打在极少人类指令下处理复杂的多步骤任务。目前,GPT-5.5及推理能力更强的GPT-5.5 Pro仅向付费用户开放,由于API(应用程序接口)部署需要不同的安全措施,OpenAI表示API版本将在近期推出。OpenAI发布新一代模型GPT-5.5 冲刺AI超级应用  据OpenAI官方技术博客,GPT-5.5的核心优势在于其独立工作的能力,不仅能更快速地理解用户意图,还能承担更多实际工作。该模型擅长编写和调试代码、在线研究、数据分析、创建文档和表格,甚至能够跨越多个软件工具直到完成任务。  另据美国科技媒体TechCrunch的报道,OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)在与媒体的电话简报会上称,新模型能在不需要太多指导的情况下完成任务,带来了更加符合直觉的体验,是迈向智能体的重要一步。  在体现真实编程和电脑使用能力的基准测试中,GPT-5.5展现出明显优势。效率是此次升级的另一大亮点。

34. OpenAI 这是要觉醒了吗?要整合为一个超级应用。所以,你看,未来应用还是不会消失的,那什么样的应用不会消失呢?就是这款应用既适合人类操作,又方便 AI 在里面运行的应用。换句话说,纯粹给人用的应用会被 AI 替代掉一部分,纯粹给 AI 用的后台管道又缺少用户粘性。真正能活下来的,是那种人机共栖的产品形态:人在里面做决策、做创意,AI 在里面跑任务、做执行,两者共享同一套界面和数据。OpenAI 把聊天、写代码、浏览器塞进一个壳里,本质上就是在赌这个方向。#How I AI##科技先锋官#

35. 千问PC端上线AI语音输入,无需切换各类应用直接用AI助手创作、翻译,给普通人工作学习带来哪些变化?

36. 2026年普通人学习AI的方法指南!

37. 普通人如何用AI搞钱!零基础保姆级教程来了

38. 爆火出圈!一文了解AI神器OpenClaw(小龙虾)到底是个啥?普通人能玩吗?

39. 刚刚,MOSS孙天祥创业,直播AI4AI大规模科研

40. 提前的反击能改变这轮AI竞争的走向吗? #大咖观察 #红衣聊AI #人工智能 #科技 #OpenAI

41. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

42. 阿里全家桶全面Agent化!千问“任务助理”全面公测,从此AI不再只是动嘴出主意的狗头军师!

43. GPT-5.5 发布!OpenAI已经不造天才了

44. OpenAI 重磅发布 GPT-5.2!效果惊人实测 ,附最新免费使用方法,切勿错过! | 零度解说

45. 如何看待 DeepSeek 发布的新模型 DeepSeek-Math-V2?AIGC、人工智能等话题优秀答主【平凡】:数学推理团队可能是 DeepSeek 的王牌。因为他们在解决 AI 最本质的问题:如何让一个模型真正「思考」,而不是表面上看起来像是在思考。

46. 如何评价陶哲轩《AI 时代的数学方法与人类思想》这篇文章?你有哪些思考?

47. OpenAI加速研发全新模型“Garlic”,直面谷歌AI进展压力

48. GRPO、GSPO 后,Qwen又提出了一种SAPO的新算法,已被用于训练 Qwen3-VL 系列模型论文:arxiv.org/pdf/2511.20347算法主要期望解决大语言模型 RL 训练中的不稳定性问题,特别是针对 MoE模型。通过引入平滑的门控机制和非对称温度控制,提供了一种比传统硬截断方法(GRPO/GSPO)更可靠、更具扩展性的 LLM 强化学习优化策略 。#科技先锋官#

49. AI写的论文,过了同行评审——科研这件事,正在被重新定义

50. 奥特曼最新访谈:AI时代,普通人成为赢家的方法#AI #山姆奥特曼 #科技 #教育 #openai#AI时代的教育#家庭教育

51. 最近数学圈发生了一件很有意思的事。世界顶级数学家陶哲轩在解决一个 Erdős(埃尔德什)的经典问题时,全流程都在用 AI 做助手——从证明草案,到简化证明,再到形式化验证。Erdős 是20世纪最高产的数学家之一,一辈子发表了1500多篇论文,提出了无数开放问题。数学圈有个著名的"埃尔德什数"——如果你和他合作过论文,你的埃尔德什数就是1;和他的合作者合作过,就是2,以此类推。爱因斯坦的埃尔德什数是2。后来有人专门做了一个网站,把他的很多未解决/已解决问题系统整理出来,这就是 Erdos Problems 网站。陶哲轩讲的是其中的第 367 号问题,属于数论里的一个具体问题,专业数学研究级别的问题。解决过程大概是这样的:一位数学家 Wouter van Doorn 先给出一个人类手写的反例证明草案,但里面有一个关键恒等式他没完全证明,只是说:“相信有人能帮我确认一下”。陶哲轩把这个恒等式扔给 Google 的 Gemini Deepthink 模式。大概十分钟后,Gemini 给出了一份完整证明,还顺带确认了整套论证是成立的。Gemini 的证明用到了 p-adic 等比较高级的代数数论工具,对这个具体问题来说有点杀鸡用牛刀。于是陶哲轩花了半小时,把 AI 的证明手工转化成更基础、更易懂的版本。两天后,另一位数学家 Boris Alexeev 用一个叫 Aristotle 的工具(基于 AI + Lean)完成了全套形式化证明,还特意手动检查最终结论,以防 AI 在形式化过程中存在编造。陶哲轩觉得还没完,又用 Deep Research (同时用了 ChatGPT 和 Gemini)做了一轮文献搜索,看这个问题有没有前人类似工作。结果找到了若干关于连续幂数的相关论文,但没有直接解决第 367 号问题。整个流程:人类提出猜想 → AI暴力证明 → 人类简化优化 → AI辅助形式化验证。都在说 Gemini 3 已经到了博士生水平,看来所言非虚,这些事情真的需要数学博士级别才能做的出来,但另一方面,真正的数学家也并没有被 AI 代替:是人类决定哪个问题值得解决,是人类判断AI的p-adic方法太重了需要简化,是人类手工完成最终的形式化表述以验证 AI 的结果是否准确。AI 做的是那些需要大量计算、符号推演、但方向已经明确的体力活。在 AI 时代,问对问题、甄别结果,比以前更重要了。(注:配图提示词 网页链接 )

52. #傅盛说中国AI应用迎来要爆了时刻##技能五子棋被AI实现了#傅盛的断言基于技术平民化、市场规模与政策红利的叠加。中国AI正从“模型竞赛”迈入“应用深耕”,其爆发不仅是技术迭代,更是开发民主化与社会生产关系的重构。能否持续领先,取决于生态整合能力与原创技术突破的平衡。

53. 陶哲轩

54. AI能秒杀数学证明,人类数学家反而更值钱了

55. 谷歌「AI协同数学家」来了!48%准确率刷新SOTA

56. 多位数学家谈AI在数学领域的影响

57. 【观点洞察】“塑造AI 时代数学的未来”-菲尔兹奖得主 Akshay·Venkatesh最新论述

58. 数学研究,AI一小时,人类一百年?

59. 观点分享丨陶哲轩最新演讲

60. 80分钟搞定60年数学猜想:23岁门外汉带着ChatGPT,让数学家们集体破防

61. AI六小时破解数学界30年难题 菲尔兹奖得主:人类该反思了

62. IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半

63. OpenAI致力打造自主“AI研究员”

64. 【故事】门外汉、剑桥学生与大模型:一道六十年数论猜想的AI破壁之路

65. 48小时破50年僵局!陶哲轩携AI拆解Erdős#1026,数学界要变天?

66. AI 不只是会做数学题了,它正在变成数学家的“研究搭子”

67. AI模型开始攻克高难度数学问题

68. 当 AI 化身你的科研伙伴:惊喜与陷阱同在

69. 这家新型机构用AI推动三百年数学难题迎来系统性突破

70. DeepMind 发布 AI 协同数学家,在 FrontierMath 基准测试中创下新高分

71. AI5天啃下1年3个月数学硬骨头 挑出菲奖论文瑕疵 重构科研逻辑

72. 【AI前沿访谈】当AI开始精通数学,离AGI还有多远?

73. 656行代码5小时搞定,Axiom AI自主完成两项Erdős猜想形式化证明

74. 清华AI数学家系统攻克均匀化理论难题!人机协同完成17页严谨证明

75. 数学正在经历一场AI革命

76. AI与数学“双向奔赴”,中国团队突破亲吻数问题

77. 2026年初数学领域重磅新闻(AI+纯数学双突破)

78. GPT-5.5幻觉率暴降52.5%,为什么我反而更不放心了?

79. 普通人用AI攻克数学猜想的时代,要来了?

80. 20250730 - OpenAI的IMO团队 - 为什么模型解决了精英水平的数学

81. AI解开数学题,科研工具要换挡

82. ChatGPT 证明 Erdős 猜想:一次“AI 数学”狂欢背后的冷思考

83. 新知 | 为什么AI让验证“橙子装箱问题”证明再也不用费十几年——AI模型能给数学家提供一种通用语言

84. Nature子刊 | 为什么我们更怕冷酷的机器人?揭秘 AI 信任背后的“温度之谜”

85. 45年数学难题AI 用10分钟破解!揭示普通人想用AI逆袭只需死磕这3步!

86. AI飞驰如电,数学家们对未来摸不着头脑

87. AI数学证明为何让数学家不安?

88. HarmonicMath 宣称 Aristotle AI 成功证明 Paul Erdős 第 124 号数学问题的 “简化版本”

89. 精读DeepSeekMath-V2论文,Putnam数学竞赛118/120分,超越人类最高分

90. “个人信任度”正在成为 AI 时代的新型生产力

91. GPT-5.2 独立证明 45 年数学猜想?陶哲轩的冷静提醒比 headline 更重要!

92. 【AI 简史】(八)o1 模型 · 慢思考对快直觉的“重构”

93. AI推理进化史:从GPT到推理模型,AI的“思考能力”如何突破?

94. 阿里宣布千问和淘宝全面打通,上线 AI 购物功

95. AI人工智能时代的数学家们——塔玛拉・G・科尔达(Tamara G. Kolda)

96. AI数学家Axiom:不做聊天,只做证明,它为何能入选Forbes潜力榜?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章