722份手稿372个成果族17个分支:OpenAI亮出数学科研硬实力

722份手稿372个成果族17个分支:OpenAI亮出数学科研硬实力

10月7日,OpenAI交出了一份沉甸甸的前沿数学研究成绩单:依托内部未公开的前沿模型,团队累计产出722份数学手稿,覆盖372个数学成果族(所谓“成果族”,指的是围绕特定数学方向形成的一组关联结论,包含主定理、推论、特例与延伸问题,具备完整的研究体系性),其中部分证明已完成Lean语言的形式化验证。

一边是成体系的数学成果集中披露,一边是核心模型秘而不宣,这波操作,展示了AI辅助数学研究的新突破,也透着OpenAI清晰的技术布局逻辑。

一、从“做题”到“造成果”:AI数学能力的量级跃迁

在大众的认知里,AI做数学还停留在“解竞赛题”“刷IMO真题”的阶段——本质上是求解已有标准答案的题目,考验的是模型的解题技巧。而这次OpenAI披露的成果,已经跨过了“解题”的门槛,走到了“产出研究级结论”的阶段。这意味着AI不再只是跟着题目的条件走,而是能在一个数学分支内成体系地探索、推导并产出新的结论。

这批成果的生成路径本身也具备规模化特征:团队先向模型输入了约4000个开放研究问题,再按研究重要性、结论完整性筛选出372组核心成果,最终整理为722份手稿。据OpenAI披露,平均每个结果的推导,消耗约相当于3小时ChatGPT Pro思考的算力。

二、覆盖17个数学分支:完整领域分布与核心方向

根据OpenAI官方仓库的学科分类,372个结果家族完整覆盖17个数学与交叉科学方向,并非单点突破,而是呈现全面开花的态势。从最抽象的数理逻辑到偏向工程应用的偏微分方程,模型的能力覆盖了现代数学的绝大多数主干分支,完整分布如下:

领域 结果家族数量 核心研究方向
理论计算机科学 40 计算复杂性、近似算法下界、图着色复杂度、矩阵乘法算法、去随机化
组合数学 37 极值组合、拉姆齐理论、离散几何、图论猜想、组合不等式
代数与复几何 36 代数几何、霍奇理论、复分析、阿贝尔簇、曲面模空间
数论 31 解析数论、丢番图逼近、黎曼ζ函数零点、希尔伯特第十问题、超越数论
微分几何 29 黎曼几何、辛几何、标量曲率不等式、流形浸入、闭测地线问题
概率与统计力学 29 自旋玻璃模型、渗流理论、随机场、统计物理相变、随机图
数学物理 25 相对论流体方程、量子海森堡模型、安德森局域化、玻色-爱因斯坦凝聚
算子代数 19 冯·诺依曼代数、C*代数、因子同构问题、非交换几何
代数学 18 交换代数、同调代数、群环零因子、表示论、不变量理论
拓扑学 18 代数拓扑、几何拓扑、流形嵌入、同伦猜想、纽结理论
实分析与复分析 16 调和分析、挂谷猜想、复动力系统、函数不等式、拟共形映射
偏微分方程 16 纳维-斯托克斯方程、Vlasov-Maxwell系统、色散方程、正则性问题
凸几何与度量几何 15 凸体几何、Mahler猜想、度量嵌入、几何不等式、填充问题
群论 14 几何群论、有限群表示、群代数结构、拟等距刚性
动力系统与遍历理论 12 哈密顿系统、遍历性、台球问题、熵猜想、反应网络
泛函分析 11 巴拿赫空间理论、算子理论、度量熵、凸分析、逼近论
数理逻辑 6 可计算性理论、集合论、模型论、证明复杂度、图灵度刚性

其中成果数量超过25个的六大核心领域,贡献了超过六成的结果家族,也是本次突破性成果最集中的方向。

Continue reading 722份手稿372个成果族17个分支:OpenAI亮出数学科研硬实力→

大模型的“自我进化”

大模型的“自我进化”:递归自我改进(RSI)到底是什么?

如果你关注近两年的AI进展,大概率会有一种明显的感受:大模型变强的速度越来越快,而“人力参与”的比重却在越来越低。

从前,提升一个模型需要人工标注数据、人工设计奖励、人工调参、人工写提示工程。而现在,前沿研究正在走向一个全新的范式——模型自己生成训练数据、自己评估输出质量、自己优化系统流程、自己迭代能力边界。

这就是当下AI领域最火热的方向之一:递归自我改进(Recursive Self-Improvement, RSI)。它是下一代大模型的重点研发方向之一。

一、什么是递归自我改进?

递归自我改进并不是一个全新的概念。早在1965年,I.J.Good在提出“超级智能”设想时就指出:如果一台机器能在所有智力活动上都超越人类,那它自然也能设计出更好的机器,进而形成自我迭代的反馈循环。

但在大模型出现之前,这更多是科幻和哲学层面的讨论。直到今天,我们才第一次在工程上看到了落地的可能。

递归自我改进,指的是AI系统利用自身的智能,去改进产生这种智能的机制本身,并形成可持续迭代的闭环。

这里有一个关键的区分标准:

  • 普通自我修正≠RSI:推理时对输出进行反思、修改、润色,只是优化“答案”,没有改变模型的能力底层,这叫“有界自我优化”。
  • 真正的RSI:优化的是“生成答案的能力系统”——比如训练数据、奖励机制、模型架构、智能体流程等。每一轮迭代后,系统本身变强了,下一轮就能站在更高的起点上继续改进。

按照2026年最新的综述研究,当前的自我改进可以沿着两个维度划分:改进对象(部署行为、训练策略、评估器、研究过程)和闭环程度(人在回路→半自动化→全闭环)。而我们常说的“递归自我改进”,特指那些闭环程度高、改进对象触及能力生成机制的系统。

Continue reading 大模型的“自我进化”→

JEV:专为机器决策而生的AI模型

JEV:专为机器决策而生的AI模型

近期AI领域诞生了一款打破传统范式的模型——JEV(也被称作System One模型)。它跳出了通用大模型“逐字生成文本”的固有路径,不靠对话交互、不做内容创作,却凭借超高推理速度、极低运行成本、原生结构化决策输出的特性,快速成为AI Agent、业务自动化、智能风控等场景的核心刚需。

不少小伙伴会有疑问:JEV到底是什么?它的训练逻辑、适配任务和通用大模型有何本质区别?为什么它能在高频工业级场景中展现出远超传统LLM的表现?本文将逐一解答这些问题,帮你快速掌握这款新型决策AI的能力边界与适用场景。

一、JEV核心定义:不“说话”,只做决策的专用AI模型

通用大模型(如GPT、Claude、DeepSeek、Qwen等)的核心能力是开放式文本生成,主打“语义理解+内容创作+自然交互”,适配人机对话、文案创作、复杂逻辑推理等场景。而JEV是一款面向机器自动化的结构化概率决策模型,官方对它的定义是:unstructured state in, typed probabilistic decisions out(非结构化状态输入,带类型的概率化决策输出)。

Continue reading JEV:专为机器决策而生的AI模型→

数学研究进入“工业时代”

大模型助力,数学研究从“手工时代”进入“工业时代”

一、Claude 与 OpenAI 的核心数学突破盘点

近期两家机构的成果集中爆发,分别在纯数学猜想推进、形式化证明、组合构造、难题攻坚、标准化测试等多个维度实现了标志性突破:

1. Claude(Anthropic):直击纯数学核心与形式化工程

  • 黎曼猜想关键指标刷新:2026年8月,未公开的研究版Claude在挑战黎曼猜想的过程中,将黎曼ζ函数满足黎曼假设的零点比例下限,从保持了数十年的41.6%大幅提升至67.2%,并生成了可被形式化验证的完整证明,由领域专家验证通过。这是黎曼猜想相关问题数十年里最大的量化进展之一。
  • 费马大定理全形式化验证:2026年9月,Claude仅用11天自主完成了费马大定理的首个端到端机器可验证证明,将怀尔斯129页的人类证明转化为约1300万行Lean代码,证明了2.95万个中间定理,代码规模超过Lean核心数学库Mathlib的5倍。此前学界普遍认为这项形式化工程需要数年时间完成。
  • 组合数学开放问题破解:与计算机科学泰斗Donald Knuth的合作中,Claude Opus 4.6仅用1小时就解决了Knuth研究数周的3D Cayley有向图哈密顿环分解问题(奇数情形),后续由人类完成完整证明,成为人机协作解决开放问题的典型案例。

2. OpenAI:攻坚千禧年难题与突破人类直觉边界

  • 纳维-斯托克斯方程千禧年难题取得实质性突破:2026年9月,GPT-6 Astra团队完整解决了克雷数学研究所千禧年难题中的C、D两类情形(A、B类仍未解决)——构造出带有光滑外力的三维纳维-斯托克斯方程的有限时间爆破反例,涵盖三维全空间与三维周期空间两种场景。
  • 组合几何构造创新:在埃尔德什1946年提出的“平面单位距离问题”中,AI跳出了人类沿用数十年的正方形网格等经典结构思路,设计出全新的点集构造方法,在相同点规模下实现了更多单位距离对,被认为突破了人类的几何直觉边界。
  • 辅助破解经典开放问题:帮助无正规数学训练的业余爱好者,解决了困扰学界60年的埃尔德什第1196号问题,证明了AI可以降低前沿数学的参与门槛,让非专业人士也能做出实质贡献。
  • 研究级数学测试全面通关:2026年9月,GPT-6 Astra攻破FrontierMath Tier 4测试的最后一道难题。全面突破这套曾被视为“AI数学天花板”的研究级题库,仅用了14个月(正确率从5%-》97.6%)。

Continue reading 数学研究进入“工业时代”→

狂堆核心的GPU VS 理性克制的CPU

狂堆核心的GPU VS 理性克制的CPU

如果你和我一样是个技术爱好者,或者近期关注过电脑,你大概率会有一个这样的疑问:
旗舰显卡动辄宣称 “上万个计算核心”,芯片尺寸一路朝着光刻机的物理极限狂奔,晶体管数量几年翻几倍;而主流笔记本的 CPU,还停留在 6 核、8 核,顶配游戏本也就 16 核、24 核,核心数涨得格外佛系。AI 火了之后就更明显了:大厂拼算力都在疯狂堆显卡,一张卡几万美金毫不心疼,却没人说 “堆一万个 CPU 核心”。

同样是电脑里的计算芯片,同样是用硅晶圆做出来的,为什么 GPU 能越做越大、核心越堆越多,CPU 却不照着这条路走呢?并非技术上做不到,而是这两者从根上就是在不同的场景,做着不同的任务。

Continue reading 狂堆核心的GPU VS 理性克制的CPU→

AI编码效率翻倍,公司业务为啥没感觉

AI编码效率翻倍,公司业务为啥没感觉?阿姆达尔定律揭露AI编程提效天花板

近期,大模型的爆发和AI编程工具的发展,实实在在降低了编码门槛,样板代码、接口实现、单元测试这类重复性工作,综合产出效率普遍能达到原来的 1.5~2 倍。但与此同时,另一个体感悖论也越来越突出 ——代码写得更快了,项目上线速度、公司整体交付效率,却完全没有出现同比例的提升,很多团队甚至感觉评审、测试环节反而更堵了。

这不是管理失当,也不是 AI 不够强。早在半个多世纪前,计算机科学家吉恩・阿姆达尔提出的一条经典定律,就精准预言了今天的局面。

Continue reading AI编码效率翻倍,公司业务为啥没感觉→

Agent购物带来新挑战

Agent购物带来新挑战:当决策入口与履约剥离,电商的底层逻辑正在被彻底改写

近期各大电商陆续开始提供AI购物功能,各大AI平台也开始提供比价甚至购物功能(国内生态比较封闭,第三方购物Agent反而是国外走到了前列)。当你对着 AI 助手说一句 “帮我选一款千元以内无线降噪半入耳耳机,明天能送到”,就能直接收到下单确认时,你可能没意识到:电商行业运行了二十年的商业规则,正在被悄然拆解。

Agentic Commerce(代理式电商)不是货架电商、兴趣电商之后的一次界面升级,它的真正冲击力,不在于 “大家以后都不打开 App 了”,而在于它把 “决策入口” 和 “履约 / 供应链” 两层彻底剥开了。AI Agent 作为新的中间层拿走了筛选与决策的权力,传统平台则逐步退化为供给与履约的后端服务商。短期看传统投流、直播不会被颠覆,但标品、复购品的营销效用会被显著削弱;中长期看,谁握有 “AI 愿意调用” 的供给与履约能力,谁就握有了新的行业议价权。

Continue reading Agent购物带来新挑战→

大模型业务赚钱吗

大模型业务赚钱吗

大模型业务赚钱吗

AI这几年的发展如火如荼,各路大神各有各的故事。但谈到赚钱,就几家欢喜几家忧了:
1、卖铲子的赚钱了:AI硬件、AI计算基础设施、AI能源供给
2、挖金子的没赚钱:大模型研发第一梯队已经十分明显,其余厂商难以坚持;美国和中国的大模型厂商,暂时没有一个可以通过大模型盈利的,投资者不会这么有耐心
3、做通用AI APP的没赚钱:通用AI APP由次请求都要烧token,所以没法像互联网APP一样可以通过规模化大幅降低成本。而且暂时没有一个路径,让消费者愿意大规模买单
4、做垂直AI APP的少量可以赚钱:比如编程、法律咨询等,因为确实大幅提升了客户的效率,或降低了客户的成本,买单逻辑成立;但更多的垂直AI APP也在挣扎
5、企业服务,还是有单可拿,有钱可赚的,但算不清楚,容易亏钱
6、部分传统行业,受到冲击很大,通过AI积极降本的赚钱了,被AI冲击导致丢单的的承压严重
7、灰产一如既往的积极应用新技术,给安全领域提出了新的挑战
8、数据标注行业同样内卷严重,能拿到什么单子,决定公司的发展
9、怎么看,公司有个好爹都很重要

Continue reading 大模型业务赚钱吗→

《人工智能拟人化互动服务管理暂行办法》发布,生与死

《人工智能拟人化互动服务管理暂行办法》发布,生与死

2026 年 4 月 10 日,国家互联网信息办公室、国家发展和改革委员会、工业和信息化部、公安部、国家市场监督管理总局五部门联合签发第 21 号令,正式公布《人工智能拟人化互动服务管理暂行办法》,自 2026 年 7 月 15 日起施行。

这是国内首部针对 AI 拟人化情感互动服务的专项监管文件,通过明确的适用边界与禁止条款,直接划定了赛道内玩家的生死线。

Continue reading 《人工智能拟人化互动服务管理暂行办法》发布,生与死→