从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新
解读 DeepSeek 旗舰开源权重模型的演进之路
与 DeepSeek V3 的发布节奏类似,团队选择在美国一个重要假期的周末推出了这款全新旗舰模型。DeepSeek V3.2 的性能达到了 GPT-5 与 Gemini 3.0 Pro 的级别,同时还是一款开源权重模型,绝对值得深入研究。
图 1:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。
我曾在《LLM 架构大盘点》一文的开篇详细介绍过其前身 DeepSeek V3,过去几个月里,随着新架构不断发布,我也一直在持续更新这篇文章。原本刚和家人过完感恩节假期回来,我只打算给这篇文章新增一个小节,补充 DeepSeek V3.2 的相关内容,但后来发现值得探讨的亮点太多,便决定单独写一篇更完整的长文。
他们的技术报告中有大量值得挖掘的内容与经验,我们这就开始。
1. DeepSeek 发布时间线
尽管 DeepSeek V3 在 2024 年 12 月发布之初并未迅速走红,但基于同款架构、以 DeepSeek V3 为基座的 DeepSeek R1 推理模型,让 DeepSeek 跻身最受欢迎的开源权重模型行列,成为 OpenAI、Google、xAI、Anthropic 等闭源模型的有力替代方案。
图 2:2024 年 12 月发布的 DeepSeek V3/R1 架构。我们将在后续章节回顾并详细拆解其架构细节。
那么,自 V3/R1 之后,DeepSeek 有哪些新进展?可以肯定的是,DeepSeek 团队这一年一定非常忙碌。但自 DeepSeek R1 发布以来,过去 10 到 11 个月里都没有重大版本更新。
在我看来,大型语言模型的重大版本间隔约 1 年是合理的,毕竟研发工作量极大。但我在各大社交平台上看到,不少人已经开始断言这个团队 “销声匿迹”,认为他们只是昙花一现。
我相信 DeepSeek 团队也一直在忙于适配从英伟达到华为芯片的切换。顺便说明,我与该团队无任何关联,也未与他们有过交流,本文所有内容均基于公开信息。据我所知,他们目前已重新使用英伟达芯片。
另外,他们也并非完全没有发布新产品,今年陆续推出了几个小型版本,比如 DeepSeek V3.1 和 V3.2-Exp。
图 3:去年至今 DeepSeek 的发布历程。核心模型以红色标注。
正如我今年 9 月的预测,DeepSeek V3.2-Exp 的发布,目的是让生态与推理基础设施提前适配,为刚推出的 V3.2 模型铺路。
V3.2-Exp 与 V3.2 采用了一种非标准的稀疏注意力变体,需要自定义代码实现,该机制的细节我们稍后展开。(我原本想在上一篇《超越标准 LLM》的文章中介绍它,但当时恰逢 Kimi Linear 发布,我便优先在新注意力变体章节讲解了 Kimi Linear。)
2. 混合推理模型 vs 专用推理模型
在深入讲解模型细节之前,我们先梳理一下模型的整体类型。最初,DeepSeek V3 以基座模型的形式发布,而 DeepSeek R1 则在其基础上经过额外后训练,成为专用推理模型。整个流程如下图所示。
图 4:DeepSeek R1 训练流程概览。该图出自我的《深度解读推理型 LLM》一文,文中有更详细的说明。
你可以在《深度解读推理型 LLM》一文中,了解上图训练流程的更多细节。
这里需要明确:DeepSeek V3 是基座模型,DeepSeek R1 是专用推理模型。
与 DeepSeek 同期,其他团队也推出了多款性能强劲的开源推理模型。今年表现最突出的开源模型之一是 Qwen3,它最初以混合推理模型的形式发布 —— 用户可以在同一个模型内切换推理与非推理模式。(Qwen3 通过分词器添加或移除 \\ 标签来实现模式切换。)
此后,各个 LLM 团队陆续推出了专用推理模型和指令 / 推理混合模型,部分团队还在两种路线之间反复调整,时间线如下。
图 5:今年部分推理模型与混合模型的发布时间线。
比如 Qwen3 最初是混合模型,但通义团队后续拆分出了独立的指令模型和推理模型 —— 拆分后开发难度更低,且在各自场景下的性能表现更优。
而 OpenAI 的 gpt-oss 等模型仅提供混合版本,用户可以通过系统提示词控制推理强度(我推测 GPT-5 和 GPT-5.1 也采用了类似的实现方式)。
而 DeepSeek 的路线恰好相反:从专用推理模型(R1)转向了混合模型(V3.1 与 V3.2)。不过我认为,R1 本质上是一个研究项目,目的是探索推理方法、打造当时最优的推理模型;而 V3.2 的发布,更偏向于打造适配多场景的综合最优模型。(从这个角度看,R1 更像是一个试验台或原型模型。)
另外我推测,尽管 DeepSeek 团队在 V3.1 和 V3.2 中集成了推理能力,但他们可能仍在研发专用的 R2 模型。
3. 从 DeepSeek V3 到 V3.1 的演进
在详细讲解全新的 DeepSeek V3.2 之前,先梳理 V3 到 V3.1 的核心变化,会更有助于理解。
3.1 DeepSeek V3 概览与多头潜注意力(MLA)
我已在多篇文章中详细拆解过 DeepSeek V3 与 R1。概括来说,DeepSeek V3 作为基座模型,有两大核心架构亮点:混合专家(MoE)与多头潜注意力(MLA)。
相信大家对 MoE 已经比较熟悉,这里就不再展开介绍。如果想了解更多,可以参考我《LLM 架构大盘点》一文中的简要概述,获取更多背景信息。
另一大亮点是 MLA 的应用。DeepSeek V2、V3 与 R1 均采用了 MLA,它是一种显存优化策略,与 KV 缓存的适配性极佳。MLA 的核心思路是:先将键(K)和值(V)张量压缩到低维空间,再存入 KV 缓存。
推理时,再将这些压缩后的张量投影回原始维度后使用,如下图所示。这一过程会增加一次矩阵乘法,但能显著降低显存占用。
(补充说明:查询(Q)向量也会被压缩,但仅在训练阶段执行,推理阶段不压缩。)
图 6:DeepSeek V3/R1 中的多头潜注意力(MLA)。(为简化图示,未画出查询向量的压缩空间。)
上图阐释了 MLA 的核心原理:键和值先被投影为潜向量,再存入 KV 缓存以降低显存需求;后续使用时需要再通过上投影还原到原始键值空间。整体而言,这种设计提升了运行效率(可以类比 LoRA 中的降维投影与升维投影)。
注意,查询向量也会被投影到独立的压缩空间,原理与键、值的压缩类似;为了图示简洁,上图中省略了这部分。
顺便一提,如前所述,MLA 并非 DeepSeek V3 的首创,其前身 DeepSeek V2 就已经采用(甚至是首创)了这一机制。
3.2 DeepSeek R1 概览与可验证奖励强化学习(RLVR)
DeepSeek R1 与上述 DeepSeek V3 架构完全一致,差异在于训练方案。具体来说,DeepSeek R1 以 V3 为基座,重点采用可验证奖励强化学习(RLVR)方法,来提升模型的推理能力。
RLVR 的核心思想是:让模型从可通过符号或程序验证的回复中学习,比如数学题和代码题(当然,该方法也可拓展到这两个领域之外)。
图 7:可验证任务示例
组相对策略优化(GRPO)算法,本质上是近端策略优化(PPO)的简化版本。PPO 是人类反馈强化学习(RLHF)中的主流算法,广泛用于大语言模型的对齐。
图 8:LLM 训练中不同强化学习方案的对比。传统基于 PPO 的 RLHF 同时使用奖励模型(基于人类偏好训练)和评判模型(价值模型)来引导学习;GRPO 去掉了评判模型;而结合 GRPO 的 RLVR 更进一步,移除了奖励模型,转而依赖计算器、编译器等符号工具提供的可验证奖励。
如果你想了解更多细节,可以参考我《LLM 推理强化学习现状》一文,其中详细讲解了结合 GRPO 的 RLVR 训练方法,包括背后的数学原理。
3.3 DeepSeek R1-0528 版本升级
正如 DeepSeek 团队所言,DeepSeek R1-0528 本质上是一次 “小版本升级”。
架构与 DeepSeek V3/R1 保持一致,性能提升主要来自训练侧的优化,使其在当时能追平 OpenAI o3 与 Gemini 2.5 Pro 的水平。
遗憾的是,DeepSeek 团队并未公开具体的实现细节,仅表示部分提升来自后训练流程的优化。另外根据公开信息推测,其云端部署版本在推理时会调用更多算力,执行更长的推理过程。
3.4 DeepSeek V3.1 混合推理能力
DeepSeek V3.1 是一款同时具备通用对话(指令)与推理能力的混合模型。也就是说,团队不再开发两个独立模型,而是用单一模型承载两种能力,用户可通过对话提示模板切换模式(与初代 Qwen3 的设计类似)。
DeepSeek V3.1 基于 DeepSeek V3.1-Base 开发,而后者又以 DeepSeek V3 为基座,三者架构完全相同。
4. DeepSeek V3.2-Exp 与稀疏注意力
2025 年 9 月发布的 DeepSeek V3.2-Exp,是更值得关注的版本。
DeepSeek V3.2-Exp 发布之初,基准测试成绩并未登顶,因此当时并未引发太多关注。但正如我 9 月的推测,这大概率是一次早期实验性发布,目的是让基础设施(尤其是推理与部署工具)提前适配后续的重大版本 —— 因为 V3.2-Exp 包含了几项架构改动。而真正的重大版本是 DeepSeek V3.2(而非 V4),细节我们稍后展开。
那么 DeepSeek V3.2-Exp 有哪些新特性?首先,它以 DeepSeek V3.1-Terminus 为基座进行训练。什么是 V3.1-Terminus?它就是上一节提到的 V3.1 检查点的小幅优化版本。
技术报告中提到:
DeepSeek-V3.2-Exp 是一款实验性稀疏注意力模型,通过持续训练为 DeepSeek-V3.1-Terminus 集成了 DeepSeek 稀疏注意力(DSA)机制。DSA 是一种由闪电索引器驱动的细粒度稀疏注意力机制,让 DeepSeek-V3.2-Exp 在训练和推理阶段均实现了显著的效率提升,在长上下文场景下尤为明显。
如上文所述,核心创新在于 DeepSeek 稀疏注意力(DSA)机制 —— 团队先给 V3.1-Terminus 加入 DSA,再基于该检查点做进一步训练。
DSA 由两部分组成:1)闪电索引器;2)令牌选择器,目标是选择性地缩减上下文,从而提升效率。
要解释它的工作原理,我们先从滑动窗口注意力说起。滑动窗口注意力是近年 Gemma 3、Olmo 3 等模型采用的技术,它将注意力窗口限制在固定大小内,如下图所示。
图 9:在滑动窗口注意力中,当前查询令牌不会关注所有历史令牌,而只关注其中一部分。
DSA 与滑动窗口注意力的核心思路一致:仅让模型关注部分历史令牌。但不同的是,DSA 并非通过固定宽度的滑动窗口选择令牌,而是通过索引器和令牌选择器动态决定要关注哪些历史令牌。换句话说,被关注的令牌分布更灵活,如下图所示。
图 10:在 DSA 中,当前令牌仅能关注选定的少量历史令牌(而非普通因果注意力中的全部令牌)。
不过,我刚才说的 “灵活” 并非随机,历史令牌的选择模式是模型学习得到的。
实际运行中,DSA 通过所谓的 “闪电索引器”,基于所有历史令牌为每个新查询令牌计算相关性得分。计算时,闪电索引器利用 DeepSeek 多头潜注意力(MLA)中的压缩令牌表示,计算令牌之间的相似度。相似度得分本质上是查询向量与键向量经缩放点积后,再通过 ReLU 函数的结果。
如果你对数学细节感兴趣,闪电索引器相似度得分的公式(摘自论文)如下:
其中,w 是每个注意力头可学习的权重系数,决定每个索引头对最终相似度得分的贡献度;q 代表查询向量,k 代表键向量。各下标含义如下:
-
t:当前查询令牌的位置;
-
s:序列中历史令牌的位置(0 ≤ s < t);
-
j:不同索引头的索引(为简化,图 10 仅画出一个头),因此 qt, j 表示 “索引头 j 中当前令牌 t 的查询向量”。
你可能会注意到,索引器仅作用于查询向量,不作用于键向量。这是因为模型只需要判断每个新查询应该关注哪些历史令牌,而键向量已经被压缩并存入 KV 缓存,索引器无需再对它们分头打分或重复压缩。
这里的 ReLU 函数(f (x) = max (x, 0))会将负的点积结果置零,理论上能带来稀疏性,但由于要对多个头的结果求和,索引器得分实际为 0 的概率很低。真正的稀疏性来自独立的令牌选择器。
独立的令牌选择器仅保留少量高分令牌(例如前 k 个位置),并构建稀疏注意力掩码,屏蔽未被选中的其他令牌。(此处 top-k 的 k 是超参数,与上文公式中代表键的 k 无关;DeepSeek 团队公开的模型代码中,该值设为 2048。)
下图以流程图形式展示了完整过程。
图 11:DeepSeek V3.2 稀疏注意力机制可视化总结
总而言之,通过索引器与令牌选择器,每个令牌仅会关注模型判定为最相关的少量历史令牌,而非全部令牌,也不是固定的局部窗口。
该设计的目标并非超越 DeepSeek V3.1-Terminus 的性能,而是在享受效率提升的同时,尽可能降低稀疏注意力机制带来的性能损耗。
整体来看,DSA 将注意力机制的计算复杂度从序列长度 L 的平方级 O (L²),降低到了线性级 O (Lk),其中 k 远小于 L,为选中的令牌数量。
5. 具备自验证与自优化能力的 DeepSeekMath V2
讲完 DeepSeek V3.2-Exp,我们离本文核心 DeepSeek V3.2 就更近了。但在此之前,还有一块关键内容需要先铺垫。
2025 年 11 月 27 日(美国感恩节),也就是 DeepSeek V3.2 发布的 4 天前,DeepSeek 团队推出了基于 DeepSeek V3.2-Exp-Base 的 DeepSeekMath V2。
该模型专为数学场景研发,在多项数学竞赛中达到了金牌水平。本质上,它可以看作 DeepSeek V3.2 的概念验证模型,引入了又一项新技术。
这里的核心背景是:DeepSeek R1 这类推理模型,是借助外部验证器训练的,模型会自主学习在给出最终答案前写出推导过程。但这些推导过程可能存在错误。
正如 DeepSeek 团队简洁的总结,传统 RLVR 存在两大短板:
…… 答案正确不代表推理过程正确。
…… 模型可能通过错误的逻辑或巧合的计算得到正确答案。
他们希望解决的 DeepSeek R1 RLVR 方案的另一局限是:
…… 定理证明等许多数学任务需要严谨的逐步推导,而非单纯的数值答案,因此基于最终答案的奖励机制不再适用。
为了弥补上述两大短板,论文中训练了两个模型:
-
基于大语言模型的定理证明验证器。
-
作为主模型的证明生成器,将上述 LLM 验证器当作奖励模型使用(替代传统的符号验证器)。
除了上述基于 LLM 的自验证,他们还采用了自优化技术(我即将出版的《从零构建推理模型》第 5 章会详细讲解),让大模型迭代优化自己的答案。
5.1 自验证
让大语言模型为中间步骤打分并非新鲜事,所谓的 “过程奖励模型” 领域已有大量相关研究,比如 2022 年的《基于过程与结果反馈的数学应用题求解》、2023 年的《逐步验证》等,相关文献非常多。
过程奖励模型的难点在于:中间奖励的正确性难以校验,还可能引发奖励破解问题。
在 2025 年 1 月的 DeepSeek R1 论文中,团队并未使用过程奖励模型,因为他们发现:
在我们的实验中,相比于它在大规模强化学习过程中带来的额外计算开销,其收益十分有限。
而在这篇论文中,他们以自验证的形式重新探索了这一方向。其核心动机是:即使没有参考答案,人类在阅读证明、发现问题时也能自我修正。
因此,为了打造更优秀的数学证明生成模型(下图中的 LLM 1),他们开发了一个证明验证器(下图中的 LLM 2),以 “大模型裁判” 的身份为证明生成器(LLM 1)的输出打分。
图 12:数学证明生成器(LLM 1)与验证器(LLM 2)的通用架构
验证器 LLM(LLM 2)依据评分标准为生成的证明打分,评分规则为:
-
1 分:证明完整严谨,所有逻辑步骤均有清晰依据;
-
0.5 分:整体逻辑成立,但存在少量错误或细节缺失;
-
0 分:证明存在根本性缺陷,包含致命逻辑错误或关键推导断层。
证明验证器模型以 DeepSeek V3.2-Exp-SFT 为起点 —— 后者是基于 V3.2-Exp、在数学与代码推理数据上做监督微调得到的模型。随后,团队通过强化学习进一步训练验证器:一方面采用格式奖励(检查解答是否符合预期格式),另一方面采用得分奖励(基于预测分与人类数学专家标注的真实分的贴合度)。
证明验证器(LLM 2)的作用是校验生成器(LLM 1)的证明,那谁来校验验证器本身?为了提升证明验证器的鲁棒性,避免它 “臆造” 问题,团队又开发了第三个大模型:元验证器。
图 13:元验证器(LLM 3)校验验证器(LLM 2)对生成器(LLM 1)的验证是否准确。
元验证器(LLM 3)同样通过强化学习开发,训练方式与 LLM 2 类似。尽管元验证器并非必需组件,但 DeepSeek 团队表示:
经元验证器评估,验证器的证明分析平均质量分从 0.85 提升至 0.96,同时证明分数预测的准确率保持不变。
这套架构其实很有意思。如果你熟悉生成对抗网络(GAN),会发现二者有异曲同工之妙:证明验证器相当于 GAN 的判别器,推动证明生成器提升质量;而生成器产出更优质的证明后,又会反过来倒逼验证器进步。
元分数仅用于验证器(LLM 2)与生成器(LLM 1)的训练阶段,不会在推理阶段的自优化循环中使用,自优化我们将在下一节讲解。
5.2 自优化
上一节我们讲了自验证,也就是分析解答的质量。而自验证的目的是实现自优化 —— 让大模型能根据反馈修正自己的答案。
自优化是一种成熟且主流的推理缩放技术。传统的自优化方案中,生成解答、校验解答、优化解答都用同一个大模型。换句话说,在前面的图 12 和图 13 中,LLM 1 和 LLM 2 是同一个模型。传统自优化流程如下:
图 14:经典自优化迭代:用同一个大模型完成初始回复生成(Output 1)、评估(Eval)和答案优化(Output 2)。
但 DeepSeek 团队在实践中发现,用同一个模型兼顾生成与验证,存在一个关键问题:
当要求模型一次性完成证明生成与自我分析时,即便外部验证器能轻易发现漏洞,生成器也往往会判定自己的证明正确。换句话说,生成器能基于外部反馈优化证明,却无法像专用验证器那样严格地评判自己的输出。
按这个逻辑,大家可能会以为他们用了独立的证明生成器(LLM 1)和证明验证器(LLM 2),自优化循环也会类似下图。注意,图中省略了 LLM 3,因为它仅用于验证器(LLM 2)的研发阶段。
图 15:采用独立验证器 LLM(LLM 2)的自优化流程
但实际情况与图 15 不同,DeepSeek 团队最终采用的是和经典自优化循环(图 14)一样的方案 —— 生成与验证共用同一个大模型:
“所有实验均使用单一模型,即我们最终的证明生成器,它同时承担证明生成与验证两项工作。”
也就是说,独立验证器是训练阶段提升生成器能力的关键,但当生成器能力足够强后,推理阶段就不再需要它了。而与朴素的单模型自优化相比,核心区别在于:最终的证明生成器,是在更强的验证器与元验证器指导下训练出来的,因此它已经学会用专业的评分标准来审视自己的输出。
此外,推理阶段使用这种二合一的 DeepSeekMath V2 验证器,在资源与成本上也更有优势 —— 相比额外运行一个验证大模型,它的复杂度和算力需求都更低。
回到图 14 和图 15 中的通用自优化概念,两张图都展示了 2 轮迭代的自优化(初始答案 + 一次优化)。当然,我们可以增加更多迭代轮次。这是典型的推理缩放权衡:迭代轮次越多,生成答案的成本越高,但整体准确率也越高。
论文中,DeepSeek 团队最多用到了 8 轮迭代,此时准确率仍未出现饱和。
图 16:增加自优化迭代轮次可提升准确率。本图为 DeepSeekMath V2 论文的标注版插图。其中 Best@32 多数投票准确率法也叫 “自一致性”,我在《从零构建推理模型》第 4 章中有详细讲解。
6. DeepSeek V3.2(2025 年 12 月 1 日)
上一节花大量篇幅讲解 DeepSeekMath V2,原因有二:其一,它是非常有价值的概念验证,通过自验证与自优化技术,进一步拓展了可验证奖励强化学习(RLVR)的边界;其二,自验证与自优化技术也被应用到了 DeepSeek V3.2 中。
在讲这部分之前,我们先对 DeepSeek V3.2 做一个整体概览。这款模型意义重大,因为它的性能足以比肩当前的旗舰级模型。
图 17:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。
和 DeepSeek 的多款模型一样,V3.2 也附带了一份详实的技术报告,接下来的章节我会逐一解读。
6.1 DeepSeek V3.2 架构
研发这款模型的核心目标,自然是提升综合性能。比如,它和 DeepSeekMath V2 一样,在数学基准测试中达到了金牌水平;同时,模型在训练中也融入了工具使用能力,在代码、智能体等其他任务上同样表现出色。
同时,DeepSeek 团队也将计算效率作为核心设计目标。因此,他们沿用了 V2、V3 中的多头潜注意力(MLA),并在 V3.2 中新增了 DeepSeek 稀疏注意力(DSA)。事实上,论文明确提到 “DeepSeek-V3.2 与 DeepSeek-V3.2-Exp 架构完全一致”,也就是我们之前讨论过的架构。
图 18:DeepSeek V3.2 架构
正如我之前所说,DeepSeek V3.2-Exp 的发布,大概率是为了让生态与推理基础设施提前适配,为刚推出的 V3.2 模型铺路。
图 19:DeepSeek 稀疏注意力(DSA)带来的推理成本节省。本图为 DeepSeek V3.2 报告的标注版插图。
有意思的是,从上图的论文截图可以看出,DeepSeek 团队已重新使用英伟达芯片(此前有传闻称他们曾尝试用华为芯片训练模型)。
既然架构与 V3.2-Exp 完全一致,真正的亮点就在于训练方法,我们将在后续章节展开。
6.2 强化学习更新
整体而言,DeepSeek 团队延续了 DeepSeek R1 的方案,采用基于组相对策略优化(GRPO)的可验证奖励强化学习(RLVR)流程,但也做了几项值得关注的更新。
最初,DeepSeek R1 采用三类奖励:
-
格式奖励:确保答案格式规范;
-
语言一致性奖励:避免模型在回复中混用多种语言;
-
核心验证奖励:判断数学、代码题的答案是否正确。
而 DeepSeek V3.2 对奖励机制做了调整:
针对推理与智能体任务,我们采用基于规则的结果奖励、长度惩罚与语言一致性奖励;针对通用任务,我们采用生成式奖励模型,每个提示词都有对应的评估标准。
比如,他们移除了格式奖励,为智能体任务新增了长度惩罚;而对于没有符号验证器(数学)或代码解释器可校验答案的通用任务,则采用奖励模型(另一个训练后可输出奖励分数的大语言模型)。
因此,这套训练流程不再像 DeepSeek R1 那样是纯粹的基于验证器的 RLVR,而是混合方案:可验证的领域沿用 RLVR,其余场景则采用更标准的 “大模型裁判” 奖励建模。
在数学领域,他们表示还 “融合了 DeepSeekMath-V2 的数据集与奖励方法”,也就是我们前文讲过的方案。
6.3 GRPO 算法更新
作为 RLVR 流程中的核心学习算法,GRPO 本身相比 DeepSeek R1 论文中的原始版本,也做了若干改动。
过去几个月里,已有数十篇论文提出 GRPO 的改进方案,旨在提升稳定性与效率。今年早些时候,我在《LLM 推理强化学习现状》一文中介绍过其中两个主流方案:DAPO 和 Dr. GRPO。
不深入 GRPO 的数学细节,简单来说:DAPO 通过非对称裁剪、动态采样、令牌级损失和显式长度奖励塑形来改进 GRPO;而 Dr. GRPO 则直接修改 GRPO 的目标函数,移除了长度归一化与标准差归一化。
近期发布的 Olmo 3 论文也采用了类似的改进,我摘录如下:
-
零梯度信号过滤:移除组内奖励完全相同的样本(即优势函数标准差为 0 的批次),避免在无梯度贡献的样本上训练,思路与 DAPO 类似(Yu 等人,2025)。[对应 DAPO]
-
主动采样:即便经过零梯度过滤,也通过一种更高效的新型动态采样方式保持批次大小稳定(Yu 等人,2025),详见 OlmoRL 基础设施说明。[对应 DAPO]
-
令牌级损失:采用令牌级损失,按批次内总令牌数归一化损失(Yu 等人,2025),而非按样本归一化,以避免长度偏差。[对应 DAPO]
-
移除 KL 损失:遵循业界通用做法移除 KL 损失(GLM-4.5 团队等,2025;Yu 等人,2025;Liu 等人,2025b),移除后策略更新的约束更少,且不会导致过优化或训练不稳定。[对应 DAPO 与 Dr. GRPO]
-
上界放宽裁剪:将损失的上界裁剪阈值设为略高于下界,允许令牌进行更大幅度的更新,思路来自 Yu 等人(2025)。[对应 DAPO]
-
截断重要性采样:为修正推理引擎与训练引擎输出的对数概率差异,按 Yao 等人(2025)的方法,将损失乘以截断重要性采样比率。
-
无标准差归一化:计算优势函数时,不按组内标准差做归一化,遵循 Liu 等人(2025b)的方案。这消除了难度偏差 —— 原本奖励标准差低的题目(比如过难或过易的题),其优势会被归一化项显著放大。[对应 Dr. GRPO]
DeepSeek V3.2 对 GRPO 的改动相对保守,我参照 Olmo 3 的风格总结如下:
-
分领域调整 KL 强度(数学场景可设为 0):DAPO 和 Dr. GRPO 在数学类强化学习中会直接移除 KL 项,而 DeepSeek V3.2 保留了目标函数中的 KL 项,但会针对不同领域调整权重。不过团队也指出,数学场景下 KL 权重极弱甚至为 0 时效果通常最好 —— 只是没有直接移除,而是将其作为超参数调优。
-
无偏 KL 估计:如前所述,V3.2 没有移除 KL 惩罚。除了将其作为调参旋钮,团队还修正了 GRPO 中 KL 惩罚的估算方式:用主损失相同的重要性采样比率对 KL 项重新加权,让 KL 梯度真正匹配 “样本来自旧策略而非当前策略” 的事实。
-
离策略序列掩码:当生成序列数据在多个梯度步中被复用时,DeepSeek V3.2 会计算当前策略与生成策略在每个完整答案上的偏移程度,直接丢弃那些优势为负且 “严重离策略” 的序列,避免模型从过旧或偏离过大的数据中学习。
-
保留 MoE 路由结果:针对混合专家主干网络,团队会记录生成阶段激活的专家,并在训练时强制使用相同的路由模式,确保梯度更新作用于生成采样答案的那些专家。
-
保留 top-p/top-k 采样掩码:当生成阶段采用 top-p 或 top-k 采样时,V3.2 会保存选择掩码,在计算 GRPO 损失与 KL 时重新应用,确保训练时的动作空间与采样时的实际空间一致。
-
保留原始 GRPO 优势归一化:Dr. GRPO 的研究表明,GRPO 的长度归一化与组内标准差归一化项,会导致优化偏向于过长的错误答案,同时过度放大多过难或过易题目的权重。Dr. GRPO 的解决方案是移除这两项,回归无偏的 PPO 式目标函数;DAPO 则转向令牌级损失,以此调整长短答案的权重。而 DeepSeek V3.2 保留了原始 GRPO 的归一化方式,转而从上述其他方面进行优化。
总体而言,相比近期其他一些模型,DeepSeek V3.2 更贴近原始 GRPO 算法,同时加入了一些符合逻辑的微调。
6.4 DeepSeek V3.2-Speciale 与扩展思考
DeepSeek V3.2 还有一个极致的扩展思考版本,名为 DeepSeek V3.2-Speciale。它在强化学习阶段仅使用推理数据训练,定位更接近 DeepSeek R1。除了仅用推理数据训练,团队还降低了强化学习中的长度惩罚,允许模型输出更长的回复。
生成长回复是一种推理缩放手段:更长的输出会提升推理成本,但换来了更好的效果。
图 20:“扩展思考” 的 Speciale 版本准确率更高,但生成的令牌数也更多。
7. 总结
本文并未覆盖 DeepSeek V3.2 训练方法的所有细节,但希望通过与前代 DeepSeek 模型的对比,能帮大家理清核心要点与创新之处。
简而言之,核心结论如下:
-
DeepSeek V3.2 与 DeepSeek V3 以来的所有前代模型架构相近;
-
主要架构改动是加入了 DeepSeek V3.2-Exp 中的稀疏注意力机制,以提升效率;
-
为提升数学能力,模型采纳了 DeepSeekMath V2 的自验证方案;
-
训练流程有多项优化,比如 GRPO 的稳定性升级(注:论文还涉及蒸馏、长上下文训练、类 gpt-oss 的工具使用集成等其他内容,本文未展开)。
无论与其他小型开源权重模型,或是 GPT-5.1、Gemini 3.0 Pro 这类闭源模型相比,DeepSeek 的市场份额如何,有一点可以肯定:DeepSeek 的每次发布都颇具看点,其开源权重检查点附带的技术报告,总能带来很多值得学习的内容。
希望这篇概览对你有帮助!
8. DeepSeek 的 mHC:流形约束超连接
Transformer 架构的效率与性能优化,通常都围绕归一化、注意力和前馈网络(FFN)三大模块展开。
例如:
-
归一化:LayerNorm → RMSNorm → Dynamic TanH
-
注意力:分组查询注意力、滑动窗口、多头潜注意力、稀疏注意力
-
前馈网络:GeLU → SiLU,SiLU → SwiGLU,混合专家。
2025 年 12 月 31 日,DeepSeek 分享了一项针对残差路径优化的有趣新研究:mHC—— 流形约束超连接。
简而言之,mHC 建立在超连接(HC)方法的基础上。超连接将常规的恒等残差连接拓展为可学习的连接方式:通过多条并行路径拓宽残差流,并允许信息在这些并行层之间交互融合。
团队在 HC 的基础上更进一步,提出了 mHC:将残差融合约束在结构化、保范数的流形上。他们发现,加入这个 “m” 改进后,训练稳定性得到了提升。
该方案会增加少量计算开销,但能显著提升训练稳定性与收敛效果。
图 21:mHC 方法示意图。右侧子图为 mHC 论文的标注版插图。





















