23. Gemma 4
继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。
架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

(注:Gemma 4 现已支持多模态能力,但图像编码器部分我会留到未来单独撰文介绍;本文仅聚焦文本模型部分。)
Learn and share.
继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。
架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

谷歌推出的 Gemma 系列模型一直表现优异,在我看来,和 Llama 系列等热门模型相比,它的市场热度始终被有所低估。
Gemma 的一大鲜明特征是词表规模较大,以此更好地支持多语言;同时产品线更侧重 270 亿参数规格,而非 80 亿或 700 亿档位。不过需要说明的是,Gemma 2 也提供更小的参数版本:10 亿、40 亿和 120 亿。
270 亿这个规格刚好卡在非常理想的平衡点:能力远强于 80 亿参数模型,资源消耗又远低于 700 亿参数模型,在我的 Mac Mini 上就能顺畅本地运行。
那么 Gemma 3 还有哪些值得关注的设计?如前文所述,DeepSeek V3/R1 等模型采用混合专家(MoE)架构,在模型总规模固定的前提下降低推理时的内存占用 —— 后文要介绍的多款模型也都沿用了 MoE 方案。
而 Gemma 3 选择了另一种技术路径来压缩计算成本:滑动窗口注意力。
滑动窗口注意力最早于 2020 年在《LongFormer》论文中提出,Gemma 2 也已采用该技术。借助滑动窗口注意力,Gemma 3 团队大幅降低了 KV 缓存的内存占用,如下图所示。

原文地址 第19章 Xiaomi MiMo-V2-Flash
2025 年 12 月又诞生了一款表现亮眼的模型。小米发布了全新的小米 MiMo-V2-Flash,其基准测试成绩与 DeepSeek V3.2 持平,但总参数量仅为后者的一半,推理速度也更快。这是一款总参数量 3090 亿的混合专家(MoE)模型,每个 token 的激活参数量为 150 亿。
有意思的是,它采用滑动窗口注意力(SWA)与全局(常规)注意力按 5:1 比例混合的设计,与 Gemma 3 的思路类似(见第 3 节)。不过它的滑动窗口尺寸设置得更为激进,仅为 128,是 Gemma 3(1024)的八分之一。

据我所知,这是目前规模最大的滑动窗口注意力模型。
此外,这款小米模型还采用了多 Token 预测(MTP)技术,具体介绍详见 12.3 节。
近期,各开源大语言模型厂商纷纷推出了面向效率优化的核心架构变体。例如上一节介绍的 Qwen3-Next,用高速门控 DeltaNet 模块替换了部分全注意力块;再如 DeepSeek V3.2 采用了稀疏注意力 —— 这是一种线性注意力变体,以牺牲部分建模性能为代价换取计算性能的提升(后续我会专门撰文详细介绍该机制)。
MiniMax-M1 也属于这类效率优化的模型路线,它采用的闪电注意力(lightning attention)是一种线性注意力变体,效率高于常规全注意力。我最初没有专门介绍 MiniMax M1,因为它的知名度不及本文讨论的其他部分模型。但全新发布的 MiniMax-M2 目前被认为是性能最强的开源权重模型(按基准测试成绩衡量),分量十足,不容忽视。

如下图总览所示,我将 MiniMax-M2 归为常规解码器式 Transformer 大语言模型,因为它没有沿用 MiniMax-M1 提出的高效闪电注意力变体。开发团队反而回归了全注意力方案,大概率是为了提升建模(以及基准测试)性能。

整体来看,MiniMax-M2 与 Qwen3 的相似度高得出人意料。除了层数、维度等规模参数不同,二者的核心组件基本一致。
春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。
今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。
与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。
和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

GLM-4.5 是今年又一款重磅发布的模型。
它与 Qwen3 类似,属于指令微调与推理能力一体化的混合模型,但在函数调用与智能体场景下的优化更为出色。

2025 年 9 月 11 日,通义千问团队发布了 Qwen3 Next 80B-A3B(见图 35),提供指令微调版(Instruct)与思考版(Thinking)两种形态。尽管其设计基于前文介绍的 Qwen3 架构,但我将它单独列为一节,一是保持图号的连贯性,二是突出其部分设计上的改动。
全新的 Qwen3 Next 架构有一个突出特点:尽管总参数量仅为前代 235B-A22B 模型的三分之一(见图 35),但专家数量提升至原来的四倍,还额外加入了共享专家。这两项设计选择(高专家数量 + 引入共享专家),正是我在本次发布前就指出过的行业未来方向,尤其是在本文开头链接的视频版本中曾重点提及。

通义千问团队始终持续输出高质量的开源权重大语言模型。我还记得 2023 年 NeurIPS 大会期间,我参与联合指导大语言模型效率挑战赛,最终所有夺冠方案均基于 Qwen2 搭建。
如今的 Qwen3 是又一标杆级模型系列,在各自参数量级的排行榜上都位居头部。该系列包含 7 款稠密模型,参数量分别为 0.6B、1.7B、4B、8B、14B 和 32B;另有 2 款混合专家(MoE)模型:30B-A3B 与 235B-A22B。
(顺带说明:“Qwen3” 中间未加空格并非笔误,我只是尽量保留通义千问开发团队选定的原始拼写。)
我们先来看稠密模型的架构。截至本文撰写时,0.6B 参数版本很可能是当前新一代开源模型中参数规模最小的。以我的实际体验来看,在如此小的体量下,它的表现十分出色。如果要在本地运行,它的 token 生成吞吐量高,内存占用低;更重要的是,参数量小也意味着它很适合在本地开展训练(用于教学研究目的)。
因此在大多数场景下,我已经用 Qwen3 0.6B 替代了 Llama 3 1B。二者的架构对比如下图所示。

与 DeepSeek V3 的发布节奏类似,团队选择在美国一个重要假期的周末推出了这款全新旗舰模型。DeepSeek V3.2 的性能达到了 GPT-5 与 Gemini 3.0 Pro 的级别,同时还是一款开源权重模型,绝对值得深入研究。
图 1:DeepSeek V3.2 与闭源旗舰模型的基准测试对比。本图为 DeepSeek V3.2 报告的标注版插图。
我曾在《LLM 架构大盘点》一文的开篇详细介绍过其前身 DeepSeek V3,过去几个月里,随着新架构不断发布,我也一直在持续更新这篇文章。原本刚和家人过完感恩节假期回来,我只打算给这篇文章新增一个小节,补充 DeepSeek V3.2 的相关内容,但后来发现值得探讨的亮点太多,便决定单独写一篇更完整的长文。
他们的技术报告中有大量值得挖掘的内容与经验,我们这就开始。
本文以 2024 年 12 月发布的 DeepSeek V3 开篇。那段时间 DeepSeek 陆续推出了多款模型,但我大多没有展开介绍,因为它们都不属于 DeepSeek V3、DeepSeek R1 这类重磅旗舰级模型发布。
