About neohope

一直在努力,还没想过要放弃...

【转载】大语言模型架构全面对比09:GPT-OSS

原文地址 第9章 GPT-OSS

9. GPT-OSS

在我写完本文约一周后,OpenAI 发布了 gpt-oss-120b 与 gpt-oss-20b—— 这是该公司自 2019 年 GPT-2 以来首次推出开源权重模型。由于 OpenAI 的开源模型备受业界期待,我更新了本文将其纳入。本节只做简要介绍,我另外撰写了一篇更详尽的专题文章,专门分析 gpt-oss 系列模型,可在此查看:

《从 GPT-2 到 gpt-oss:架构演进深度解析》
作者:塞巴斯蒂安・拉施卡(Sebastian Raschka)博士
2025 年 8 月 9 日
阅读全文

在介绍核心亮点之前,先概览 gpt-oss-20b 与 gpt-oss-120b 两款模型,如下图 26 所示。

figure26

图 26:两款 gpt-oss 模型架构概览

从图 26 可见,其架构包含了前文介绍过的所有常见组件。例如图 27 将小型 gpt-oss 架构与 Qwen3 30B-A3B 并置对比 —— 后者同样是 MoE 模型,激活参数量相近(gpt-oss 激活参数为 36 亿,Qwen3 30B-A3B 为 33 亿)。

Continue reading 【转载】大语言模型架构全面对比09:GPT-OSS

【转载】大语言模型架构全面对比10:Grok 2.5

原文地址 第10章 Grok 2.5

10. Grok 2.5

本文首次上线几周后,xAI 发布了其 2700 亿参数 Grok 2.5 模型的权重。

我认为有必要把它补充进来,因为 Grok 2.5 是 xAI 去年的旗舰生产级模型。截至目前,我们讨论的所有模型从发布之初就是开源权重模型。例如,gpt-oss 大概率不是 GPT-4 的开源权重复刻版,而是专门为开源社区训练的定制模型。

借助 Grok 2.5,我们得以难得一窥真实生产级系统的面貌,尽管这是去年的模型。

架构层面,Grok 2.5 整体看起来相当标准(图 32),但仍有几个值得注意的细节。

image32

图 32:Grok 2.5 与同等规模的 Qwen3 模型对比

例如,Grok 2.5 采用「少量大专家」的配置(共 8 个专家),这是相对早期的设计思路。如前文所述,DeepSeekMoE 论文等更新的设计更倾向于「多而小」的专家配置,Qwen3 也采用了这种方案。

另一个有意思的设计是它采用了近似共享专家的机制。图 32 左侧所示的额外 SwiGLU 模块,作用相当于一个始终激活的共享专家。它和经典的共享专家设计并不完全一致 —— 其中间维度扩大了一倍,但核心思路相同。(Qwen3 没有采用共享专家这点我一直觉得很有意思,看看 Qwen4 及后续模型会不会改变这个设计,值得关注。)

【转载】大语言模型架构全面对比05:Llama 4

原文地址 第5章 Llama 4

5. Llama 4

本文前面对混合专家模型(MoE)的详细铺垫在这里又派上了用场。Llama 4 同样采用了 MoE 架构,其余部分则沿用了与 DeepSeek V3 高度相似的相对标准架构,如下图所示。(Llama 4 原生支持多模态能力,与 Gemma、Mistral 等模型类似。但由于本文聚焦语言建模方向,因此仅讨论其文本模型部分。)

image17

图 17:DeepSeek V3(6710 亿参数)与 Llama 4 Maverick(4000 亿参数)架构对比

尽管 Llama 4 Maverick 的整体架构与 DeepSeek V3 十分相近,但仍有几处值得关注的差异。

首先,Llama 4 延续了前代的分组查询注意力(GQA),而 DeepSeek V3 采用的是本文开头介绍过的多头潜注意力(MLA)。两者均为超大规模架构:DeepSeek V3 的总参数量比 Llama 4 Maverick 高出约 68%;但从激活参数量来看,DeepSeek V3 为 370 亿,是 Llama 4 Maverick(170 亿)的两倍以上。

Llama 4 Maverick 采用更经典的 MoE 配置:专家数量更少但单个专家规模更大 —— 每步激活 2 个专家,每个专家隐层维度为 8192;而 DeepSeek V3 每步激活 9 个专家,每个专家隐层维度为 2048。此外,DeepSeek 除前 3 个 Transformer 块外,其余每个块都包含 MoE 层;Llama 4 则采用交替设计,每隔一个 Transformer 块轮换使用 MoE 模块与稠密模块。

由于架构之间存在诸多细微差异,很难判定这些设计对模型最终性能的具体影响。但核心结论是:2025 年 MoE 架构的普及度已出现显著提升。

【转载】Claude如何为AI生成文本添加水印

原文地址:How Claude Watermarks AI-Generated Text,by Sebastian Raschka, on 2025-08-22

Claude如何为AI生成文本添加水印

一段 48 分钟的视频讲解,涵盖 token samplingwatermark detection 与水印移除方法

我最近发布了一则笔记 https://substack.com/@rasbt/note/c-315339554?r=gb4sb&utm_source=notes-share-action&utm_medium=web ,介绍了 Claude 全新的文本水印方案 https://www.anthropic.com/news/claude-text-watermark 及其实现方式。这个话题热度很高,也引发了非常热烈的讨论,我觉得可以进一步展开,更详细地讲解它的工作原理。

这次我没有采用常规的文字文章形式,而是录制了一期关于该主题的小型讲座(算是换一种内容呈现形式)。下方是视频以及对应的文字稿。

原本我只打算做 10 页幻灯片,录一段 10 分钟的短视频,但在制作过程中不断补充了不少关键细节,最终做成了超过 50 页幻灯片、时长 48 分钟的内容。希望这份讲解能把原理讲清楚,祝大家观看愉快!

如果你偏好使用 YouTube 播放器,可通过此链接观看:https://youtu.be/tLv7qRWFMlw
讲座幻灯片下载地址:https://sebastianraschka.com/pdf/slides/2026-08-18-claude-watermarking.pdf


视频文字稿

注:以下文字稿经过轻度编辑优化,提升了可读性,但完整保留了原视频讲座的内容顺序与讲解逻辑。
https://www.youtube.com/watch?v=tLv7qRWFMlw

Continue reading 【转载】Claude如何为AI生成文本添加水印

【转载】大语言模型架构全面对比23:Gemma 4

原文地址 第23章 Gemma 4

23. Gemma 4

继 3 月 Nemotron 3 Super 发布后,当月剩余时间里旗舰开源权重模型的发布节奏相对平缓。我仍在等待 DeepSeek-V4 的推出,而 4 月至少迎来了谷歌的 Gemma 4。

架构层面,如下图所示,310 亿参数的 Gemma 4 与 270 亿参数的 Gemma 3 相比几乎没有改动。

figure58

图 58:Gemma 3(27B)与 Gemma 4(31B)架构并排对比
(注:Gemma 4 现已支持多模态能力,但图像编码器部分我会留到未来单独撰文介绍;本文仅聚焦文本模型部分。)

Continue reading 【转载】大语言模型架构全面对比23:Gemma 4

【转载】大语言模型架构全面对比03:Gemma 3

原文地址 第3章 Gemma 3

3. Gemma 3

谷歌推出的 Gemma 系列模型一直表现优异,在我看来,和 Llama 系列等热门模型相比,它的市场热度始终被有所低估。

Gemma 的一大鲜明特征是词表规模较大,以此更好地支持多语言;同时产品线更侧重 270 亿参数规格,而非 80 亿或 700 亿档位。不过需要说明的是,Gemma 2 也提供更小的参数版本:10 亿、40 亿和 120 亿。

270 亿这个规格刚好卡在非常理想的平衡点:能力远强于 80 亿参数模型,资源消耗又远低于 700 亿参数模型,在我的 Mac Mini 上就能顺畅本地运行。

那么 Gemma 3 还有哪些值得关注的设计?如前文所述,DeepSeek V3/R1 等模型采用混合专家(MoE)架构,在模型总规模固定的前提下降低推理时的内存占用 —— 后文要介绍的多款模型也都沿用了 MoE 方案。
而 Gemma 3 选择了另一种技术路径来压缩计算成本:滑动窗口注意力

3.1 滑动窗口注意力

滑动窗口注意力最早于 2020 年在《LongFormer》论文中提出,Gemma 2 也已采用该技术。借助滑动窗口注意力,Gemma 3 团队大幅降低了 KV 缓存的内存占用,如下图所示。

figure11

图 11:摘自 Gemma 3 论文(https://arxiv.org/abs/2503.19786)的标注图,展示滑动窗口注意力带来的 KV 缓存内存节省效果

Continue reading 【转载】大语言模型架构全面对比03:Gemma 3

【转载】从零构建AI文本检测器

原文地址:Building an AI Text Detector From Scratch,by Sebastian Raschka, on 2026-08-15

从零构建AI文本检测器

一个涵盖数据集构建、模型训练、本地部署与RLVR的端到端项目

Substack最近在界面中推出了AI检测功能,这非常有意思。
与此同时,很多人向我询问有哪些值得动手实践的本地LLM项目,可以作为演示,展示小语言模型(SLM)的能力。

把这两件事结合起来,我觉得实现一个AI检测器会是个很有意思的选题。我还会把它作为验证器,训练一个小语言模型来生成能够规避检测的文本。这是一个小型教学项目,用于研究AI检测器的局限性,同时探索一种基于验证器的LLM应用方向——它不同于常规基于数学和代码训练的推理模型。

figure01

图1:Substack现已内置AI检测器功能。

如上所述,本教程的核心目标是通过搭建一个简易的AI检测器,讲解其工作原理。
在实际场景中,这类检测器可以用来过滤垃圾内容,也可以用来优化个人写作风格,避免文本变成AI生成的风格。举个例子,如果你写了一篇长文,想优化拼写和语法,用语法检查工具润色、提升可读性是很诱人(也确实很实用)的做法。这类工具很多,包括ChatGPT这类通用LLM都能做到。但这也带来了风险:即便内容本质上还是你自己写的,经过这类工具过度润色后,文风会变得像AI生成的,进而被标记为垃圾内容。

比如,有了AI检测工具,我们就可以提出要求:“修正我的语法,同时保证我的文本AI生成率得分为0%。”

言归正传,我们会在本文搭建一个功能完整的检测工具,目标有两个:一是讲解AI检测工具的工作原理;二是以它为案例,讲解更通用的技术——如何构建一个可与LLM配合使用的评分器或验证器。

免责声明:AI检测本质上是一场猫鼠游戏。AI检测器可以学会识别某些AI生成内容的特征模式,但下一代LLM可能会偶然或刻意地不呈现这些模式,从而规避检测。之后检测器又要更新迭代以识别新的模型,如此循环往复。此外,检测器也难免会出现误报(把人类写的文本判定为AI生成),这一点后面会详细展开。

Continue reading 【转载】从零构建AI文本检测器

【转载】大语言模型架构全面对比19:Xiaomi MiMo-V2-Flash

原文地址 第19章 Xiaomi MiMo-V2-Flash

19. 小米 MiMo-V2-Flash

2025 年 12 月又诞生了一款表现亮眼的模型。小米发布了全新的小米 MiMo-V2-Flash,其基准测试成绩与 DeepSeek V3.2 持平,但总参数量仅为后者的一半,推理速度也更快。这是一款总参数量 3090 亿的混合专家(MoE)模型,每个 token 的激活参数量为 150 亿。

有意思的是,它采用滑动窗口注意力(SWA)与全局(常规)注意力按 5:1 比例混合的设计,与 Gemma 3 的思路类似(见第 3 节)。不过它的滑动窗口尺寸设置得更为激进,仅为 128,是 Gemma 3(1024)的八分之一。

figure52

图 52:基准性能相近的小米 MiMo-V2-Flash 与 DeepSeek V3.2 对比

据我所知,这是目前规模最大的滑动窗口注意力模型。

此外,这款小米模型还采用了多 Token 预测(MTP)技术,具体介绍详见 12.3 节。

【转载】大语言模型架构全面对比13:MiniMax-M2

原文地址 第13章 MiniMax-M2

13. MiniMax-M2

近期,各开源大语言模型厂商纷纷推出了面向效率优化的核心架构变体。例如上一节介绍的 Qwen3-Next,用高速门控 DeltaNet 模块替换了部分全注意力块;再如 DeepSeek V3.2 采用了稀疏注意力 —— 这是一种线性注意力变体,以牺牲部分建模性能为代价换取计算性能的提升(后续我会专门撰文详细介绍该机制)。

MiniMax-M1 也属于这类效率优化的模型路线,它采用的闪电注意力(lightning attention)是一种线性注意力变体,效率高于常规全注意力。我最初没有专门介绍 MiniMax M1,因为它的知名度不及本文讨论的其他部分模型。但全新发布的 MiniMax-M2 目前被认为是性能最强的开源权重模型(按基准测试成绩衡量),分量十足,不容忽视。

figure37

图 37:MiniMax-M2 与其他主流开源、闭源大语言模型的基准性能对比。图片取自官方模型库发布说明文档。

如下图总览所示,我将 MiniMax-M2 归为常规解码器式 Transformer 大语言模型,因为它没有沿用 MiniMax-M1 提出的高效闪电注意力变体。开发团队反而回归了全注意力方案,大概率是为了提升建模(以及基准测试)性能。

figure38

图 38:本文涵盖的主流大语言模型时间线,以及部分效率优先的注意力混合模型(后者以牺牲部分建模性能为代价换取效率提升)。

整体来看,MiniMax-M2 与 Qwen3 的相似度高得出人意料。除了层数、维度等规模参数不同,二者的核心组件基本一致。

Continue reading 【转载】大语言模型架构全面对比13:MiniMax-M2

【转载】大语言模型架构全面对比21:GLM-5

原文地址 第21章 GLM-5

21. GLM-5

春节假期已经成为开源重磅模型发布的一个出人意料的稳定窗口期。比如 2024 年 1—2 月有 GLM-4 与 Qwen 1.5,2025 年则有 DeepSeek R1 与 Qwen 2.5。

今年,智谱 AI([z.AI](z.AI))再度抢跑,于 2026 年 2 月 11 日推出 GLM-5,距离 2 月 17 日的农历新年约一周时间。

与我在本文第 11 节介绍的、2025 年夏季发布的 GLM-4.5 相比,新一代 GLM-5 的规模翻倍:总参数量从 3550 亿提升至 7440 亿,体量介于 DeepSeek-V3.2 与 Kimi K2 之间。

和 GLM-4.5 一样,GLM-5 采用混合专家(MoE,见 1.2 节)架构,单 token 激活参数量仅小幅上涨:GLM-4.5 为 320 亿,GLM-5 为 400 亿。

figure56

图 56:GLM-5 与 GLM-4.5 架构并排对比

Continue reading 【转载】大语言模型架构全面对比21:GLM-5