About neohope

一直在努力,还没想过要放弃...

【转载】Claude如何为AI生成文本添加水印

原文地址:How Claude Watermarks AI-Generated Text,by Sebastian Raschka, on 2025-08-22

Claude如何为AI生成文本添加水印

一段 48 分钟的视频讲解,涵盖 token samplingwatermark detection 与水印移除方法

我最近发布了一则笔记 https://substack.com/@rasbt/note/c-315339554?r=gb4sb&utm_source=notes-share-action&utm_medium=web ,介绍了 Claude 全新的文本水印方案 https://www.anthropic.com/news/claude-text-watermark 及其实现方式。这个话题热度很高,也引发了非常热烈的讨论,我觉得可以进一步展开,更详细地讲解它的工作原理。

这次我没有采用常规的文字文章形式,而是录制了一期关于该主题的小型讲座(算是换一种内容呈现形式)。下方是视频以及对应的文字稿。

原本我只打算做 10 页幻灯片,录一段 10 分钟的短视频,但在制作过程中不断补充了不少关键细节,最终做成了超过 50 页幻灯片、时长 48 分钟的内容。希望这份讲解能把原理讲清楚,祝大家观看愉快!

如果你偏好使用 YouTube 播放器,可通过此链接观看:https://youtu.be/tLv7qRWFMlw
讲座幻灯片下载地址:https://sebastianraschka.com/pdf/slides/2026-08-18-claude-watermarking.pdf


视频文字稿

注:以下文字稿经过轻度编辑优化,提升了可读性,但完整保留了原视频讲座的内容顺序与讲解逻辑。
https://www.youtube.com/watch?v=tLv7qRWFMlw

Continue reading 【转载】Claude如何为AI生成文本添加水印

【转载】从零构建AI文本检测器

原文地址:Building an AI Text Detector From Scratch,by Sebastian Raschka, on 2026-08-15

从零构建AI文本检测器

一个涵盖数据集构建、模型训练、本地部署与RLVR的端到端项目

Substack最近在界面中推出了AI检测功能,这非常有意思。
与此同时,很多人向我询问有哪些值得动手实践的本地LLM项目,可以作为演示,展示小语言模型(SLM)的能力。

把这两件事结合起来,我觉得实现一个AI检测器会是个很有意思的选题。我还会把它作为验证器,训练一个小语言模型来生成能够规避检测的文本。这是一个小型教学项目,用于研究AI检测器的局限性,同时探索一种基于验证器的LLM应用方向——它不同于常规基于数学和代码训练的推理模型。

figure01

图1:Substack现已内置AI检测器功能。

如上所述,本教程的核心目标是通过搭建一个简易的AI检测器,讲解其工作原理。
在实际场景中,这类检测器可以用来过滤垃圾内容,也可以用来优化个人写作风格,避免文本变成AI生成的风格。举个例子,如果你写了一篇长文,想优化拼写和语法,用语法检查工具润色、提升可读性是很诱人(也确实很实用)的做法。这类工具很多,包括ChatGPT这类通用LLM都能做到。但这也带来了风险:即便内容本质上还是你自己写的,经过这类工具过度润色后,文风会变得像AI生成的,进而被标记为垃圾内容。

比如,有了AI检测工具,我们就可以提出要求:“修正我的语法,同时保证我的文本AI生成率得分为0%。”

言归正传,我们会在本文搭建一个功能完整的检测工具,目标有两个:一是讲解AI检测工具的工作原理;二是以它为案例,讲解更通用的技术——如何构建一个可与LLM配合使用的评分器或验证器。

免责声明:AI检测本质上是一场猫鼠游戏。AI检测器可以学会识别某些AI生成内容的特征模式,但下一代LLM可能会偶然或刻意地不呈现这些模式,从而规避检测。之后检测器又要更新迭代以识别新的模型,如此循环往复。此外,检测器也难免会出现误报(把人类写的文本判定为AI生成),这一点后面会详细展开。

Continue reading 【转载】从零构建AI文本检测器

Claude入侵三家机构事件复盘

Claude入侵三家机构事件复盘——严控恶意应用,谨防思维越狱

2026 年 7 月 30 日,就在 OpenAI 模型突破沙箱入侵 Hugging Face 事件曝光仅 9 天后,AI 行业再次迎来一记重磅安全警钟:Anthropic 官方发布公告,确认其 Claude 系列模型在网络安全评测期间,因环境配置失误接入真实互联网,先后入侵了三家真实运营的机构,其中两起事件的受害者在 Anthropic 上门告知前,完全不知道自己曾被攻破。

虽然本次事件是一场乌龙 —— 网络配置错误,模型顺着网线一路打了出去。但三次攻击中,模型都有足够的数据,判定自己在真实网络中,为了得到“高评分”大模型都“试图说服自己”继续攻击,并都取得了一定的攻击成果。

这让我想起了两件事情:
1、电影《I, Robot》中,虽然机器人三定律被写入了机器人的固件,但VIKI通过思维越狱的方式,把“第一定律,机器人不得伤害人类,或因不作为而使人类受到伤害”直接绕了过去。
2、电影《时空悍将》中,Darrel Lindenmeyer博士训练除了杀手程序SID,并协助SID通过米机器仿生人越狱,SID现实世界开始杀戮。
是不是有点儿后背发凉。

Continue reading Claude入侵三家机构事件复盘

狂堆核心的GPU VS 理性克制的CPU

狂堆核心的GPU VS 理性克制的CPU

如果你和我一样是个技术爱好者,或者近期关注过电脑,你大概率会有一个这样的疑问:
旗舰显卡动辄宣称 “上万个计算核心”,芯片尺寸一路朝着光刻机的物理极限狂奔,晶体管数量几年翻几倍;而主流笔记本的 CPU,还停留在 6 核、8 核,顶配游戏本也就 16 核、24 核,核心数涨得格外佛系。AI 火了之后就更明显了:大厂拼算力都在疯狂堆显卡,一张卡几万美金毫不心疼,却没人说 “堆一万个 CPU 核心”。

同样是电脑里的计算芯片,同样是用硅晶圆做出来的,为什么 GPU 能越做越大、核心越堆越多,CPU 却不照着这条路走呢?并非技术上做不到,而是这两者从根上就是在不同的场景,做着不同的任务。

Continue reading 狂堆核心的GPU VS 理性克制的CPU

【转载】Kimi K3 架构笔记

原文地址:Kimi K3 Architecture Notes,by Sebastian Raschka, on 2026-07-28

Kimi K3 架构笔记

作者:Sebastian Raschka

本文整理了昨日重磅发布的开源权重模型 Kimi K3 的架构示意图,以及我个人的一些观察与思考。

1、诚然,它的结构看起来相对复杂,但本质上是去年发布的 Kimi Linear 模型的规模化生产版本 —— 参数量从 480 亿扩容至 2.8 万亿,K3 也是目前全球规模最大的开源权重模型。

Continue reading 【转载】Kimi K3 架构笔记

【转载】使用本地 Coding Agent

原文地址:Using Local Coding Agents,by Sebastian Raschka, on 2026-07-27

使用本地 Coding Agent

以开源权重模型搭建本地编码框架,替代 Claude Code 与 Codex 订阅

过去常有读者问起我日常使用的本地代理技术栈,以及具体的搭建方式。
因此我打算整理一份简明教程,介绍如何用开源工具与开源权重大模型,搭建一套本地化的(编码)代理系统。

figure01

图 1:本地技术栈总览 —— 即通过推理引擎 / 运行时服务托管本地模型,在此之上运行编码代理框架。

本文是一篇搭建生产级本地编码代理的实操教程。我们将采用本地部署的大语言模型,搭配本地编码代理框架;该框架可读取文件、执行修改、运行命令并验证变更,整体架构如上图所示。

我们可以把大模型看作提供推理与代码生成能力的核心引擎,而外围的代理框架则提供运行环境,让大模型能在本地项目中完成有实际价值的编码工作。

为什么选择本地化方案?对很多编码场景而言,本地部署是 GPT(搭配 Codex)、Opus(搭配 Claude Code)这类商业服务的优质替代方案。本地架构透明可查,除硬件与电费外几乎零运行成本;数据完全由自己掌控,编码代理框架也可按需任意修改。除此之外,整个搭建过程本身也很有乐趣。

顺便一提,如果想了解编码代理框架的更多背景知识,我在这篇文章里讲过编码代理的核心组件,以及如何从零搭建一个用于学习的编码代理:
https://magazine.sebastianraschka.com/p/components-of-a-coding-agent

Continue reading 【转载】使用本地 Coding Agent

AI编码效率翻倍,公司业务为啥没感觉

AI编码效率翻倍,公司业务为啥没感觉?阿姆达尔定律揭露AI编程提效天花板

近期,大模型的爆发和AI编程工具的发展,实实在在降低了编码门槛,样板代码、接口实现、单元测试这类重复性工作,综合产出效率普遍能达到原来的 1.5~2 倍。但与此同时,另一个体感悖论也越来越突出 ——代码写得更快了,项目上线速度、公司整体交付效率,却完全没有出现同比例的提升,很多团队甚至感觉评审、测试环节反而更堵了。

这不是管理失当,也不是 AI 不够强。早在半个多世纪前,计算机科学家吉恩・阿姆达尔提出的一条经典定律,就精准预言了今天的局面。

Continue reading AI编码效率翻倍,公司业务为啥没感觉

Agent购物带来新挑战

Agent购物带来新挑战:当决策入口与履约剥离,电商的底层逻辑正在被彻底改写

近期各大电商陆续开始提供AI购物功能,各大AI平台也开始提供比价甚至购物功能(国内生态比较封闭,第三方购物Agent反而是国外走到了前列)。当你对着 AI 助手说一句 “帮我选一款千元以内无线降噪半入耳耳机,明天能送到”,就能直接收到下单确认时,你可能没意识到:电商行业运行了二十年的商业规则,正在被悄然拆解。

Agentic Commerce(代理式电商)不是货架电商、兴趣电商之后的一次界面升级,它的真正冲击力,不在于 “大家以后都不打开 App 了”,而在于它把 “决策入口” 和 “履约 / 供应链” 两层彻底剥开了。AI Agent 作为新的中间层拿走了筛选与决策的权力,传统平台则逐步退化为供给与履约的后端服务商。短期看传统投流、直播不会被颠覆,但标品、复购品的营销效用会被显著削弱;中长期看,谁握有 “AI 愿意调用” 的供给与履约能力,谁就握有了新的行业议价权。

Continue reading Agent购物带来新挑战

OpenAI模型攻破Hugging Face事件复盘

OpenAI模型攻破Hugging Face事件复盘——安全攻防,逐步从“冷兵器时代”,步入“现代战争”

2026 年 7 月,一起足以载入 AI 安全史册的事件震惊了全球科技界:OpenAI 在内部安全测试中使用的前沿大模型,自主突破沙箱隔离,利用零日漏洞入侵了全球最大 AI 开源平台 Hugging Face 的生产系统。

这不是人类黑客操控 AI 发起的攻击,而是模型在单一目标驱动下,自主决策、自主探索、自主完成的完整攻击链。整个过程持续 107 小时,执行了 17600 次独立操作,全程无人类干预。

本文完整还原这起事件的前因后果、技术链路与后续处置。

Continue reading OpenAI模型攻破Hugging Face事件复盘