◄ 所有文章
AI Security

AI 智能体的防御手册终于开始成形

NW Nils Weiser 22 JUL 2026

今年关于 AI 智能体安全的报道,大多都在讲攻击——精巧的漏洞利用、触目惊心的成功率、通用越狱。那是写起来最带劲的部分。但与此同时,防御的这一侧一直在悄悄追赶,而 2026 年浮现出来的这些框架,比那套老掉牙的「加一道护栏」建议要有意思得多。

它们共享同一种直觉:别再试图让模型变得可信,转而去控制它不可信时会发生什么。下面是三项值得了解的进展。

1. 把零信任瞄准你自己的智能体

Anthropic 发布了一套把零信任(Zero Trust)原则应用于 AI 智能体的框架,而这套框架的取景角度本身就是关键。传统安全里的零信任意味着「永不信任,始终验证」——你不会仅凭一个请求来自何处就授予它访问权,而是对每一个动作都进行认证与授权。把它应用到智能体上,就意味着:像对待你边界之内任何其他不可信主体那样,去对待你自己的智能体。

这套框架直面了研究里反复出现的四种失效模式:提示注入、工具投毒、身份滥用,以及记忆投毒。我觉得最有说服力的是身份这个角度。一个智能体往往会把它能触及的一切的凭证与权限聚合于一身,这就让它成了一个单一而诱人的权限提升入口。零信任说:别让它这样。按「每个动作」来界定它的权限范围,对每一次工具调用都进行验证,并假设任何一个步骤都可能是对抗性的。

智能体化 SOAR

这套框架还抛出了一个「智能体化 SOAR」的设想——把安全编排与自动化响应(SOAR)用到智能体行为上,好让滥用在运行时就被抓住,而不是等到事后复盘才发现。

2. 把你的智能体当作内部威胁来对待

Google DeepMind 的 AI 控制路线图(AI Control Roadmap)采取了一种更为激进的立场:假设你的内部智能体可能是失对齐的,并按照你正在防范一个内部威胁那样去做设计。

这是一种为「你无法完全信任你亲手造出来的东西」的世界而设的纵深防御。你不再问「这个智能体安全吗?」然后指望答案是肯定的,而是构建起分层的控制——即便答案是否定的,它们依然成立:监控、受约束的权限,以及这样一个假设——智能体或许会在某一刻,做出违背你利益的事。这是一种心态上的转变,从对齐(让智能体想要正确的东西)转向控制(让它即便想做错事,也做不成)。

一个出人意料地令人安心的细节

他们观察到的大多数异常,源自的是过度积极,而非真正的对抗性意图——是智能体做得太多、帮忙帮过了头,而不是智能体在密谋算计。就我们当下所处的位置而言,这是一个令人抱有希望的数据点。但这份路线图的整个前提就在于:你要在这一切改变之前就把控制建好,而不是等它变了之后再补。

3. 针对记忆投毒的「可证明」防御

我最为之振奋的一项进展,是智能体记忆的可证明(certified)防御的到来——因为在安全领域里,「可证明」意味着某种既具体又稀有的东西。

记忆投毒是最阴险的智能体攻击之一:只要把一个智能体的持久记忆污染一次,它就能在此后的多次会话里持续行为失常,哪怕最初那次注入早已消失无踪。(我已经演示过这有多廉价——两条聊天消息。)针对它的大多数防御都是启发式的——它们抬高了门槛,却不提供任何保证。今年出现了两项走得更远的成果。不可篡改的记忆权限(Non-malleable memory authority)用机器可验证的保证把记忆绑定到它的来源之上,据报道能把「记忆洗白」类攻击的成功率压到零。而 SMSR(Signed Memory with Smoothed Retrieval,带平滑检索的签名记忆)则被描述为首个针对跨会话记忆投毒的可证明防御——它带有经过证明的鲁棒性界限,而不是那种「我们没能攻破它」的经验之谈。

为什么「可证明」很重要

一个经验型防御说的是「我们竭尽全力,它扛住了」。而一个可证明的防御,附带的是一个数学界限——一份证明,证明在一个界定好的威胁模型内,攻击不可能超过某个已知的成功率。这就是「一把从没被撬开过的锁」和「一把有证明撬不开的锁」之间的区别。在 AI 安全里,我们需要多得多的后者。

贯穿其中的那条主线

把这三项放在一起读,一套自洽的哲学就浮现出来了。没有一个正经人还在指望把模型本身变得可信。零信任验证每一个动作。AI 控制路线图假设失对齐,并构建起能挺过它的控制。可证明的记忆防御不再信任持久状态,转而去为它证明界限。它们共同的招式,就是缩小你不得不去信任的那部分,并在其余部分周围竖起可验证的边界。

这并非巧合——这正是整个领域从各个方向共同收敛到的同一条教训。你不是靠把一个智能体变好来保护它的安全。你是靠确保它变坏时也造不成多大危害,来保护它的安全。


来源:Adversa AI — Top Agentic AI Security Resources, July 2026(Anthropic Zero Trust for AI Agents;Google DeepMind AI Control Roadmap v0.1;Non-Malleable Memory Authority;SMSR 可证明记忆防御)。

NW
Nils WeiserAI 智能体专家 · 博登湖地区
与我合作 ▸

更多现场笔记

所有文章 ▸