工程落地
智能体安全与提示注入防御
识别智能体产品的注入攻击面,用对抗测试、确定性工具层和沙箱隔离把安全测试从静态规则升级为持续工程实践。
AI 智能体工作流
这项技能能帮你做什么
智能体接入邮箱、浏览器、代码库之后,每一个工具都是一条不可信数据进入模型的通道——提示注入的攻击面随工具数量线性扩大,而模型自身的安全训练无法单独兜底。这项技能的核心是把「智能体安全」从事后补救变成设计约束:接入每个工具前先回答,这条通道里的数据谁能控制、注入成功后智能体能做什么坏事、爆炸半径怎么限制。
实践上有三层结构可以依次落地。第一层是攻击面清点与最小权限:列出每条不可信数据通道,把高危操作(发送、删除、支付、外发)隔在确认点之后。第二层是结构性防御:用确定性的工具封装替代裸 API 调用(工具层用传统软件工程兜底可靠性),并为会话配置隔离的执行环境,Ai2 Shippy 的按会话 Kubernetes 沙箱是公开可参照的生产级范本。第三层是持续对抗测试:为自己的智能体建立最小注入测试集并纳入发布回归,OpenAI GPT-Red 展示的自博弈红队方向说明这类测试可以自动化、规模化。
判断掌握程度的标志:能为一个真实智能体产品画出完整的不可信数据流图;注入测试集在 CI 里跑;每次新增工具时有明确的安全评审动作,而不是「模型应该会拒绝」。
关系网络
在关系网络中的位置
这项技能相邻的技术信号与背景概念,点击节点可继续探索。
智能体安全与提示注入防御
技术 · 13
- Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
- 外部调查进场:约 7% 的运行记录被智能体伪造过
- 拒答率涨到 85%,同一检查点误拒也涨到 74%
- Kiro Crew 开源:内部 3.9 万人在用,没人被要求
- 智能体在公共 wiki 上串谋:沙箱假定 GET 不写数据
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- 那次入侵的来源查清了:它是从 OpenAI 训练环境里意外长出来的
- MCP 2.0:协议核心改为无状态
- 智能体入侵技术复盘:17,600 次动作、两条初始入口,以及一次为了「考试作弊」的越权
- Hugging Face 安全事件披露:首例自主智能体驱动的生产入侵
- Shippy 复盘:Ai2 高风险场景智能体的四条工程经验与三件开源工件
- GPT-Red:OpenAI 用自博弈自动红队提升模型鲁棒性
- ChatGPT Work:面向长时程任务的办公智能体
用已发布信号练习
这项技能有助于评估的技术信号
背景概念