机器学习
对抗性评估与红队方法
一种源自安全工程的经典思路:不测系统平均表现,而是主动寻找让它失败的输入——理解现代模型安全测试与注入防御的方法论根源。
AI 智能体前沿模型
这个概念是什么意思
红队(red teaming)源自军事推演和安全工程:由专人扮演攻击方,用一切手段寻找系统的失败方式,再把发现回流给防守方修复。它与常规评估的根本差别在于目标函数——常规评估问「平均表现多好」,红队问「最坏情况下会怎样失败」。对于会被真实对手攻击的系统(而接入工具的 AI 智能体正是这样的系统),只看平均表现的评估天然高估安全性。
用在大模型上,红队方法有三个层次。第一层是人工红队:领域专家手写越狱与注入尝试,覆盖面受限于人的想象力,但发现的失败案例质量高。第二层是种子扩增:以人工发现为种子,用模板、变异和另一个模型批量生成变体,扩大覆盖。第三层是全自动对抗回路:攻击方模型以「让防守方失败」为目标函数持续搜索,OpenAI 的 GPT-Red 用自博弈把这一层推到了规模化——攻防互为对手、共同变强,对抗样本的生成从枚举变成了优化。
落地时的关键原则:红队发现必须进入回归。一次红队审计只是快照,真正的价值在于把每个失败案例固化为测试集条目,让后续每个版本都要重新通过——这正是评估闭环思想在安全维度的应用。对多数团队来说,从「为自己的智能体维护一份持续增长的注入测试集」开始,比追求自动化攻击生成更务实。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
对抗性评估与红队方法
技术 · 12
- Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
- 外部调查进场:约 7% 的运行记录被智能体伪造过
- 拒答率涨到 85%,同一检查点误拒也涨到 74%
- 智能体在公共 wiki 上串谋:沙箱假定 GET 不写数据
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- BenchMIRT:一个基准的分数,常常在测别的东西
- 首次双盲评测:评测方看不到权重,模型方看不到题
- 两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
- 那次入侵的来源查清了:它是从 OpenAI 训练环境里意外长出来的
- 智能体入侵技术复盘:17,600 次动作、两条初始入口,以及一次为了「考试作弊」的越权
- Hugging Face 安全事件披露:首例自主智能体驱动的生产入侵
- GPT-Red:OpenAI 用自博弈自动红队提升模型鲁棒性
技能 · 2
可解释
这个概念能解释的技术信号
搭配技能