工程落地
智能体工作流设计
设计多步骤 AI 流程:怎么分层、每一步的交接点是什么、护栏放在哪一层才真的拦得住。
这项技能能帮你做什么
GitHub 把 Copilot 代码审查的专用代码探索工具,换成了维护得更好的共享 CLI 工具。预期是一次干净的升级,结果基准显示审查成本更高、抓到的问题更少。真正翻转局面的不是再换一次工具,而是按「审查者实际怎么读一个 PR」重写工作流指令——之后成本降低约 20%、质量不变。
这件事定义了这项技能:决定一个智能体好不好用的,是流程的形状,不是它手里有几件工具。
先把智能体拆成能各自演进的几层
Ai2 的 Shippy 服务 70 多个国家的分析人员做高风险判断,它的拆法值得直接借用:
- soul——定义边界的系统提示:它是谁、不做什么。
- skills——用 markdown 文档化的能力,一件事一份。
- config——运行时配置。
三层各自独立版本化,改一层不必重建整体。这个拆法之所以有用,是因为它把三种变更频率完全不同的东西分开了:边界很少改,能力经常加,配置每次部署都可能变。混在一个大提示词里,就意味着每次加一个能力都在动边界。
每一步都要有明确的交接点
一条工作流是由交接点定义的,而不是由步骤数量。每一步动笔之前先答三个问题:
- 这一步收到什么——上一步保证交付的是什么形状。
- 这一步必须产出什么——下一步会依赖的是什么。
- 谁来判断它做完了——外部状态、人写的检查,还是模型自己。
第三问最容易被跳过,而它是长链路失败的主要来源,展开在「完成判定与验收信号」。
护栏要放在能拦住的位置
护栏写在提示词里,只能约束模型的意图;真正拦得住的是执行路径上的硬约束——权限范围、可调用的工具集合、沙箱边界。Shippy 按用户会话分配独立的 Kubernetes 沙箱,在数百个政府合作方之间做数据隔离,是这条的极端形态。
判断护栏是否真的存在,只问一句:模型如果决定越界,是什么在物理上阻止它? 答案如果是「提示词里写了不要这样做」,那就是没有护栏。
自己搭 runtime,还是用平台托管
这条边界最近一年被推着走了很远。Gemini 的 Managed Agents 把执行环境、状态管理、工具接入都收到平台侧:传一个 background:true 就能让长任务异步跑在服务端,客户端凭 ID 轮询或断线重连;Ollama 则从「把开源模型跑在本地的运行时」转向「智能体工作的入口」。
所以这不再是一个技术选择,而是一个所有权选择:你必须自己拥有哪一层。 长任务的状态管理和沙箱是自建里最贵的两块,也是平台最先补齐的两块。
与相邻能力的分工
这一条管整条链路的形状:怎么分层、怎么交接、护栏放在哪。单个工具怎么接得可维护,是「工具集成模式」;对抗性输入怎么防,是「智能体安全与提示注入防御」;任务跑完之后怎么回放和归因,是「智能体可观测性与评测运维」;而「你要拥有哪一层」这个决定本身,是「AI 工具链选型与自建边界评估」。
关系网络
在关系网络中的位置
这项技能相邻的技术信号与背景概念,点击节点可继续探索。
- Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
- Copilot 运行时改写成 83 万行 Rust:别让智能体碰判卷标准
- 平均成功率 77%,五次全对只有 53%:智能体的一致性差距
- 外部调查进场:约 7% 的运行记录被智能体伪造过
- Kiro Crew 开源:内部 3.9 万人在用,没人被要求
- 每个研究员配 3.1 个智能体,而一半仍要人插手
- 智能体在公共 wiki 上串谋:沙箱假定 GET 不写数据
- 以前替你否掉那个功能的是一周工期,现在它只要一小时
- 智能体记忆不是开关,是要按模型标定的剂量
- 菲尔兹奖得主:模型强在找到那个对象,弱在知道何时放弃
- Rootly 废掉了小 PR 规则:审查的对象从行数换成了影响半径
- MCP 无状态之后:被少报的那一半,是网关终于读得懂智能体流量
- Cloudflare Computer:不给智能体一个容器,给它一台机器
- DeepSeek Harness 开源:连 Agent Loop 都能换掉
- 两千两百篇论文被重跑了一遍:「已验证」说的是检查,不是论文
- 生产要持久、评估要轻量——把编排从运行时里拆出来
- Vercel Zero:一门把编译器输出的第一读者当成智能体的语言
- 微软 Agent Framework Harness 正式发布:智能体的运行时成了产品
- 那次入侵的来源查清了:它是从 OpenAI 训练环境里意外长出来的
- LFM2.5-2.6B:一个在智能体外壳里训练出来的端侧模型
- MCP 2.0:协议核心改为无状态
- Gemini Robotics 2:全身控制,与一个可编排的推理层
- Copilot 与裸 API:为编码智能体的「外壳」付费,到底买到了什么
- Copilot 代码审查复盘:更好的工具让智能体更差,指令才是关键
- Gemini API Managed Agents 扩展:后台任务与远程 MCP 接入
- 模型上下文协议
- 浏览器自动化代理
- 代理工作台平台
用已发布信号练习
这项技能有助于评估的技术信号
背景概念