工作流 · 第 2026-07-15

Shippy 复盘:Ai2 高风险场景智能体的四条工程经验与三件开源工件

Ai2 Skylight 团队复盘海事态势感知智能体 Shippy 的工程实践:智能体三分解剖(soul/skills/config)、确定性 CLI 工具层、按会话隔离的沙箱部署、专家加权评分的活数据评估,并开源了 OpenClaw(智能体框架)、Harbor(评估框架)与 Mothership(托管平台)三件工件。

Hugging Face Blog2026-07-15值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

AI 智能体工作流

记录

信号正文

Shippy 是 Ai2 Skylight 团队为实时海事态势感知构建的智能体,服务 70 多个国家的分析人员做高风险业务决策——错误回答可能浪费执法资源甚至危及人员安全,这决定了它的工程取向:可靠性优先于能力上限。

复盘提炼出四条经验。第一,把智能体拆成 soul(定义边界的系统提示)、skills(用 markdown 文档化的能力)与 config(运行时配置)三层,各自独立版本化,改动无需重建整体。第二,模型不直接拼裸 API 调用,而是通过专门构建的确定性 CLI 与后端交互——分页错误、畸形查询这类隐蔽 bug 在工具层就被消化,且每一层可独立测试。第三,Mothership 平台按用户会话分配独立的 Kubernetes 沙箱部署,在数百个政府合作方之间做数据隔离的同时支撑多步分析。第四,评估不用静态基准,而是在活数据上由领域专家定义加权评分表,真实捕捉工具选择与护栏遵守情况。

随文开源三件工件:OpenClaw(智能体框架)、Harbor(带 Shippy 插件的评估框架)、Mothership(通用智能体托管平台),外加与 Claude Code、Codex 通用的 agent-skills markdown 规范。对正在把智能体推向生产环境的团队,这是一份罕见的「高风险场景」一手工程记录。

为什么是现在

为什么重要

生产级智能体的公开工程复盘本就稀少,高风险场景(错误决策有真实代价)的更是罕见。四条经验——三分解剖、确定性工具层、会话级沙箱、专家评分的活数据评估——每一条都指向同一个主题:智能体可靠性来自工程结构,不是模型能力。

背景

技术背景

「模型通过确定性 CLI 而非裸 API 与系统交互」是近期智能体工程的收敛趋势:把不可靠性关进模型与工具的边界之内,工具层用传统软件工程的确定性来兜底。agent-skills 的 markdown 规范与 Claude Code、Codex 通用,也印证了智能体能力描述格式正在跨厂商标准化。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

把智能体推向生产环境的工程团队智能体平台与基础设施建设者关注智能体评估方法的从业者
可能影响的领域
智能体工程实践智能体评估方法多租户智能体部署

下一步

学习路径

  1. 对照 soul/skills/config 三分法审视自己的智能体:提示、能力、配置是否已经解耦
  2. 把最容易出错的一个 API 调用包成确定性 CLI 工具,对比错误率变化
  3. 参照 Harbor 的思路,为自己的智能体定义一份领域专家加权的评分表

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • OpenClaw 与现有主流智能体框架相比的差异化设计是什么?
  • 会话级 Kubernetes 沙箱的成本与冷启动延迟在什么量级?
  • agent-skills 规范会不会成为跨厂商的事实标准?

来源参考

Hugging Face Blog

Ai2研究实验室2026-07-15
打开原始来源https://hf-mirror.com/blog/allenai/shippy-tech-blog