Shippy 复盘:Ai2 高风险场景智能体的四条工程经验与三件开源工件
Ai2 Skylight 团队复盘海事态势感知智能体 Shippy 的工程实践:智能体三分解剖(soul/skills/config)、确定性 CLI 工具层、按会话隔离的沙箱部署、专家加权评分的活数据评估,并开源了 OpenClaw(智能体框架)、Harbor(评估框架)与 Mothership(托管平台)三件工件。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
Shippy 是 Ai2 Skylight 团队为实时海事态势感知构建的智能体,服务 70 多个国家的分析人员做高风险业务决策——错误回答可能浪费执法资源甚至危及人员安全,这决定了它的工程取向:可靠性优先于能力上限。
复盘提炼出四条经验。第一,把智能体拆成 soul(定义边界的系统提示)、skills(用 markdown 文档化的能力)与 config(运行时配置)三层,各自独立版本化,改动无需重建整体。第二,模型不直接拼裸 API 调用,而是通过专门构建的确定性 CLI 与后端交互——分页错误、畸形查询这类隐蔽 bug 在工具层就被消化,且每一层可独立测试。第三,Mothership 平台按用户会话分配独立的 Kubernetes 沙箱部署,在数百个政府合作方之间做数据隔离的同时支撑多步分析。第四,评估不用静态基准,而是在活数据上由领域专家定义加权评分表,真实捕捉工具选择与护栏遵守情况。
随文开源三件工件:OpenClaw(智能体框架)、Harbor(带 Shippy 插件的评估框架)、Mothership(通用智能体托管平台),外加与 Claude Code、Codex 通用的 agent-skills markdown 规范。对正在把智能体推向生产环境的团队,这是一份罕见的「高风险场景」一手工程记录。
为什么是现在
为什么重要
生产级智能体的公开工程复盘本就稀少,高风险场景(错误决策有真实代价)的更是罕见。四条经验——三分解剖、确定性工具层、会话级沙箱、专家评分的活数据评估——每一条都指向同一个主题:智能体可靠性来自工程结构,不是模型能力。
背景
技术背景
「模型通过确定性 CLI 而非裸 API 与系统交互」是近期智能体工程的收敛趋势:把不可靠性关进模型与工具的边界之内,工具层用传统软件工程的确定性来兜底。agent-skills 的 markdown 规范与 Claude Code、Codex 通用,也印证了智能体能力描述格式正在跨厂商标准化。
关注人群
谁该关注
下一步
学习路径
- 对照 soul/skills/config 三分法审视自己的智能体:提示、能力、配置是否已经解耦
- 把最容易出错的一个 API 调用包成确定性 CLI 工具,对比错误率变化
- 参照 Harbor 的思路,为自己的智能体定义一份领域专家加权的评分表
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- OpenClaw 与现有主流智能体框架相比的差异化设计是什么?
- 会话级 Kubernetes 沙箱的成本与冷启动延迟在什么量级?
- agent-skills 规范会不会成为跨厂商的事实标准?
来源参考