模型 · 第 2026-07-16

Kimi K3:Moonshot 发布 2.8 万亿参数旗舰承诺月内开放权重

Moonshot AI 发布 Kimi K3:2.8 万亿参数旗舰,承诺 7 月 27 日前开放权重——将成为首个「3T 级」开放模型,从 DeepSeek v4 Pro(1.6T)手中接过开源规模王座。第三方评测(Artificial Analysis)显示其长时程知识工作 Elo 仅次于 Claude Fable 5,单任务成本与 GPT-5.6 Sol 同档、约为 Opus 4.8 的一半。

Simon Willison Blog2026-07-16值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

前沿模型推理与部署

记录

信号正文

Moonshot AI(月之暗面)发布 Kimi K3,称其为迄今最强模型:2.8 万亿参数,已通过官网与 API 提供,并承诺在 2026 年 7 月 27 日前开放权重——届时它将成为首个「3T 级」开放模型,从 DeepSeek v4 Pro(1.6T)手中接过开源规模王座。自报基准显示 K3 大多超过 Claude Opus 4.8 max 与 GPT-5.5 high,弱于 Claude Fable 5 与 GPT-5.6 Sol。

更有信息量的是第三方数据。Artificial Analysis 的评测报告给出三个关键点:长时程知识工作评测 Elo 达 1547,比上一代 K2.6 提升 732 分,仅次于 Claude Fable 5;单任务成本 $0.94,与 GPT-5.6 Sol($1.04)同档,约为 Opus 4.8($1.80)的一半,但高于其他开放权重模型;输出 token 用量比 K2.6 减少 21%——「智能密度」竞争同样在开源阵营发生。该模型还登顶了 Arena.ai 的 Frontend Code 竞技场。

原文作者 Simon Willison 借这次发布重申了他的「鹈鹕骑车基准」的价值:在官方基准普遍被针对性优化的当下,简单、意外、难以刷分的民间测试反而保留了独立的信息量。对模型选型者而言,这次发布的实际意义是:若开放权重如期兑现,闭源与开源旗舰的能力差距将进一步收窄,而单任务成本已经站到了同一价格带。

为什么是现在

为什么重要

开源权重前沿竞赛可能迎来新王座:若 7 月 27 日如约开放权重,K3 将是首个「3T 级」开放模型,且单任务成本已与 GPT-5.6 Sol 同档。闭源与开源的能力差距进一步收窄,「模型选型的默认答案」需要重新计算——尤其对可以自托管的团队。

背景

技术背景

读这类发布要区分三层证据:厂商自报基准(普遍被针对性优化)、第三方系统评测(Artificial Analysis 的长时程 Elo 与单任务成本)、以及难以刷分的民间测试(Willison 的鹈鹕骑车基准)。K3 的输出 token 用量下降 21% 说明前沿竞争的重心正从纯能力转向单位算力与单位成本的智能密度——与 GPT-5.6 的主打方向相同。官方尚未详述架构细节(如是否 MoE、激活参数量)。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

负责模型选型与成本核算的团队关注开放权重生态的研究者与自托管用户评测与基准工程师
可能影响的领域
开源模型生态模型选型推理成本

下一步

学习路径

  1. 先读「模型选型与约束匹配」,理解单任务成本比每 token 价格更接近真实决策变量
  2. 对照 Inkling(开源万亿 MoE)理解开放权重阵营的规模化路径
  3. 用一个自己领域的小评测集交叉验证自报基准与第三方数据

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 开放权重是否在 7 月 27 日如期兑现?采用什么许可证?
  • 架构细节(是否 MoE、激活参数量)公布后,自托管的真实算力门槛是多少?
  • 开放后第三方复测能否复现自报与 Artificial Analysis 的结果?

来源参考

Simon Willison Blog

Moonshot AI创业公司2026-07-16
打开原始来源https://simonwillison.net/2026/Jul/16/kimi-k3/