评估与分析
旗舰模型发布解读与换代判断
面对一份新旗舰模型公告,分清哪些数字可比、哪些是话术,并判断这次值不值得换——换代的成本大多不在模型本身。
前沿模型产品策略
这项技能能帮你做什么
每隔几周就有一份「最强模型」公告。要从里面提取出决策信息,先把公告里的数字分成三类。
可以直接横着比的:上下文长度、每百万 token 的价格、开放权重的许可条款、以及第三方独立评测(如 Artificial Analysis)的分数。这些有统一口径。
要先换算才能比的:参数量。MoE 模型会报两个数——总参数和激活参数。Inkling 的约 1 万亿总参数里每次只激活 41B,Kimi K3 的 2.8 万亿同理。拿总参数去和稠密模型比大小没有意义,真正决定推理成本的是激活参数。同理,训练数据的 token 规模要连数据配方一起看,单看总量说明不了质量。
基本不可比的:厂商自定义的复合指标。GPT-5.6 主打「单位算力的智能密度」,方向可能是对的,但没有公开口径,不能当选型依据,只能当作「这家在优化哪个方向」的信号。
什么时候才真该换?三个条件至少满足一个:
- 现在的模型在某个具体任务上稳定失败,且已经排除了提示词和上下文的问题。
- 成本结构发生数量级变化,不是便宜一两成。
- 出现了你确实需要的新能力——更长上下文、原生多模态输入、或者开放权重让你能自托管。
「榜单排名变了」不是换代理由。
换代真正的开销通常不在模型本身,而在这四项:
- 提示词要重调。 不同模型对指令的敏感度不同,原样搬过去经常退化。
- 评测要重跑。 不重跑就不知道换完是变好还是变差,只是换了个感觉。
- 成本要重算。 单价降了不等于账单降了——输出长度、重试率、上下文填充量都会变。
- 上下游要回归。 工具调用格式、输出解析、超时设置都可能要跟着改。
遇到「开放权重」的公告,还要多看一步:宣布开源和真的能用之间有距离——权重哪天真放出来、许可允不允许商用、能不能用它的输出去训练别的模型,各家写法差别很大。承诺本身不是可用性。
这项技能和「模型与输出评估」分工清楚:那一条讲怎么设计你自己的检查,这一条讲怎么读别人的公告、决定要不要换。实际用起来是先后关系——先用这条判断值不值得试,再用那条验证试的结果。
关系网络
在关系网络中的位置
这项技能相邻的技术信号与背景概念,点击节点可继续探索。
旗舰模型发布解读与换代判断
技术 · 22
- 纳维-斯托克斯之争:88 小时、3000 亿 token,和一个没回答的问题
- 拒答率涨到 85%,同一检查点误拒也涨到 74%
- 90 亿个变异预先算好:把模型变成一份资源
- 模型之间只传 17 比特:一座桥补上一半差距
- 每个研究员配 3.1 个智能体,而一半仍要人插手
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- BenchMIRT:一个基准的分数,常常在测别的东西
- 首次双盲评测:评测方看不到权重,模型方看不到题
- Muse Glimmer 开源:30B 压进消费级显卡,报错不停下
- Qwen3.8-27B 的第三方实测:模型很好,出厂默认值不好
- Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
- 开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
- Gemini 3.7 Flash:主力档三周一迭代,价格砍半
- Meta 重回开放权重:一封长文、一个独立董事会,和一组本地部署的数字
- vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈
- Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能体设计
- BigBang-v1:把数据生产系统本身当成优化对象,以及一处对不上的口径
- SGLang v0.5.17:Kimi K3 首日可服务,以及一个认识会话的前缀缓存
- Google Gemini Flash Cyber:面向漏洞发现与修复的轻量安全模型
- Kimi K3:Moonshot 发布 2.8 万亿参数旗舰,承诺月内开放权重
- Inkling:Thinking Machines 开源万亿参数多模态 MoE 模型
- GPT-5.6:OpenAI 新一代旗舰模型,主打单位算力智能密度
用已发布信号练习
这项技能有助于评估的技术信号
背景概念