工具 · 第 2026-09-07

模型之间只传 17 比特:一座桥补上一半差距

大模型生成一个 token 时内部构建约两兆字节的状态,最后只吐出 17 个比特——而所有多模型协作系统(子智能体、模型委员会、路由调度)都建立在这 17 个比特之上。Mostik 让 753B 的 GLM-5.2 把隐藏状态通过一座小桥直接交给 4B 的 Qwen-3.5,全程不产生文本、两边权重完全冻结、桥是唯一被训练的部分。结果:4B 补上与 753B 约 50% 的差距、自身准确率 +25%、难题子集上 2 倍,而大模型侧推理成本降到约二十分之一。技术细节尚未公开,团队以比赛未结束为由拒绝披露。

量子位2026-09-07立即关注

多个信号同时成立,建议优先评估这条技术变化。

端侧 AI推理与部署前沿模型

记录

信号正文

17 比特与两兆字节

大模型生成一个 token 的过程中,内部会构建一百多个隐藏向量、约一百万个数值,合计约 两兆字节 的内部状态。然后它从大约 15 万词的词表里挑出一个 token 输出——17 个比特离开模型,两兆字节被丢掉,不再被使用

而目前所有让多个模型协作的系统——编程子智能体、模型委员会、路由调度——全部建立在那 17 个比特之上。模型之间唯一的沟通渠道是文本。

被丢掉的部分不是格式,是深层计算。近两年的可解释性研究给了具体证据:一篇 ICLR 2026 的论文显示,Qwen-3 在写出 accountant 这个词之前好几个 token,内部就已经带着它的表征,而正是这个表征让它提前选对了冠词 an 而不是 a;模型越大,这种提前规划越强。Anthropic 在 Claude 3.5 Haiku 上观察到同类现象——写诗时落笔之前韵脚就已经定下,并进一步描述了一种被称作 J-space 的结构:模型在任意时刻都维护着一组未表达的概念,既不是输入的回声,也不是对下一个 token 的猜测。

桥做了什么

Mostik 的做法是让发送方把隐藏状态通过一座小型的、经过训练的桥直接交给接收方,接收方拿到内部状态后直接使用。全程不产生任何文本,两个模型的权重完全冻结,桥是系统中唯一被训练的部分。

公开演示里,发送方是智谱的 GLM-5.2(753B,云端),接收方是阿里的 Qwen-3.5(4B,可在手机上跑)。大模型自始至终不写一个字:读题、隐藏状态穿过桥、停止;所有文本由小模型生成。

成本设计是这套方案能成立的另一半。逐个生成 token 的解码环节最贵,一次性读入整个输入的预填充便宜得多——桥让大模型只做预填充、不做解码,把最贵的活全交给小模型

数字,以及它们成立的条件

  • 4B 模型补上了它与 753B 之间约 50% 的性能差距,自身准确率提升 25%
  • 在大小模型差距更明显的难题子集上,提升达到 2 倍
  • 大模型侧推理成本压到原本的约 二十分之一
  • 换算算力:不用桥要拿到同样成绩需要部署一个中等规模模型,而桥方案的计算成本是它的 五分之二
  • 与文本接力等标准组合方法对比,在所有测试的大模型算力水平上桥都更好;优势在交接点极早时最明显——那时文本接力根本没有内容可传,而隐藏状态里已经有东西了。

最值得记的一个设计选择是两个模型被刻意冻结。GLM-5.2 与 Qwen-3.5 出自不同团队、不同数据,却能通过一座桥有效传递信息而不需要对任何一方微调——团队说这正是严格测试的用意:如果有用信息能在这种条件下通过,说明桥所利用的结构是训练过程中自然产生的,不是被对齐出来的。

没有公开的那一半

技术细节尚未披露,团队以「比赛还没结束」为由拒绝在此刻公开。所以这条信号能核对的是公开演示与团队自述的实验结果,不是一篇可复现的论文

首席科学家、2010 年菲尔兹奖得主 Stanislav Smirnov 自己给出的限制更值得抄下来:在两个 AI 模型之间找到数学上的共同基础其实非常困难,目前似乎还没有合适的数学语言来描述这件事

Mostik 在俄语里意为「小桥」,成立 4 个月,15 人,其中 12 名博士。

为什么是现在

为什么重要

端侧与云端的分工一直被当成「谁跑哪一部分」的问题,而这条信号指出真正的瓶颈在接口上:两个模型之间每次只交换一个 token 的 17 个比特,把一百万个数值的内部状态整个丢掉。如果这条通道能变宽,那么「大模型算、小模型说」就成为一种新的成本结构——大模型只做便宜的预填充,昂贵的解码留给手机上的 4B。

背景

技术背景

桥的训练目标是让接收方能直接使用发送方的隐藏状态,而不需要对任何一方微调。两个模型出自不同团队、不同训练数据,却能在完全冻结的条件下完成有效传递——团队据此论证桥所利用的结构是训练过程中自然产生的。对比实验覆盖文本接力等标准组合方法,桥在所有测试的大模型算力水平上都更优,且优势在交接点极早时最大,因为那时文本接力还没有任何内容可传。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在做端云协同推理、正在权衡把哪一半放本地的架构师关注多智能体系统里模型间通信开销的工程师需要判断一个高分是模型能力还是系统设计的评估负责人
可能影响的领域
端云协同推理多模型协作推理成本结构

下一步

学习路径

  1. 先记住那对数字:一次生成构建约两兆字节内部状态,输出 17 个比特——所有多模型系统都建立在后者上
  2. 读《本地与云混合推理架构》:这条信号改变的是那条线怎么划,而不是划在哪
  3. 把成本设计单独看一遍:大模型只做预填充、小模型做解码,二十分之一的降幅来自这里而不是来自桥本身
  4. 读《模型选型与约束匹配》:4B 能承接的前提是它只需要写,不需要想
  5. 对照本站的 ARC-AGI-3 相关记录,问同一个分数在两种系统下各自意味着什么

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 桥在两个未曾一起训练过的模型对之间的迁移性如何,换一对还成立吗?
  • 隐藏状态直传之后,这条通道上的内容还能被审计吗?
  • 技术细节公开之前,这些数字有多少是可复现的?

来源参考

量子位

Mostik创业公司2026-09-07
打开原始来源https://www.qbitai.com/2026/09/485108.html