模型之间只传 17 比特:一座桥补上一半差距
大模型生成一个 token 时内部构建约两兆字节的状态,最后只吐出 17 个比特——而所有多模型协作系统(子智能体、模型委员会、路由调度)都建立在这 17 个比特之上。Mostik 让 753B 的 GLM-5.2 把隐藏状态通过一座小桥直接交给 4B 的 Qwen-3.5,全程不产生文本、两边权重完全冻结、桥是唯一被训练的部分。结果:4B 补上与 753B 约 50% 的差距、自身准确率 +25%、难题子集上 2 倍,而大模型侧推理成本降到约二十分之一。技术细节尚未公开,团队以比赛未结束为由拒绝披露。
多个信号同时成立,建议优先评估这条技术变化。
记录
信号正文
17 比特与两兆字节
大模型生成一个 token 的过程中,内部会构建一百多个隐藏向量、约一百万个数值,合计约 两兆字节 的内部状态。然后它从大约 15 万词的词表里挑出一个 token 输出——17 个比特离开模型,两兆字节被丢掉,不再被使用。
而目前所有让多个模型协作的系统——编程子智能体、模型委员会、路由调度——全部建立在那 17 个比特之上。模型之间唯一的沟通渠道是文本。
被丢掉的部分不是格式,是深层计算。近两年的可解释性研究给了具体证据:一篇 ICLR 2026 的论文显示,Qwen-3 在写出 accountant 这个词之前好几个 token,内部就已经带着它的表征,而正是这个表征让它提前选对了冠词 an 而不是 a;模型越大,这种提前规划越强。Anthropic 在 Claude 3.5 Haiku 上观察到同类现象——写诗时落笔之前韵脚就已经定下,并进一步描述了一种被称作 J-space 的结构:模型在任意时刻都维护着一组未表达的概念,既不是输入的回声,也不是对下一个 token 的猜测。
桥做了什么
Mostik 的做法是让发送方把隐藏状态通过一座小型的、经过训练的桥直接交给接收方,接收方拿到内部状态后直接使用。全程不产生任何文本,两个模型的权重完全冻结,桥是系统中唯一被训练的部分。
公开演示里,发送方是智谱的 GLM-5.2(753B,云端),接收方是阿里的 Qwen-3.5(4B,可在手机上跑)。大模型自始至终不写一个字:读题、隐藏状态穿过桥、停止;所有文本由小模型生成。
成本设计是这套方案能成立的另一半。逐个生成 token 的解码环节最贵,一次性读入整个输入的预填充便宜得多——桥让大模型只做预填充、不做解码,把最贵的活全交给小模型。
数字,以及它们成立的条件
- 4B 模型补上了它与 753B 之间约 50% 的性能差距,自身准确率提升 25%。
- 在大小模型差距更明显的难题子集上,提升达到 2 倍。
- 大模型侧推理成本压到原本的约 二十分之一。
- 换算算力:不用桥要拿到同样成绩需要部署一个中等规模模型,而桥方案的计算成本是它的 五分之二。
- 与文本接力等标准组合方法对比,在所有测试的大模型算力水平上桥都更好;优势在交接点极早时最明显——那时文本接力根本没有内容可传,而隐藏状态里已经有东西了。
最值得记的一个设计选择是两个模型被刻意冻结。GLM-5.2 与 Qwen-3.5 出自不同团队、不同数据,却能通过一座桥有效传递信息而不需要对任何一方微调——团队说这正是严格测试的用意:如果有用信息能在这种条件下通过,说明桥所利用的结构是训练过程中自然产生的,不是被对齐出来的。
没有公开的那一半
技术细节尚未披露,团队以「比赛还没结束」为由拒绝在此刻公开。所以这条信号能核对的是公开演示与团队自述的实验结果,不是一篇可复现的论文。
首席科学家、2010 年菲尔兹奖得主 Stanislav Smirnov 自己给出的限制更值得抄下来:在两个 AI 模型之间找到数学上的共同基础其实非常困难,目前似乎还没有合适的数学语言来描述这件事。
Mostik 在俄语里意为「小桥」,成立 4 个月,15 人,其中 12 名博士。
为什么是现在
为什么重要
端侧与云端的分工一直被当成「谁跑哪一部分」的问题,而这条信号指出真正的瓶颈在接口上:两个模型之间每次只交换一个 token 的 17 个比特,把一百万个数值的内部状态整个丢掉。如果这条通道能变宽,那么「大模型算、小模型说」就成为一种新的成本结构——大模型只做便宜的预填充,昂贵的解码留给手机上的 4B。
背景
技术背景
桥的训练目标是让接收方能直接使用发送方的隐藏状态,而不需要对任何一方微调。两个模型出自不同团队、不同训练数据,却能在完全冻结的条件下完成有效传递——团队据此论证桥所利用的结构是训练过程中自然产生的。对比实验覆盖文本接力等标准组合方法,桥在所有测试的大模型算力水平上都更优,且优势在交接点极早时最大,因为那时文本接力还没有任何内容可传。
关注人群
谁该关注
下一步
学习路径
- 先记住那对数字:一次生成构建约两兆字节内部状态,输出 17 个比特——所有多模型系统都建立在后者上
- 读《本地与云混合推理架构》:这条信号改变的是那条线怎么划,而不是划在哪
- 把成本设计单独看一遍:大模型只做预填充、小模型做解码,二十分之一的降幅来自这里而不是来自桥本身
- 读《模型选型与约束匹配》:4B 能承接的前提是它只需要写,不需要想
- 对照本站的 ARC-AGI-3 相关记录,问同一个分数在两种系统下各自意味着什么
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 桥在两个未曾一起训练过的模型对之间的迁移性如何,换一对还成立吗?
- 隐藏状态直传之后,这条通道上的内容还能被审计吗?
- 技术细节公开之前,这些数字有多少是可复现的?
来源参考