模型之间靠自然语言聊天，可能很快会显得非常低效。

一家创业公司，做了个挺有意思的东西，不让两个大模型互相写字，直接传 hidden state。

今天 Agent、Subagent、Model Council 的协作方式基本都一样。模型 A 想完一遍，把结果压成几百个 token；模型 B 再把这些 token 读进去，重新理解一遍。

这中间丢掉的信息可能多得离谱。

模型生成一个 token 之前，内部可能已经形成上百个 hidden vector，大约包含上百万个数字、2MB 左右的状态；最后真正输出的，只是从大约 15 万词表里选出的一个 token，大概 17 bits。大量内部计算在模型开口的一瞬间就被扔掉了。

所以他们训练了一个很小的「bridge」，专门负责翻译不同模型的内部表征。

实验里，用 GLM-5.2 到 Qwen-3.5。

这个大模型只负责把题目读进去，一个字都不生成；它的 hidden state 直接经过 bridge 塞给小模型，最后由小模型把答案写出来。两个模型本身都完全冻结，不需要重新微调。

加上 bridge 后，小模型可以追回自己和这个大模型之间 50% 的性能差距，相当于自身准确率提高约 25%；在更难的数据集上提升最高到 2 倍。和「先让大模型写一段话，再交给小模型」相比，同等大模型计算量下最高还能多拿约 10 个百分点。达到同样成绩，如果直接换一台中型模型跑，所需计算量大约是这套组合的 2.5 倍。

我们现在所有 Multi-Agent 的基础设施，默认「语言」就是 AI 之间最好的通信协议。这个假设很可能只是因为 API 只能吐 token。

人类需要语言，是因为没办法把脑子里的神经状态直接复制给另一个人。

模型可没有这个限制。

如果不同模型的 latent space 真能被稳定翻译，那么未来所谓「一个超级模型」可能都没那么重要了。大模型负责读和想，小模型负责生成，代码模型、数学模型、视觉模型各自挂上去，彼此传递的也不再是 prompt。

到那时候，我们看到的文字，只需要出现在 AI 最后一次跟人说话的时候。
