先摆两个本机测出来的数字。
我用 llama.cpp 在这台机器上跑 Qwen2.5-7B-Instruct(Q4_K_M,Metal 后端),读进一个 token 的速度是 1497 token/s,写出一个 token 的速度是 56.6 token/s——同一个模型、同一块芯片,读比写便宜 26 倍。原因只有一个:读可以整段并行,写必须一个一个来。
第二个数字:这个模型每个 token 要占 56 KiB 的 KV cache(28 层 × 4 个 KV 头 × 128 维 × K/V 两份 × fp16,从 GGUF 元数据算出来的)。而它辛苦算完之后吐出来的那个 token,是从 152064 个词里挑一个——上限 bit,2.15 字节。
两个模型用文本互相说话时,接口宽度比是 26,000 : 1。
把这两个数字并排放,「让模型跳过文本、直接把内部状态递给另一个模型」就不是猎奇新闻,而是一笔明显该算的账。这篇讲清这笔账怎么算、为什么算得通、以及它真实的代价在哪。
这篇的主线一句话:文本是一根极窄的吸管,而两个独立训练的模型的内部表示之所以能对接,是因为它们的几何相似到「差一个旋转」——桥的全部工作就是把这个变换找出来。
名词速查
| 术语 | 一句话解释 |
|---|---|
| 隐藏状态(hidden state) | 模型算到某一层、某个位置时手里那个向量。Qwen2.5-7B 是 3584 维 |
| 残差流(residual stream) | 贯穿所有层的那条「主干道」向量,每层往上加东西。详见《Out 投影到底在输出什么》 |
| KV cache | 注意力对已处理 token 的中间结果缓存,省掉重复计算,代价是显存。详见《KV cache 那笔账》 |
| prefill / decode | 推理两阶段:一次性并行读完输入 vs 逐 token 串行生成 |
| latent communication | 模型之间不发文本、直接传连续向量的通信方式,本文主角 |
| 桥(bridge / projector / translator) | 装在两个冻结模型之间、把发送方表示翻译成接收方能读的形式的小模块,通常是系统里唯一被训练的部分 |
| 正交变换 | 保持长度和夹角不变的线性变换,直观上就是「旋转(可能带反射)」。矩阵满足 |
| Procrustes 问题 | 给两堆对应的点,求最佳旋转把一堆对齐到另一堆。有闭式解,不用梯度下降 |
| 锚点(anchor) | 两个空间里已知互相对应的点对,用来拟合变换 |
| 冻结(frozen) | 模型权重完全不动,不做微调 |
门槛铺垫
这篇假设你知道 Transformer 大致的层结构、KV cache 是什么以及为什么占显存、以及 decode 为什么慢(受显存带宽而不是算力限制)。
还有一个概念上的前置:知识在模型里不是按格子存的。如果这点还别扭,先读《模型里没有一格存着「巴黎」》——本文第三节讲的「坐标系是任意的」是那篇结论的直接推论。
一、先把新闻和事实分开
这个话题最近的传播源头是一条新闻,说「俄罗斯团队让 GLM 直连 Qwen」。先把它归位,再进正题——因为这条路真正的证据不在那条新闻里。
能核实的部分:Mostik(俄语「小桥」)是一家俄罗斯人创办的初创公司,首席科学家是 2010 年菲尔兹奖得主 Stanislav Smirnov(日内瓦大学)。据多家二手报道(我未能直接访问其官网,本机网络策略拦截),其演示是把冻结的 GLM-5.2(753B)的隐藏状态经一个训练出来的桥递给冻结的 Qwen-3.5(4B),大模型全程只读不写、不生成任何 token,小模型负责全部生成;宣称成本约为单跑大模型的 1/20,性能落在两个模型之间。
不能核实的部分(这些是关键):没有 arXiv 论文,没有同行评议,没有代码,技术说明只发在自己官网。具体映射形式、哪些张量过桥、在哪一层注入,全部未披露。有分析指出其宣传口径的数字与自家技术说明不一致(据 explainx.ai,未核实)。ARC-AGI-3 榜首和 7.51 分的说法因比赛进行中而无细节。
我的判断:这条新闻在机制上完全可信(下面三节会说清为什么它必然可行),在证据上不可引用。所以本文后面所有的数字都不用它——用 ICLR / COLM 上有论文有代码的工作,加本机实测。这条新闻的价值只是把一个已经跑了四年的研究方向推到了公众视野。
二、根本问题:文本是一根 17 bit 的吸管
先把「文本损失了什么」量化。用本机这个模型的真实配置(从 GGUF 元数据读出:28 层、3584 维、28 个注意力头、4 个 KV 头、head_dim 128、词表 152064),三种可能的通信载体宽度是:
| 载体 | fp16 字节 | 相对一个 token 索引 |
|---|---|---|
| 一个输出 token 的索引 | 2.15 B( bit) | 1× |
| 末层 hidden state(单位置) | 7,168 B = 7.0 KiB | 3,331× |
| 每 token KV cache(跨全部层) | 57,344 B = 56.0 KiB | 26,649× |
| 全层残差流(单位置) | 200,704 B = 196.0 KiB | 93,273× |
(脚本验算过,脚本在文末。)
一个必须先说的诚实限定:这张表比的是接口的字节宽度,不是信息量。隐藏状态是 fp16 浮点数堆出来的,冗余极高、有效秩远低于维数,它携带的实际信息远小于 56 KiB;而一个 token 在给定上下文时的条件熵通常也远低于 17.2 bit(往往只有几 bit)。所以「26,000 倍」是通道口径比,不是「文本丢了 26,000 倍的信息」。把它当量级直觉用,别当结论用。
那么口径变窄,具体丢的是什么?三样东西:
- 分布退化成 argmax。模型算出的是词表上一整个概率分布,采样只留下一个索引。第二名候选是 0.49 还是 0.001,接收方无从得知。这一层的细节见《采样温度、top-k、top-p》。
- 跨层的中间计算被丢弃。模型在第 12 层可能已经算出了某个关键中间量,但残差流后续把它改写了、最终输出里看不到。KV cache 保留了每一层的痕迹,文本没有。
- 不确定性被抹平。「我认为是 A 但不太确定」在文本里得靠模型主动写出「不太确定」这几个字才传得过去,而它在内部本来就是一个可读的量。
这三点合起来是一句话:当模型 A 为模型 B 写字时,丢掉的不是格式,是做出这个选择背后的那部分计算过程。
顺带回应一个常见误解:这跟 tokenizer 效率无关。就算换个压缩率更高的 tokenizer(见《BPE 不是一个汉字一个 Token》),瓶颈依然在「离散化」这个动作本身,不在词表大小。
三、为什么能对接:坐标系本来就是任意的
这一节是全文的核心。问题是:GLM 和 Qwen 由不同团队、不同数据训练,凭什么它们的内部向量能互相翻译?
3.1 残差流没有「正确的」坐标系
先看一个可以自己推的事实。取任意正交矩阵 (),把残差流整体换个基:。这个改动能不能被权重完全吸收,让模型的函数一字不变?
逐个部件看(以 RMSNorm 架构为例,Qwen、Llama 都是):
- 所有读取残差流的线性层(,以及最后的 unembedding):。把 代回去就行——吸收。
- 所有写回残差流的线性层():新的输出要落在旋转后的基里,令 ——吸收。
- RMSNorm:。逐通道的 不与 交换,看起来是障碍。但 后面紧跟着一个线性层,可以先把它折进去:。折完之后 RMSNorm 只剩纯归一化 ,而 (正交保长),于是 ——等变,吸收。
- MLP 里的非线性:作用在投影之后的 空间上,不碰残差流——无关。
结论:折掉 之后,残差流的基对模型函数完全不可观测。 一个 3584 维空间的正交群维数是 万——有六百多万个自由度的旋转,每一个都给出一个功能完全相同的模型。
(严格性补一句:对做均值减法的 LayerNorm 架构,减均值是往全 1 方向的正交投影,只和保持全 1 方向的那些 交换,规范群缩小到 维子空间上的旋转。依然极大。)
所以:两个独立训练的模型没有任何理由用同一组坐标。 期待「把 GLM 的向量直接塞进 Qwen」能工作,是期待两次独立的随机初始化恰好落在同一个基上——不可能。
3.2 但几何可以是相同的
坐标任意,不代表结构任意。如果两个模型学到的是同一个几何(点与点之间的距离和夹角一致),只是用了不同的基去描述它,那么它们之间的映射恰好就是一个正交变换——因为正交变换正是「保距离保夹角」的那一类。
这不是我的推测,是有实证的:
- Moschella 等人 2022 年就观测到,在相同数据和建模选择下,不同潜在空间里编码之间的夹角不变(arXiv 2209.15430,ICLR 2023 notable top 5%)。他们据此提出用「样本到一组固定锚点的相似度」当表示,无需额外训练就能获得不变性——论文标题直接就叫 Relative representations enable zero-shot latent space communication。
- Huh 等人 2024 年把这个观察推广成 Platonic Representation Hypothesis(arXiv 2405.07987):AI 模型的表示正在收敛,模型越大,不同模型衡量数据点之间距离的方式越接近,跨模态也是如此。
把 3.1 的数学和 3.2 的实证拼起来,本质原理就出来了:
坐标系必然不同(数学决定),几何大致相同(实证观察)⇒ 两个模型的表示空间之间存在一个近似正交的映射。找到它,信息就能过去。
3.3 于是它有闭式解:正交 Procrustes
「求一个正交矩阵把一堆点最好地对齐到另一堆点」是一个有名字的老问题——正交 Procrustes:
一次 SVD,闭式解,不需要梯度下降,不需要训练数据以外的任何东西。
这直接解释了 StateBridge(arXiv 2608.13317,COLM 2026)为什么能做到 training-free:它把发送方末层的隐藏状态通过一个闭式正交变换对齐到接收方的输入空间,再加轻量的范数校准和词表锚定,然后作为连续前缀拼在接收方输入前面。在四个模型、两个模型家族、数学/代码/问答三类任务的 26 组模型-任务配对里,它在 22 组上取得最好或并列最好。
论文里那句「existing latent methods … require trained projectors that limit portability」现在读起来就很清楚了:如果映射本质上是个旋转,何必训一个投影头。
3.4 本机实验:d 维旋转需要且只需要 d 对锚点
上面的论证有个可以亲手验的推论:拟合这个变换需要多少对锚点? 我在本机跑了一个最小合成实验(不是真模型,是机制演示,下面会说清边界):
设定 64 维空间,2000 个点。模型 B 的坐标 = 模型 A 的坐标经一个随机正交变换、再加噪声。只用前 对锚点做 Procrustes 拟合,然后在最后 500 个完全没参与拟合的点上评估恢复质量(平均余弦相似度):
| 锚点数 | 无噪声 | 噪声 0.05 | 噪声 0.2 |
|---|---|---|---|
| 16 | 0.2710 | 0.2283 | 0.2659 |
| 32 | 0.4885 | 0.4970 | 0.4916 |
| 48 | 0.7519 | 0.7313 | 0.7252 |
| 56 | 0.8692 | 0.8644 | 0.8761 |
| 64 = d | 1.0000 | 0.9966 | 0.9593 |
| 72 | 1.0000 | 0.9988 | 0.9794 |
| 128 | 1.0000 | 0.9995 | 0.9928 |
| 1500 | 1.0000 | 1.0000 | 0.9996 |
三个可读到的结论:
- 阈值精确落在 。少一个都不行( 只有 0.87),到了 64 就是 1.0000。道理不神秘: 的正交矩阵有 个自由度,而每对锚点提供 个方程—— 对锚点给 个约束, 时才把解锁死。
- 越过阈值后立刻泛化。用 64 对锚点拟合出的旋转,在 500 个从未见过的点上余弦是 1.0000。这是「桥为什么可以用很小的样本集训出来、然后对任意输入都成立」的机制来源——XBridge 论文说自己「trained on a small balanced sample set」,根子在这里。
- 对噪声很稳。20% 噪声下 128 对锚点还能到 0.9928。几何不必完全一致,够像就行。
这个实验的边界必须说清:它证明的是「如果两个空间真的只差一个旋转,那么少量锚点足以闭式恢复、且能泛化」。它没有证明真实的 GLM 和 Qwen 只差一个旋转——那是 3.2 里的实证问题,也正是真实研究的战场。真实模型的几何只是近似一致,这个「近似」的缺口有多大,决定了下一节的全部工程复杂度。
四、桥装在哪一层:三个注入点
「只差一个旋转」是理想情形。现实中差的不只是旋转,于是出现了三条工程路线,区别在于桥接在模型的哪个位置。
flowchart LR
subgraph S["发送方(权重冻结)"]
S1["读入问题<br>prefill"] --> S2["各层残差流"]
S2 --> S3["末层 hidden state"]
S2 --> S4["各层 KV cache"]
end
subgraph B["桥(唯一被训练的部分)"]
B1["① 正交对齐"]
B2["② KV 投影与融合"]
B3["③ 交叉注意力"]
end
subgraph R["接收方(权重冻结)"]
R1["输入层<br>接连续前缀"] --> R2["中间各层"]
R2 --> R3["decode 出全部文本"]
end
S3 --> B1 --> R1
S4 --> B2 --> R2
S2 --> B3 --> R2
① 接在输入层:当成连续前缀
代表是 StateBridge(上一节已说)。发送方末层 hidden state 经变换后,像 prompt 一样拼在接收方输入之前。
好处是可移植性最强——只用到「输入嵌入层」这一个统一接口,跨模型家族通用,且可以做到零训练。代价是只用了末层那一个向量(7 KiB 量级),发送方中间各层的计算全部浪费。
② 接在 KV cache:逐层投影加融合
代表是 Cache-to-Cache(C2C),arXiv 2510.03215v2,ICLR’26,清华 NICS(Tianyu Fu 等)。它用神经网络把发送方的 KV cache 投影并融合进接收方的 KV cache,还有一个可学习的门控去挑「哪些层值得接」。
论文口径的数字(v2 版本):比单个模型平均准确率高 6.4–14.2%,比文本通信高约 3.1–5.4%,平均 2.5× 延迟加速。代码开源在 thu-nics/C2C。
一个关于证据纪律的插曲:这篇的 v1 和 v2 数字不一样(v1 是 8.5–10.5% / 3.0–5.0% / 2.0×)。我最初在二手转述里看到的是 v1 的数字。引论文数字务必回查当前版本——这也是本文所有 arXiv 编号和数字都从 arXiv API 当场拉取核实的原因。
同一路线上的两篇补充:
- KVComm(arXiv 2510.03346v3,ICLR 2026)解释了为什么大家从裸 hidden state 转向 KV:hidden state 有 information concentration bias(信息过度集中)的毛病。它按注意力重要性分数做逐层筛选,只传 30% 的层的 KV 就能逼近「把输入直接合并给一个模型」的上界。
- XKV(arXiv 2608.20617)解决了 C2C 的三个限制。其中最要紧的一条:据 XKV 的描述,C2C 要求两个模型读同一个输入;XKV 让双方可以在家族、深度、KV 头数、head_dim、tokenizer 上全不相同,且只训练 translator。45 组配置下,翻译一对 cache 快 10.3×(5.8 vs 59.9 ms),端到端比文本通信快 6.8×,可训练参数少 76%。
③ 接在中间层:交叉注意力,双向锁步
祖先是 Google 的 CALM(arXiv 2401.02412,2024 年 1 月)——在两个模型之间加交叉注意力来组合表示,两边权重都不动。PaLM2-S 配一个小模型,低资源语言翻译和算术上绝对提升最高 13%,代码生成相对提升 40%。
更激进的是 The Bicameral Model(arXiv 2605.11167):两个冻结模型每一步锁步并行,通过翻译网络和一个学出来的抑制门互相读对方的激活(门约占合并参数的 1%)。它有个结果特别值得记住:两个 0.5B 模型配一个计算器,算术准确率从 36% 提到 96%;而在数学推理任务上,辅助模型从未看过题目文本,只靠隐藏状态信号就能生成针对该题的代码。
三条路线的权衡
| ① 输入层前缀 | ② KV cache 融合 | ③ 交叉注意力锁步 | |
|---|---|---|---|
| 代表 | StateBridge | C2C / KVComm / XKV | CALM / Bicameral |
| 需要训练吗 | 可以不训练(闭式) | 要训桥 | 要训接口 |
| 用到发送方多少信息 | 只有末层一个向量 | 各层 KV,可筛选 | 各层激活,且双向 |
| 跨模型家族难度 | 最低(统一接口) | 中(需对齐深度/几何,XKV 已解) | 高(要锁步,架构耦合深) |
| 发送方要不要 decode | 不要 | 不要 | 要(同步跑每一步) |
| 适合什么 | 快速接一对模型、要可移植 | 大模型只读、小模型只写的省钱场景 | 工具调用、需要来回协商的任务 |
选型上,「大模型只 prefill、小模型全 decode」这个省钱形态对应的是②。这也正是 Mostik 演示的形态——它在路线图上并不新,新的是它把发送方推到了 753B。
五、真实的代价:连续通道会把名字弄丢
到这里都是好消息,该请怀疑的读者上场了。最尖锐的反对意见是:连续向量传的是「大概的意思」,那精确的东西怎么办?
这个担心完全成立,而且已经被量化了。XBridge(arXiv 2608.11676)把它命名为 entity grounding problem(实体接地问题):跨模型家族的交叉注意力桥会出现 rare-token compression collapse——罕见 token 在连续瓶颈里被压掉,实体身份丢失。纯用桥的 F1 只有约 30%。
这个数字很说明问题。「巴黎在法国」这种高频语义在向量空间里稳如磐石,但「客户订单号 A7X-99183」「这个人姓 Nakagawa」这类低频、任意、必须逐字符准确的东西,在一个平滑的连续空间里没有稳定落点。
XBridge 的解法很有启发性:把离散的东西请回来。它用 Lexical Anchor Mapping(LAM)把发送方的原始上下文 token 映射到接收方的词表,提供离散的实体锚点;再用 Latent Enrichment Bridge(LEB)让接收方去查询发送方的隐藏状态做上下文增强。离散锚点负责「是谁」,连续桥负责「怎么理解」,靠接收方自己的自注意力把两者绑到一起。结果是三个模型家族(Llama、Qwen、Mistral)、七个基准、两个通信方向上全面超过文本通信,延迟低 11×;LEB 只有 264M 可训练参数(接收方的 3.8%)。
所以正确的结论不是「文本没用」,而是一个分工:
文本擅长传身份(离散、精确、可验证),隐藏状态擅长传分布(连续、丰富、带不确定性)。把两者对立起来是错的,成熟的方案是混合。
这也是我对这条路线短期形态的判断:纯连续的桥不会赢,「离散锚点 + 连续增强」会。 XBridge 的 F1 30% 与其混合方案的差距就是这个判断的依据。这个判断可证伪——如果两年内出现一个纯连续通道在实体密集任务(比如多跳问答、结构化抽取)上稳定压过混合方案的工作,我就错了。
六、为什么划算:读写不对称是这门生意的全部
机制说完,说经济。桥的省钱逻辑只有一句话:让贵的模型只做便宜的事。
prefill 和 decode 的成本结构完全不同。prefill 是把整段输入一次性并行算完,是算力受限的大矩阵乘;decode 必须一个 token 一个 token 来,每步都要把全部权重从显存搬一遍,是带宽受限的(细节见《Decode 为什么跑不到理论带宽》)。
本机实测(llama-bench,Qwen2.5-7B-Instruct Q4_K_M,Metal,3 次重复):
| 测试 | 吞吐 | 相对 decode |
|---|---|---|
| pp512(prefill,512 token) | 1602.89 ± 24.16 t/s | 28.3× |
| pp2048(prefill,2048 token) | 1496.97 ± 11.34 t/s | 26.5× |
| tg128(decode,生成 128 token) | 56.56 ± 2.87 t/s | 1× |
读一个 token 比写一个便宜 26–28 倍。 这个比例就是桥要变现的东西:如果大模型全程只读不写,你为它付的是那个便宜 26 倍的价格。
由此可以对 Mostik 的「1/20 成本」做一个数量级检验。它宣称的 1/20,和本机测到的 26:1 读写不对称在同一个数量级上。所以这个数字在结构上是站得住的——这是我的判断,理由就是上面这张表:它不需要任何魔法,只需要把大模型的 decode 完全砍掉。
同时也要看清明码标价的代价:据报道其性能「落在两个模型之间」,即补上了小模型与大模型差距的约 50%。这是一笔明确的降级换省钱,不是免费午餐,不是「4B 打赢 753B」。C2C 论文的 2.5× 加速和 3.1–5.4% 的准确率优势,是同一件事更保守也更可信的表述。
七、一个更硬的反对:这是能力迁移,还是只是上下文压缩?
绿灯思维要求我把最难的问题提出来:桥传过去的,会不会只是「把输入换了种方式再说一遍」?如果是,那它就只是一种花哨的 prompt 压缩,谈不上「共享推理」。
这个怀疑有依据。据 XKV 的描述,C2C 要求两个模型读同一个输入——在那个设定下,桥传的确实更接近「对共享上下文的增强表示」,而不是「大模型独有的思考成果」。这是这条路线上一个真实的解释性隐患。
但有两条证据指向「不止于此」:
- XKV 明确取消了共享上下文的要求(sharer 编码了 receiver 没有的信息),并在 45 组配置下仍然有效。信息确实是从一边流到另一边的,不是双方各自算一遍。
- Bicameral 那个结果:辅助模型从未见过题目文本,仅凭隐藏状态信号就生成了针对该题的代码。如果桥只是在压缩输入文本,辅助模型不可能在完全没有文本的情况下写出问题特定的程序。
我的判断是:桥传递的是「已经被加工过的表示」,介于原始输入和最终答案之间。 它的价值不来自搬运输入,而来自搬运「大模型对这个输入做了几十层计算之后的中间结论」。这也解释了为什么效果在「交接点很早」时最明显——那时文本接力根本还没有内容可传,但内部状态里已经积累了东西。
不过这一段是我目前理解的推断,不是论文里的定论。这条路线上「桥到底传了什么」的可解释性研究还没做完,我没有看到直接测量它的工作。
八、可观测性:失去一个窗口,得到一个新面
一个值得记下的副作用(这一节是推测,标注清楚)。
思维链之所以对安全有用,部分原因是它把一部分推理外化成了人能读的文本。桥把这部分收回内部:两个模型之间交换的是向量,文本审计看不到任何东西。这是个新的失效模式——从外面看一切正常,通道里传了什么无从判断。
反过来,桥也增加了一个观察面:发送方隐藏状态、变换结果、接收方行为三者都可以被记录,而在单个模型内部你连这个切面都没有。这一点在原理上成立,但我没看到把它做成可靠监控工具的工作,所以现在只能算一个方向而不是结论。
已有的相关信号是 KVComm 指出的 information concentration bias——隐藏状态里的信息分布本身高度不均。这暗示「盯住哪几层」也许是可操作的。但我没有亲手验证过任何一条。
结尾:带得走的东西
一句话主线:文本是一根 17 bit 的吸管;两个模型的内部表示能对接,因为坐标系必然不同(数学)而几何大致相同(实证),二者之间的映射近似是一个正交变换;而这门生意划算,因为读比写便宜 26 倍。
一张判断表(面对任何一个「模型直连」的新方案,按这五问过一遍):
| 问什么 | 为什么这么问 |
|---|---|
| 桥接在哪一层? | 输入层最可移植、KV 最富信息、中间层最耦合。决定了跨家族难度 |
| 桥要不要训练? | 闭式正交解意味着几何本来就对齐;要训大桥意味着差距不止一个旋转 |
| 谁负责 decode? | 决定省钱幅度。大模型只 prefill 才有数量级收益 |
| 双方要不要读同一个输入? | 要,就更接近上下文增强;不要,才是真的信息迁移 |
| 实体和数字怎么保? | 纯连续通道会把罕见 token 压丢(F1 ~30%)。没有离散锚点的方案要警惕 |
诚实的提醒。 本文亲手测的只有三样:llama-bench 的 prefill/decode 吞吐、从 GGUF 元数据推出的字节账、以及 Procrustes 合成实验。所有论文的准确率数字我都没有复现——C2C 的 6.4–14.2%、StateBridge 的 22/26、XBridge 的 F1 30%、XKV 的 10.3×、Bicameral 的 36%→96%、CALM 的 13%,全部是论文口径(arXiv 摘要当场核实过编号、版本、日期、会议)。Mostik 的全部数字是二手报道,其官网我未能直接访问。第三节的合成实验只演示机制,不构成「真实模型之间只差一个旋转」的证据。
三个成本最低的亲手验证实验,从便宜到贵:
-
读写不对称(1 分钟,一条命令)。有 llama.cpp 和任意 GGUF 就能跑,把
<model>换成你的模型:llama-bench -m <model>.gguf -p 512,2048 -n 128 -r 3看
pp与tg两行的比值。这个比例是桥能省多少钱的上界,而且在你自己的硬件上和我的不一样——带宽越好的卡,比值通常越小。 -
旋转恢复与锚点阈值(30 秒)。改
d看阈值怎么跟着动:import numpy as np rng = np.random.default_rng(0) d, n = 64, 2000 A = rng.standard_normal((n, d)) Q_true, _ = np.linalg.qr(rng.standard_normal((d, d))) B = A @ Q_true + 0.05 * rng.standard_normal((n, d)) # 差一个旋转 + 噪声 for k in [32, 48, 64, 128]: # 只用 k 对锚点拟合 U, _, Vt = np.linalg.svd(A[:k].T @ B[:k]) # 正交 Procrustes 闭式解 Q_hat = U @ Vt held = slice(1500, 2000) # 未参与拟合的留出点 p, t = A[held] @ Q_hat, A[held] @ Q_true cos = np.mean((p * t).sum(1) / (np.linalg.norm(p, axis=1) * np.linalg.norm(t, axis=1))) print(f"anchors={k:<4} held-out cosine={cos:.4f}")我这次跑出来是
32 → 0.4956、48 → 0.7378、64 → 0.9934、128 → 0.9996。和第三节表格的「噪声 0.05」列同形但小数位略有差异——那张表每行重新抽一次噪声,随机数消耗顺序不同。要看的是阈值位置,不是具体小数。 -
真跑一次 KV 桥(半天,要 GPU)。
thu-nics/C2C有开源代码,跑它最小的模型对。这是唯一能把「论文口径」变成「亲手测出」的路径,也是我下一步想做的。
如果只带一条下山:判断任何一个「跳过文本」的方案,先问它在哪一层接、谁负责 decode。这两个答案决定了它的可移植性和省钱幅度,剩下的都是细节。
参考来源
论文(arXiv 编号、版本、日期、会议均通过 arXiv API 当场核实)
表示对齐的理论与实证基础
- Moschella et al., Relative representations enable zero-shot latent space communication, arXiv 2209.15430(v2,2022-09-30,ICLR 2023 notable top 5%)——不同潜在空间中编码的夹角不变;锚点相对表示
- Huh, Cheung, Wang, Isola, The Platonic Representation Hypothesis, arXiv 2405.07987(v5,2024-05-13)——模型表示随规模收敛
桥接在输入层
- Peng, Zhang, Wang, Aletras, StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems, arXiv 2608.13317(2026-08-13,COLM 2026)——闭式正交变换,免训练,22/26 组最优
桥接在 KV cache
- Fu, Min, Zhang, Yan, Dai, Ouyang, Wang, Cache-to-Cache: Direct Semantic Communication Between Large Language Models, arXiv 2510.03215(v2,ICLR’26,清华 NICS)|代码:thu-nics/C2C
- Shi, Chiesa, Maguire, Kostic, KVComm: Enabling Efficient LLM Communication through Selective KV Sharing, arXiv 2510.03346(v3,ICLR 2026)——hidden state 的信息集中偏置;只传 30% 层
- Liu, Zhang, Jia, Kan, Wang, Dual-Cache Latent Space Communication between Heterogeneous Language Models(XKV), arXiv 2608.20617(2026-08-20)——去掉共享上下文与几何匹配要求
桥接在中间层
- Bansal et al., LLM Augmented LLMs: Expanding Capabilities through Composition(CALM), arXiv 2401.02412(2024-01-04,Google)——交叉注意力组合冻结模型
- Flamant, Ghai, Shimizu, The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models, arXiv 2605.11167(2026-05-11)——双向锁步;辅助模型未见题目文本即生成代码
连续通道的失效模式
- Yang, Huang, Zhang, Wang, Yu, Lee, XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication, arXiv 2608.11676(2026-08-12)——实体接地问题;罕见 token 压缩坍塌
工程实践与二手报道
- 本机实测:
llama-bench(llama.cpp build 8ed274ef4 / 9630)+ Qwen2.5-7B-Instruct Q4_K_M,Metal 后端;模型配置读自 GGUF 元数据 - Mostik 相关(均为二手报道,未经同行评议,其官网我未能直接访问):mostik.ai 技术说明|ForkLog 报道|explainx.ai 的数字质疑|量子位报道
- Stanislav Smirnov(2010 菲尔兹奖)