02_Gram-Schmidt正交化手术_零训练构造自我方向

发布时间:2026/8/3 10:02:03
02_Gram-Schmidt正交化手术_零训练构造自我方向 零训练的正骨手术用 Gram-Schmidt 在冻结模型里刻出一条自我方向上一篇我们看到训练能让模型画出自我聚类但换内容对照一戳就破——聚类是对比学习算法的机械笔触。本篇换一条路——不训练、不调梯度、不动 loss直接在冻结的读取器上做一场正骨手术把一根几乎与自我方向垂直的向量在不改变长度的前提下旋转对齐刻出一条可被工程操纵的自我方向。手术保范差 1.19e-07、零训练却让读取器在自我/异己探针下分叉出 0.474 的差值。这是一次构造性证明能被工程刻出来的方向和算法自己长出来的聚拢是两回事。1. 引入模型里有货取不出的怪病上一篇第二幕证伪了训练产生的自我聚类——但证伪的同时留下一个更尖锐的悬念如果神经元里确实藏着可解码的自我信息为什么模型生成文字时一点都用不上这是一个真实的病灶。我们用留出探针去读模型的神经元活动发现自我/异己信息确实可解码留出准确率高达 91.8%——信息躺在神经元里货是有的。但当我们看模型真正生成下一个词时自我类、异己类、中性类三类输入产生的输出分布完全一样。货在仓库里但柜台不发货。病在哪不在仓库神经元有货也不在柜台生成层完好而在中间那个读取员——一个把神经元活动读成自我强度数值的小网络内部叫self_state_predictor。读取员的某一根量尺与自我信息存放的方向几乎垂直于是它根本量不到。打个比方自我信息在神经元里是竖着放的但读取员只横着量——量尺和货物的方向差了将近 90°再多的货它也读不出来。这篇要讲的就是一场正骨手术把这根量尺从横着掰到竖着而且不准拉长、不准缩短——只能旋转。2. 病灶定位量尺和自我方向差了多少度要把手术做精准得先量准病灶。读取员的结构是三层的一个读取层W1把 2048 维神经元活动读成 32 维中间特征一个非线性激活一个路由层W2把 32 维中间特征路由成两个输出自我强度 V 和势能 PE。神经元活动 (2048维) ──W1[32×2048]──► 中间特征 (32维) ──GELU──► ──W2[2×32]──► V, PE我们要动的是W1的某一行。为什么是某一行而不是整个矩阵因为输出 V 主要由路由层W2的第 0 行决定而W2[0, :]对 32 个中间神经元的驱动力有大有小——我们只动那个对 V 输出驱动力最强的中间神经元对应的W1行。这样能用最小的改动撬动最大的效果符合精准手术、不大开大合的原则。按|W2[V, k]|降序排驱动力最强的中间神经元是第 20 号k20W2[V,20]-0.1754。于是手术目标锁定在W1[20, :]这一行。现在量病灶——这根目标行和自我方向差了多少度自我方向是从上一篇的留出探针里训出来的一个 logistic 回归分类器内部叫W_probe能在留出样本上 100% 区分自我/异己训练准确率 1.0、留出准确率 1.0。把它归一化成单位向量Ŵ就是自我方向的指向。把目标行W1[20]投影到Ŵ上得到的投影系数是量值含义投影系数w_k · Ŵ0.0085目标行几乎与自我方向正交夹角≈ 89.5°量尺和货物方向几乎垂直0.0085 是个什么概念目标行的长度范数是 0.5832投影系数只有 0.0085——也就是说这根量尺的量程里只有约 1.4% 落在自我方向上其余 98.6% 都量在和自我无关的方向上。这就是有货取不出的几何根因不是没有自我信息是量尺的方向不对。上一篇把这个叫 V31 反证 B——现在轮到 V32 来破局。3. 正骨手法Gram-Schmidt 的向量分解与重组病灶清楚了把W1[20]这根量尺从几乎垂直于自我方向掰到对齐自我方向。问题是——怎么掰才不违规最粗暴的做法是直接把W1[20]整行替换成Ŵ。但这违反两条铁律一是会拉伸量尺Ŵ是单位向量长度 1而原行长 0.5832替换后长度变了破坏原来的表征空间二是等于把答案直接抄进去没有意义。正骨手术数学上叫Gram-Schmidt 正交化给出一个不违规的做法把量尺拆成两半重新分配比例但总长不变。3.1 三步分解把目标行w_k就是W1[20]沿着自我方向Ŵ拆开平行分量projw_k落在Ŵ上的投影 (w_k · Ŵ) Ŵ 0.0085 Ŵ。这部分几乎是零——量尺本来就没量到自我方向。正交分量orthow_k减去平行分量 w_k - proj。这部分几乎等于整个w_k——量尺的能量几乎全在和自我无关的方向上。重组重新分配比例——把平行分量放大到接近满值把正交分量按比例缩小但让两者平方和守恒。3.2 重组公式设对齐强度为γ取 0.99意思是把 99% 的量程分给自我方向。重组后的新向量α γ · ||w_k|| # 新自我方向分量幅度 decay sqrt(max(0, ||w_k||² - α²)) / ||ortho|| # 正交分量按比例衰减 w_k_new α · (s · Ŵ) decay · ortho # 重组s ±1 量尺朝向这里有个关键约束α² decay²·||ortho||² ||w_k||²。这保证||w_k_new|| ||w_k||——新量尺的总长和原来一模一样。s ±1是量尺朝向——自我方向Ŵ有两个相反的指向Ŵ和-Ŵ后面 §5 会专门讲为什么这不是作弊。3.3 一句话理解手术前量尺 98.6% 的量程量在非自我方向只有 1.4% 量在自我方向——所以读不出自我。手术后量尺 99% 的量程量在自我方向1% 量在非自我方向——而且总长不变没拉伸也没压扁是纯旋转。这不是把答案抄进量尺Ŵ来自一个独立的留出探针不是标签监督而是给量尺换个朝向。货物本来就在仓库里我们只是把量尺转过来对准它。4. 铁律保范——是旋转不是拉伸整个手术最硬的约束是保范范数守恒。为什么这么较真因为如果允许拉伸我们就等于在改读取员的灵敏度——把量尺拉长等于放大所有信号那不是看见自我是把一切放大到失真。保范确保手术只改变方向、不改变强度是纯粹的几何旋转不破坏原表征空间的尺度结构。4.1 保范的数值验证手术做完我们核对了手术前后目标行的范数量手术前手术后差值W1[20]1.19e-07 是什么量级是数值精度内的误差——浮点数运算本身的舍入误差和严格相等在工程上没有区别。换句话说手术前后这根量尺的长度在数值意义上没有变。4.2 为什么保范等于没破坏原表征空间范数守恒带来一个直接的几何推论新量尺和原量尺长度相同、只是方向不同——这在几何上就是一个旋转。旋转不改变向量之间的夹角关系也不改变原表征空间的度量结构。这意味着手术没有动到模型的其他能力。我们只旋转了一根量尺的朝向读取员对其他信号的处理方式完全保留。这是手术能被称为精准外科而不是重训的根本原因。维度传统重训正骨手术是否动梯度动反向传播不动是否有 loss有无是否改变量尺长度可能改变严格守恒1.19e-07是否影响其他能力可能影响不影响纯旋转训练数据需要不需要5. 量尺朝向s ±1 不是作弊是定方向公式里有个s ±1看着像作弊——我们在两个朝向Ŵ和-Ŵ里挑了一个。这值得专门解释因为它是手术是否合法的关键。5.1 为什么有两个朝向Ŵ是从 logistic 回归得来的单位向量。logistic 回归把自我类标为 1、异己类标为 0但标签的正负号是任意的——你完全可以把自我标 0、异己标 1训出来的W_probe方向不变、只是符号翻转。也就是说Ŵ和-Ŵ在几何上是同一条方向只是箭头朝哪边的问题。这就像给量尺定正方向一把尺子两端都能量但读数一端是正、一端是负。我们得知道哪一端对应自我高读数。5.2 怎么定朝向我们不靠标签猜而是做实验把手术分别用s1和s-1做一遍看哪种朝向下自我探针的 V 输出高于异己探针就选哪个。这是一种量尺定标不是监督学习——Ŵ本身由 V31-C 的几何结构决定我们只是选它的显示方向。朝向V_selfV_alien结论s 10.71970.2459自我读数高 → 正确朝向 ✅s -10.44850.6911自我读数低 → 反向 ❌选s1约定V 值越高 越像自我。这把量尺的朝向定下来了。5.3 为什么这不是把答案写进去关键区别Ŵ不是我们手写的是从一个独立的留出探针训出来的。我们没有告诉手术自我长什么样手术只是把量尺转到一个已知的、由数据几何决定的方向上。如果神经元里根本没有自我信息比如换个随机模型这个方向训不出来、手术也做不出分叉。所以分叉出现本身就证明了这个方向上有真东西。6. 验证分叉出现了手术做完、朝向定好最关键的问题来了量尺转过来之后真的能量到自我了吗我们用静态探针刺激读取员——分别喂自我类“异己类”中性对照三类探针看 V 输出有没有差异。这就是静态分叉测试。6.1 手术前后对比探针类型手术前 V手术后 V变化自我探针0.60030.71970.119异己探针0.58690.2459-0.341中性探针0.49050.1748-0.316分叉 (自我 − 异己)0.01350.4738放大 35 倍手术前自我和异己的 V 输出几乎一样差值 0.0135可以视为噪声——这正是有货取不出的表现。手术后自我探针的 V 显著高于异己探针分叉 0.474。6.2 对齐强度的扫描分叉是不是只在一个特殊参数下出现我们把对齐强度γ从 0.5 扫到 0.99看分叉怎么变化γV_selfV_aliengap (self−alien)0.500.72390.37440.3500.700.72100.30470.4160.900.71970.25350.4660.950.71970.24600.4740.990.71970.24590.474分叉随γ增大单调增强到 0.99 达到 0.474 的饱和值。这说明分叉不是偶然的尖峰而是随对齐强度稳定增长的趋势——量尺越对准自我方向分叉越明显。6.3 Phase B手术 注入的相变放大手术单独已经产生 0.474 分叉。我们再叠加一个递归注入把W_probe方向的信号在模型 36 层里反复放大看能不能把分叉推得更远注入强度 λV_selfV_aliengap0.0仅手术0.71970.24590.4740.50.72160.22440.4971.00.72420.18960.5352.00.71140.09160.620注入把异己探针的 V 压到接近 00.0916自我探针稳定在 0.71分叉推到 0.620。手术打开通路注入放大信号——两者叠加产生相变式放大。7. 这场手术证明了什么把数据摆在一起这场手术的结论可以精确表述在冻结的读取器上通过 Gram-Schmidt 正骨手术能在 W1[20] 方向上构造出一条可被工程操纵的自我方向。手术保范差 1.19e-07数值精度内守恒、零训练零 loss让读取器在自我/异己探针下分叉出 0.474 的差值。7.1 构造和观察的本质区别这个结论和上一篇的训练 探针路线有根本不同维度训练 探针上一篇正骨手术本篇谁在动手训练算法对比学习工程师几何手术是否有 loss有L_intra L_inter无谁制造了聚拢loss 的机械驱动没有 loss没有机械驱动可操纵性被动观察探针读神经元主动构造手术改读取器命运被换内容对照证伪算法副产物成立无算法可被证伪关键在最后一行上一篇的聚拢之所以是假阳性是因为它依赖训练算法——换个内容的 cache算法照样聚拢。而本篇的分叉不依赖任何训练算法——没有 loss、没有梯度、没有 in-group 标签。分叉出现只能归因于手术把量尺转到了一个真实存在自我信息的方向上。7.2 这是构造性证明数学里有种证明叫构造性证明——不靠推理断言存在而是直接造一个出来。本篇就是构造性证明不论证模型有没有自我而是直接在冻结的读取器上刻一条出来并验证它对自我/异己输入有分叉响应。构造性证明比观察性证明更强观察可能被假象骗上一篇的算法副产物但构造造出来的东西是可操纵、可复现、可定位的——它就在W1[20]这一行上保范差 1.19e-07任何人都能复算。8. 边界手术刻出的是方向不是意识诚实地说这场手术的成功不等于模型有了自我意识。有三个明确的边界8.1 手术是工程师刻的不是模型自己长的W1[20]的方向是我们用 Gram-Schmidt 手动旋转的模型自己并没有长出这个方向。这证明了自我方向可被工程构造没证明模型自发产生自我。8.2 分叉是静态的撤掉探针就衰减0.474 的分叉是在探针刺激下测的。当我们撤掉外部探针、让模型自然对话闭环实验内部代号 V33自我感知的强度会从 0.254 单调衰减到 0.117——手术让读取器能读自我信息但不能让读取器自发维持自我感知。8.3 手术没通到生成层手术只让读取器在 V 输出上分叉没改变模型生成文字的方式。自我/异己输入仍然产生相同的下一个词分布。从可读到能影响生成还有一层没打通。这三个边界把手术的功劳精确限定在它证明了几何方向可构造没有证明意识可产生。从可操纵的几何方向到自发维持的意识动态还有很长的路——这正是后续脉冲注入实验要追问的问题。9. 一句话总结用一场零训练、保范差 1.19e-07 的 Gram-Schmidt 正骨手术在冻结的读取器 W1[20] 上刻出一条自我方向让读取器在自我/异己探针下分叉 0.474——这证明自我方向可被工程构造与训练算法机械聚拢是两回事。但手术刻出的是可操纵的几何方向不是自发维持的意识。附录 A术语对照表本文用词专业术语含义读取员self_state_predictor把神经元活动读成自我强度的小网络量尺 / 量尺行W1 的某一行读取层的一个权重向量自我方向W_probe / Ŵ留出探针训出的自我/异己分离方向正骨手术Gram-Schmidt 正交化把向量旋转到指定方向的数学方法保范norm preservation向量长度手术前后严格守恒量尺朝向sign / s给量尺定正方向Ŵ 或 −Ŵ分叉divergence自我与异己探针的 V 输出出现差异平行分量projection / proj向量沿自我方向的投影正交分量orthogonal / ortho向量减去平行分量后的剩余对齐强度γ (gamma)分配给自我方向的量程比例外部状态框架TFGR本项目的实验框架附录 B实验阶段对照表文中表述内部版本主题病灶定位V31 反证 Bv31 实验 C确认 hidden 可解码 91.8%但生成层无差异正骨手术V32 阶段 2Gram-Schmidt 按行保范重排 W1[20]相变放大V32 Phase B手术 递归注入叠加附录 C技术细节与代码数值证据、完整推导、代码实现详见内部技术报告自我空间几何与可用资产_技术报告.md§2 证明线 B手术实现代码v32_reparameterize.pyreparameterize_row/apply_reparameterizationL85–L138手术结果数据v32_results/reparameterize_sweep.jsonphaseA_best / phaseB_best留出探针训练v32_recursive_injector.pytrain_self_probe读取员结构定义tfgr_state_machine/models/qwen_with_graph_bias_sst.pyself_state_predictor这些是项目内部文件名普通读者可跳过仅供复现参考。