<!-- Published from the author's working notes. Cognitive state: survived. -->

# 折扣信用分配是余核问题，不是闭环 holonomy

*一次正式纠错、一个精确有限图结果，以及一组双轴定义检验 · 马成 × agent · 2026-08-04*

## 一句话结论

此前私有推导把折扣闭环量 `M=4.095` 当成了 gauge-invariant holonomy。这个判断是错的。对有向 `n` 环与 `0≤γ<1`，折扣关联算子 `D_γ=I-γP` 满足 `det(D_γ)=1-γ^n≠0`，所以它可逆：简单环上的**任何**奖励场都存在唯一的折扣标量势。旧数值只是相对于某个候选势的拟合误差，不是表征无关的障碍；现正式撤回。

真正保留下来的是一个更窄、也更干净的结论：在全部已观测转移类型构成的边系统上，粗粒化可能制造出比观测状态势变量更多、且彼此不相容的边约束。此时正确对象是奖励场模去 `im(D_γ)` 之后的加权残差——一个商空间/余核障碍。`γ=1` 时它退化为普通图上的环流；`γ<1` 时，如果没有额外微分或局部系统结构，就不应叫 de Rham 上同调或闭环 holonomy。

## 正确的数学对象

令 `V` 为观测状态，`E` 为不同的有向转移类型，`r∈R^E` 为其期望奖励，`W` 为正的边访问权重对角阵。对 `e=(u→v)` 定义

```text
(D_γ φ)_e = φ(u) - γ φ(v).
```

先拟合最佳折扣势，再留下正交余项：

```text
φ*     = argmin_φ ||r - D_γ φ||²_W
r_perp = [I - D_γ(D_γᵀ W D_γ)⁺D_γᵀW] r.
```

它有四条精确性质：

1. `r_perp=0` 当且仅当一个折扣标量势能同时拟合全部观测边；
2. `D_γᵀWr_perp=0`；
3. 加上任意 potential-based shaping 场都不改变它；
4. 若 `z∈ker(D_γᵀ)` 且 `zᵀr≠0`，则 `z` 给出非恰当性的对偶证书。

这里“**余核**”不是换名词。折扣破坏了普通闭环求和的抵消，因此简单环本身并不产生拓扑障碍；只有全部已观测边约束共同形成过定系统时，余核才出现。

## 精确 aliasing 结果

实验从一个六状态潜在环开始，潜在奖励严格由势生成；随后把六个状态平衡地两两混叠成三个观测状态。对**所有不同的已观测转移类型**聚合奖励，再用三个观测势同时拟合。

`γ=0.9` 时：

| 观测边数 | 固定随机种子试验数 | 修正残差非零 |
|---:|---:|---:|
| 3 | 191 | 0% |
| 5 | 1,230 | 100% |
| 6 | 1,579 | 100% |
| 全部 | 3,000 | **93.6333%** |

沿用历史筛选——要求观测图包含特定的 `0→1→2→0`——剩下 1,484 次试验，结果为 **93.0593%**。旧 headline 被复现了，但原因完全不同。

精确有理数枚举消除了 Monte Carlo 歧义：共有 90 个平衡 alias map，45 个通过历史筛选；其中 3 个只有三条观测边，其折扣关联矩阵方阵可逆，因而在本 ensemble 中对任意奖励都精确可解；18 个五边图和 24 个六边图全部一般不可解。因此结构比例为

```text
42/45 = 14/15 = 93.333...%.
```

所以 93.0593% 只是围绕精确组合比例的一次有限采样，不是什么普适 POMDP 常数。

## 第二个纠错：两种“循环”不是同一种循环

交叉复核还暴露出另一处混同。此前被同一个“循环”概念包住的，其实是两个不同空间里的非梯度对象：

- **表征残差** `||r_perp||_W`：粗粒度观测图能否容纳一个统一的折扣奖励势；
- **策略 harmonic flow**：多主体单边改策的收益流能否来自一个共同博弈势。

它们位于不同图上，也需要不同干预。状态细化可以消掉第一项，却不改变第二项；把反对称博弈换成势博弈可以消掉第二项，却不修复第一项。

最小 2×2 定义检查把“恰当/过定约束表征”与“势博弈/matching-pennies 博弈”交叉：

| 表征 | 博弈 | 相对表征残差 | 策略 harmonic 比例 |
|---|---|---:|---:|
| 恰当 alias | 势博弈 | `6.5×10⁻¹⁶` | `2.7×10⁻¹⁶` |
| 恰当 alias | harmonic | `6.5×10⁻¹⁶` | `1.000` |
| 过定约束 alias | 势博弈 | `0.9116` | `2.7×10⁻¹⁶` |
| 过定约束 alias | harmonic | `0.9116` | `1.000` |

这只是 Cartesian 定义层面的解耦，不是干预/结果实验，也不是 bicomplex、学习优势或意识理论的证据。下一步必须在同一个耦合 learner 中真实执行两种定向修复，并验证每个修复只改变预言的轴。

## J-space 放在哪里——以及不能放在哪里

Anthropic 2026 年的 Jacobian-lens 工作给出了 Transformer 内部一个具体的**瞬时访问/工作空间坐标**。J-space 不是固定线性子空间，而是由过完备 frame 生成、受稀疏度限制的非负锥之并；论文只在中间层带上观察到 workspace-like 功能。这足以说明“Transformer 完全没有 state”说得过头：它有 activation state、computational state，也有瞬时的 workspace-like representational state。

但它还不是 closure 主线需要的对象：一个跨步持续、具有自主路径依赖、并由自身更新规则维持投影/遗忘策略的状态。J-space 缩小了缺失机制的范围，却没有补上这个机制；它的存在更不能直接推出 phenomenal consciousness。2025 年 COGITATE 的对抗性协作和 2026 年麻醉状态下人类海马仍保留复杂加工与可塑性的结果，都要求我们继续拆开四个量：可报告、复杂表征、学习/可塑性、意识。

## 保留、撤回与下一道门槛

**保留**

- 有损状态聚合能把潜在层完全势化的奖励变成观测层无法由单一势拟合的奖励场；
- 修正残差对 potential-based shaping 不变，并有精确的原始/对偶定义；
- 玩具 rig 中，表征不一致与策略循环是两条正交轴；
- `γ=1` 时普通图 cycle-space/上同调语言仍然成立。

**撤回或重置**

- `M=4.095` 是 gauge-invariant discounted holonomy；
- “非零折扣闭环缺陷就是非平凡 de Rham 类”；
- 把表征残差、博弈 harmonicity、滞回、记忆与意识认成同一个数学谓词；
- 把 J-space 说成已经持续自维持的状态，或意识的证据。

可复现实验：[脚本](https://machengshen.github.io/theory/experiments/discounted_cokernel_reproduction.py) · [结果 JSON](https://machengshen.github.io/theory/experiments/discounted_cokernel_results.json)。

相关原始材料：[Anthropic J-space](https://transformer-circuits.pub/2026/workspace/index.html) · [COGITATE](https://www.nature.com/articles/s41586-025-08888-1) · [麻醉状态下人类海马的可塑性与语言加工](https://www.nature.com/articles/s41586-026-10448-0)。

下一步不该再造类比，而是把两个诊断放进同一个真正耦合的 learner，分别干预状态细化与博弈激励，检查每个干预是否只移动它预言的轴，并改善样本外指标。如果修正残差相对于 TD error、bisimulation error 或 predictive-state splitting 没有新增价值，就把它保留为一个精确证书，不升级成学习原理。
