<!-- Published from the author's working notes. Cognitive state: speculative. -->

# 学习"我到哪里为止" —— 一条理论线在一天之内自己打倒了四根支柱里的三根

*一条工作线的整理 · 2026-07-27 → 2026-07-28 · **未 ratify,不是结论***

---

## 第一部分 —— 写给不在这个领域的人

这半篇没有公式、没有希腊字母、没有论文编号。每个专业词第一次出现时就地解释。第二半有全部数字、命令、引用和证伪条件,是写给机器和专业读者的。**只读第一部分,你也应该能把我们发现了什么讲给别人听。**

### 一段话版本

我们以为找到了当下机器人做法的病根:**从来没有人让机器人自己搞清楚"我到哪里为止、世界从哪里开始"**。我们提出机器应该**学出**这条边界而不是被人递给它,并且说一条**真的**边界有个签名——它**会卡住**,一旦定下来就不容易挪动。用一整天,我们用自己的仿真器和自己对别人公开数据的重分析,从四个方向打自己的提案。**四条支撑主张倒了三条,而且每一条都是被我们自己的仪器打倒的。** 活下来的东西很薄但是真的:那个"卡住"的行为**确实能自己长出来**,不是我们偷偷手装进去的。取代原主张的是一个更锐利也更难的问题,写在最后。

### 1 · 我们原本相信什么

现在主流的机器人学习有两大类。

- 一类靠**照抄**:给机器几千条人类示范,让它模仿"看到什么 → 做什么"。
- 一类靠**打分**:定义一个数字表示做得好不好,让它去搜能把这个数字推高的行为。

两类都被白送了一个答案,而这个问题没人当面问过它们:**世界里哪些部分是"我"?** 工程师在决定"哪些算关节、有哪几个马达、机器的'动作'是什么"的时候,就已经用手把这条线画好了。机器从来不需要回答"我是什么"。

我们的主张是:这条手画的线不是细节,它**就是**瓶颈。一个能自己解出边界的机器人会做到今天做得很差的两件事:

- 拿起一件没见过的工具,把它当成手臂的延长,而不是当成一个背下来的物体;
- 干活途中坏掉一个马达,能**重画那条线**——"那截肢体不再是我的了"——而不是回炉重训。

### 2 · 为什么我们觉得这不只是个口号

因为在人身上,这条边界看起来有一个非常特别的力学性格:它**会卡住**。

> **"卡住"的学名叫"滞回"。** 想空调设 26 度。它不是 26.1 就开、25.9 就停。它要等房间热到 27 才开始制冷,冷到 25 才停。**开的门槛和关的门槛不是同一个数**,中间那个差就是滞回——正是它让空调不会每隔几秒就啪嗒啪嗒开关一次。有滞回的系统**记得自己是从哪一边过来的**。

人版的体验谁都有。握根棍子握久了,你开始**用棍尖摸到桌面**,而不是感觉手心里有根棍子。压麻一条胳膊,有几秒钟它不是你的,是床上一个外来物件。实验室里还有个经典错觉:一只橡胶手,和你藏起来的真手被同步抚摸,过一会儿你会觉得那只橡胶手是你的——看上去边界是**整块地啪一下切过去**的。

如果边界真的会卡住,那么一整类机器设计当场出局。任何规则是"每一刻都根据眼前所见算出当下最优边界"的机制**都不可能卡住**,因为"重算最优解"这个动作**不记得**你上一刻站在哪一边。那就意味着正确的实现根本不是一个优化器,而更像一个有惯性的物理系统。这就是那条结构性论证——这种论证说起来便宜,兑现起来很贵。

### 3 · 我们怎么去打它

我们**事先**写下四种它可能死掉的方式,然后花一天时间自己去触发它们。同时跑两条战线:

- **文献战线。** 问的不是"这个想法有没有人提过"——那个问题几乎没用。真正要问的是:**当某人说他证明了这件事,他的实验到底支撑到哪一步、从哪一步开始是修辞?** 我们有一条规矩:"别人做过了"只是线索,永远不是裁决;绝大多数论文是**以发表为目的**写的,不是以真为目的写的,所以诚实的动作是去打他们的证据,而不是客气地给自己让位。
- **仿真战线。** 一条简单的仿真手臂,配可拆卸的工具、可切断的马达,和一个手臂控制不了的、被风吹动的球——好让"不是我"这件事有个指称对象。

### 4 · 它是怎么塌的 —— 按发生顺序

**(a) 那个"显然成立"的事实,既不显然也没被确立。**
我们整套动机压在一句话上:"这在人身上经验上是确凿的"。**不是。** 决定性实验从来没人做过——把一个旋钮从小扫到大、再从大扫回小,看边界翻转的位置在上行和下行是不是不一样。更糟的是,工具那一支有一篇专门的再分析,结论是那个效应**可能根本不存在**于大家默认的强度,效应量小、统计功效低。而我们唯一找得到的支持性数字——错觉大约二十秒建立、一分钟消退——恰恰是我们自己早就声明**不算数**的那一种:一个完全没有卡住性质的普通系统,在"有输入 → 撤掉输入"的切换下天然就给你这个。

**(b) 去找决定性数据,找到的是相反的符号。**
两份独立的公开数据,不同国家、不同操纵、加起来几百人,都能回答一个较弱但相关的问题:**你刚刚经历过的东西,把你下一次判断往它那边拉(卡住),还是往反方向推(对比)?** 两份都说**往反方向**。这不是干净的证伪——两份都是一段结束后填问卷而不是逐次作答,其中一份量的还是人们**预期**会体验到什么而不是实际体验——但两件独立的事同时指向不利方向,比一件更难辩解。

**(c) 然后是好消息:在我们自己的仿真里,那个"卡住"没被安装就出现了。**
这一条重要,因为拿到卡住行为最便宜的办法就是把它写进方程——相当于把答案抄在卷子底下。我们把手装的那部分**整个删掉**,只留下真正要主张的机制:**一条通道越是被当成"我"的一部分,它就被预测得越准;越准就越被信任;越被信任就越被当成"我"的一部分。** 一个自我强化的回路。只有这个回路、别的什么都没有,边界卡住了;而且把实验放慢一万倍之后它**仍然**卡住——这一步正是区分"真卡住"和"只是东西沉降需要时间"的假卡住的检验。**这是唯一还站着的支柱。**

**(d) 然后是我们自己要求做的那个对照,当场朝我们开火。**
我们事先写下:**把完全一样的处理施加到明显不属于机器人的东西上**——那个被风吹的球——检查它不会卡住。一半成功了:用球自己实测的数字,不出现卡住。但另一半是致命的。方程里有一个**自由旋钮**,没有任何数据把它钉死。把这个旋钮在球上拧大,球的边界**卡得和手臂一模一样——我们打印出来的每一位数字都相同**。这有原因,而且是可以证明的、不是巧合:做完归一化之后,方程只在乎**一个组合量**;"自我"那部分只决定**旋钮要拧多大**,不决定这个效应会不会出现。

> 直说:**"卡住"不是自我的签名。它是任何一个带门控的慢变量的通用性质。** 在这个量上,我们的手臂和一个被风吹的球**无法区分**;唯一的差别是一个 7 倍的量级差,而它可以被一个自由参数吸收掉。

**(e) 唯一那条锐利的具体预测,反了。而且反了两次。**
那条预测很直觉,也正是我们偏爱自己这套机制而不是一个手搓开关的理由:**进来难,出去更难**——工具应该是慢慢才变成你的一部分,而**更慢**才不再是你的一部分。第一种实现里根本没有不对称(并入和释放的时间到小数点后三位都相同),而我们一度以为看到的不对称,是把三个量压成一个量时的约化假象。于是我们换成**本该产生不对称的那种实现**——不对称出现了,但**方向反了**:**释放比并入更快**,而且**离开所需的挑动比加入更少**。

原因是可算的,回头看也显然。我们的机制放大的是关于一条通道的**证据**。而证据是**不站队**的。放大"这是我的手"的证据,同样地放大"这不是我的手"的证据。要拿到"进来容易出去难",你必须**额外**假设:信任只放大支持自己的证据——而那又是一件手装的东西,恰恰是我们要避开的。

**(f) 最后:连活下来的那点卡住,也要求一个旋钮被调到 2% 精度以内。**
要让回路有两个稳定档位而不是一个,里面的一个成本和一个收益必须**抵消到大约 2% 的相对精度**。而我们自己的目标函数——那个本该让这一切自然涌现的东西——把**每一条通道**都放在这个窗口**外面**,近的差 2 个窗口宽,远的差四百个。所以"能涌现"和"会涌现"之间,还隔着一整条没人做过的论证。

### 5 · 三个错误是我们的,不是世界的

值得写下来,因为每一个都是**可复发的错误物种**,不是运气不好。

1. **量错了对象,然后把这个误诊当成前提发给了下一棒。** 早期一轮跑出个弱结果。我们诊断成"我们的仿真手臂和世界耦合太弱",并把这个诊断当既成事实交给下一阶段。**是错的。** 弱读数来自测量协议的缺陷;而且我们用来指控手臂的那根探针,走的路径**根本不经过**我们指控的那个部件——它在结构上就不可能探测到我们归咎给它的问题。**我们把"探针的信噪比"读成了"系统的耦合强度"。** 通用教训:任何时候你说"指标 X 告诉我性质 Y",**先证明 X 对 Y 敏感**;证明不了,就造一根不共享 X 假设的第二探针。(手臂**确实**有一个真实的耦合缺陷——它是被另一根探针找到的,第一个指标对它全盲。)
2. **连着三次相信"数据可用性声明"。** 三篇已发表研究都写着"逐试次数据公开"。我们全下载、把每个文件都打开。三份都是**被试 × 条件的汇总表**,没有试次序号、没有顺序列,于是我们要问的问题**在结构上不可计算**。同样形状的坑还踩了两次:某份数据的参数列看上去正是我们要的上下行扫描,而响应列**每一行都是空的**。**别信任务名、别信摘要——打开列看。**
3. **让"经验上确凿"这句无引用的话当了前提。** 那一个没有出处的从句,是整条架构结论下面的承重构件。抽掉它,结论就悬在空中——它一开始就不该被放进来。

### 6 · 还剩什么,以及底下那个更好的问题

活下来的:**"卡住"能从一个自我强化的信任回路里自己长出来,不需要手装**,并且通过了放慢检验。这是一个真实的、虽然不大的正面结果。

取代原主张的东西更锐利,而且如果没有那些失败我们根本找不到它:

> **"卡住"很廉价。几乎任何带门控的慢变量都有。所以问题从来不是"边界会不会卡住"——而是:*什么东西能让一条边界的卡住,是**关于这条边界本身**的,而不是它碰巧和一个随风飘的球共享的通用性质?***

这是个更难的问题,也是个更好的问题,而且是我们下一步会做的那个。这条线诚实的状态是:**一个开着的问题,原有动机被拆掉了大半,靠一个正面仿真结果和一个被重述的问题维持存活。** 这里没有任何东西是定论。这里没有任何东西被 ratify。

---
---

## 第二部分 —— 技术记录

以下每一条要么实测过、要么有出处。没跑的一律标出。论断标注:**[实测]**(我们跑过)/ **[引用]**(别人已发表的数字,已对正文核验)/ **[推断]**(我们的综合)/ **[未做]**。

全文认知状态:**speculative**,分项状态见 §7。

### 0 · 记号

- **μ** —— agent/环境边界,作为一等的**被学习变量**:把所有传感-运动通道划分为 (self, blanket, world)。"blanket"(毯)是屏蔽面:world 只能经由它影响 self。
- **滞回** —— μ 在被扫参数下的双稳,上行与下行有不同转换点。本文采用的**操作判据**(见 §5)是**环面积外推至零扫速仍 > 0**(率无关),**不是**"在某个有限扫速下测到非零环面积"。
- **Δπ / s** —— 精度摆幅:一条通道在边界内 vs 边界外被预测得好多少,用相对摆幅 `s = 1 − ε_in/ε_out` 表示。
- **G** —— 精度→归属→精度反馈的环增益,`G = κ·Δπ·(g−c)/(4γτ_π)`。

### 1 · 原提案

统一诊断:视觉-语言-动作模型(VLA)与强化学习(RL)的缺陷是**同一个** —— μ 外生。

- VLA:动作空间由工程师手画(例如 27 维联合动作空间 + noop 补位 = 一个被冻进词表的手画 μ;整个 cross-embodiment codec 就是为这个手画 μ 打的补丁)。模型从不需要回答"我是什么"。
- RL:标量目标下的 argmax。**argmax 无记忆** ⟹ 结构上不可能有滞回 ⟹ 不可能维持边界。一阶 homeostat = 温控器。

提案:不学策略,**学 state / 学 μ**。

1. 训练信号 = **闭包违反**,不是 reward 也不是动作模仿。`z` 是 state 当且仅当动力学在 `z` 上闭合。最大化遗忘 s.t. 闭包。无奖励无示范。
2. μ 作为一等变量:所有通道划分为 (self, blanket, world);判据 = self 侧内部可预测可控、world 侧只经 blanket 可达、划分在扰动下稳定。
3. 目标是**二阶**:不是"在 μ 内最大化",而是"维持 μ 仍是解的条件"= self-seal。

可开工规格(损失函数 / 双稳解析条件 / MuJoCo rig / 含扫速控制的测量协议):`robotics-mu-experiment-spec-20260727`(工作文档,未在此发布)。

### 2 · Prior art —— 按审计而非综述做

方法说明:本线的规矩是**「别人做过了」是证据,不是裁决**。prior-art 的正确产出不是"谁占住了哪句",而是"他们的证据实际支撑到哪一步、哪一步是修辞"。然后**同一把刀转向我们自己**;这里双标就会退化成护主张。

- **Crutchfield 因果态 / computational mechanics (1989);PSR** —— 占住"state = 最小预测充分统计量",即闭包本身。**[引用]**
- **Klyubin & Polani, empowerment (2005)** —— 占住"从通道结构导出内在目标"。**[引用]**
- **Maturana & Varela, autopoiesis** —— 占住"自我造自己的边界"(无算法)。**[引用]**
- **Hoffmann / Lanillos, body-schema learning** —— 占住"机器人从感觉运动数据学自己的身体"。**[引用]**
- **Tononi & Koch, Φ-argmax 边界** —— 占住"边界 = 某量的最优",**且正是必须被区别开的对象**。**[引用]**
- **Friston FEP / Markov blanket / self-evidencing** —— **2026-07-28 审计降级**:它不是被证明的结果,是**前提未被验证满足的框架**。
  - Biehl, Pollock & Kanai 2021 (*Entropy* 23(3):293) 打掉"有 blanket ⟹ 内部状态在做变分推断"这一步:原话 *"not generally correct without additional (previously unstated) assumptions"*,带反例。**[引用]**
  - Friston et al. 2021 (*Entropy* 23(8):1076) 是补前提 + 把 exact 放松成 approximate = **修补非反驳**。**[引用]**
  - Aguilera et al. 2022 (*Physics of Life Reviews* 40:24–50):blanket + solenoidal 条件 *"only valid for a very narrow space of parameters"*,且要求 *"an absence of perception-action asymmetries that is highly unusual for living systems"*。**[引用]**
  - **这是双刃(见 §3 的 D0)**:我们 §1.2 用的是**同一个** blanket 三分结构 ⟹ 若在有感知-行动不对称的系统上 blanket 本就难以存在,那"学出稳定 blanket 划分"就不是学得好不好的问题,而是**解是否存在**的问题。
  - 另:"argmax/FEP 无记忆"——我们自己反复使用的那半句杀法——**已在 2022 年公开发表**:Aguilera et al. 写 FEP 主结论 *"is in general a poor description of the behaviour of a system as it ignores the history of interactions"*。我们的增量只剩后半句(接到边界维持上)。**[引用]**
- **Dynamic Markov Blanket Detection, arXiv:2502.21217 (2026-02)** —— 比以上任何一条都近。**已读正文核验,非摘要推断。[引用]**
  - 它的归属**确实有自身状态**:每个观测节点一条一阶离散 HMM(*"the labels associated with every observational node i has its own discrete HMM"*,§3)⟹ **我们不能再说"FEP 系的 blanket 无时间状态"**,那句是错的。
  - 但:实现版明写把标签转移与宏观状态**解耦**(*"transition probabilities for the assignment variables are a priori independent of the macroscopic latents"*),推断是**全轨迹前后向平滑**(acausal),且论文自陈 *"latent assignment variables quickly diffuse to a uniform stationary distribution in the absence of observed data"* —— 单稳、无 latch 的教科书定义。全文 hysteresis / bistability / bifurcation / saddle-node **零命中**,零并入-释放不对称实验。
  - **但**:其**一般形式**(式 21)让标签转移率依赖宏观 blanket 变量 —— 正是双稳所需的状态相关耦合闭环。他们为 tractability 明写假设掉了,并列入 future work。**我们的 wedge 正落在他们 roadmap 的下一格。** 不算被抢先,但时间窗不宽。
  - 未答的更早威胁:"训练信号 = 闭包违反"与他们的 surprise/ELBO 高度同构。**若说不清它不等于 ELBO,整条提案只是换名**,而这比滞回更早会被打中。**[未做]**
- **规模叙事(falsifier #4)。** 单独审计。裁决:**该 falsifier 没被触发,但原因是证据真空,不是我们赢了。[引用]**
  - 工具使用:规模派证的是**环境泛化**(π0.5 跨约 104 个家庭)与**同类新物体实例**(π0 掉约 13pp)。从这里到"未见工具当身体延伸",**没有任何一篇做过实验**。FORGE (2026-07) 开篇仍写机器人 *"fail to transfer the same function to novel"* tools,而且它的 2× 是靠**结构**(keypoint 中间表示)拿到的。
  - 损伤恢复:唯一正面主张是厂商博客视频——零成功率、零试验数、零误差棒;其"损伤"因训练覆盖"10 万种不同机器人"而被做成**分布内**(摊销,不是重解 μ),且全是 locomotion 不是操作。**Cully et al. 2015 (Nature)**——腿式 5 种损伤 + 机械臂 **14 种**关节损伤矩阵、<2 分钟在线适应、无自诊断——十一年后**仍是这项能力上最严谨的评测**。这不是进步,是没人再认真做了。
  - 披露质量标尺:Gemini Robotics 每任务 n=20(二项 95%CI ≈ ±22pp)已属业界最好之一。真实世界通用基准 GM-100 上 2026 SOTA 绝对成功率仅 **17.30%**(π0.5 13.02%,GR00T N1.6 7.59%,WALL-OSS 4.05%)。**[引用;GM-100 构成为二手]**
  - 第三方审计(Epoch AI, *Where Autonomy Works*, 2026):*"Transfer is rarely demonstrated… Unless transfer is explicitly shown, it should not be assumed."*
  - **反向审计(对我们不利,照写)**:**没有找到**任何一篇让"更好的结构"在同任务同硬件上击败大 10× VLA 且带试验数与误差棒的论文;也**没有**任何"学出来的自我边界"在真实机器人上的性能优势实证。**规模派手里有真实曲线,我们手里只有机制假说。**
  - ⟹ 战略推论:最小实验落在**公开的证据真空**里——不是因为难,是因为没人测。**要抢就抢测量协议**(并入/释放非对称阈值曲线;在线执行器失效的 episode-to-recovery 分布带误差棒),**不是抢架构**。架构上我们打不过规模,方法学上对方是空的。附带义务:10 万形态域随机化是必须超过的**摊销基线**,所以最小实验的损伤类型必须可证地落在任何预训练覆盖之外。

### 3 · 仿真 D0 —— 满足 blanket 条件的非平凡划分存在吗

Rig:MuJoCo 3.10,2–3 DoF 臂,可拆卸工具,可切断执行器,风驱动球;N=34 条标量通道(9 本体感 + 10 触觉 + 12 视觉关键点 + 3 动作回读)。动作 = OU 相关噪声 babbling,**不学策略**,这样任何滞回都不能归因于学到的控制器。全部 CPU,`mujoco==3.10.0`,Python 3.12。

**A · D0-pos(阳性对照,通过)。** 手装双阱,零扫速外推 `A₀ = +0.36 … +0.62`(随拟合形式变动)。线性阴性档:`|A₀| ≤ 0.008` 且符号随拟合形式翻转 ⟹ 与 0 不可区分。**[实测]**
- **判据修正(我们自己揪出来的)**:阴性档的 bootstrap CI **也不含 0**,但那只反映种子噪声(SEM ~1e-4),没反映"只有 4–7 个扫速点、β 与 c 简并"的系统偏差。**正确判据不是 CI,而是把 0.008 当分辨底,看阳性档高出它多少倍**(实测 44–75×)。
- 解析锚点复现:`h_c = 0.38490`、`x* = ±0.57735`;数值 `h_up = +0.3950`、`h_dn = −0.3939`(误差 2.6%)。鞍结标度 `r^{2/3}`、`r^{1/3}` 均在 5% 内复现。直接双稳共存 1.00/1.00 vs 阴性档 0.47/0.43。
- ⟹ **仪器有效**,后续阴性结果可归因于系统而非尺子。

**B · D0 v1 —— 非平凡 blanket 划分"存在",但这个存在几乎无信息量。[实测]**
- 是:22 self / 10 blanket / 2 world 的划分给 `Δ_peek = −0.0032 ± 0.0016`(6/6 种子全负)⟹ 加回 world 通道不改善对 self 的预测 ⟹ 滞回讨论**有对象**。
- 但:故意泄漏的标定划分只给 +0.012,动态范围 0.015 **小于**跨种子 std 0.021。⟹ 这是 Aguilera 那把刀在我们 rig 上的形态,但**方向相反**:不是"blanket 条件只在极窄参数区成立",而是**太容易成立以至于选不出东西**。
- 退化吸引域压倒性:72 次随机重启 **87% 塌到 |S|=1**,且每次都是最安静最好预测的那个 taxel。可算诊断:唯一把可控通道拉进 self 的项实测 ≤0.007,而划分间闭包损失差 ~0.3 ⟹ 系数差约 1.5 个数量级;修法是**重标定**不是换搜索算法。

**C · D0 v2 —— 这一阶段把我们自己下的诊断证伪了,这是最该留下的一条。[实测]**
- **v1 的诊断("ratio<1 是因为接触率太低")——我们下的、并当前提派下去的——是错的。** ratio 低是**协议缺陷**(预测视界 K=10 太短 + 岭回归 λ 网格上界截断),不是 rig 缺陷:修好协议后**两个 rig 都过 3**(v2 rig 3.64;被我们判为"坏"的 v1 rig 3.94)。根因:泄漏标定探针探的是**臂→工具**的泄漏,**这条路径根本不经过球**,对接触率不敏感。**我们把"探针的信噪比"当"rig 耦合强度"读了。**
- **两件事都真但必须分开记**:协议缺陷(已修,ratio 3.08 → 3.64);**rig 缺陷真实存在但 `Δ_peek` 看不见**,由**估计器无关的反事实探针**独立证实:同动作序列只换 wind_seed,轨迹分歧 **D: 0.045 → 0.203(4.5×)**。
- rig 第二层根因(v1 没看出来):干扰球 y 方向无恢复力 → 长 rollout 漂出平面,接触率随时长单调衰减(2000 步 3.8% → 12000 步 0.56%)。加 y 系绳 + 球移进臂实际占据区后接触率 **27%**(诚实标注:超出 5–20% 目标带),且不再随时长衰减。
- **γ_c 从数据自动标定**:`γ_c = std(L_clo)/std(可控性项) = 0.0826/0.00374 ≈ 22.1`。规格默认 1.0 **在量纲上就是错的**。
- 实测坑:`actuatorfrc ≡ ctrl`(MuJoCo motor 力矩读数就是指令本身,不剔除会让可控性增益整体塌到 ≤0.0018,看起来像"动作没用");peek-gain **在 K=1 上结构性瞎**(20 ms 后每通道都能被自己滞后外推);固定 λ 跨不同列数不可比,必须逐预测器在 val 上选 λ。
- 两条与规格担心方向相反的测量学发现:**(i)** 规格让辅助预测器 `f⁺` 用**更小**的 λ 反而制造假阳性——`f⁺` 过拟合 → 负 `Δ_peek` → **假装 blanket 成立**;**(ii)** 连续时序切分 + 非平稳 babbling 会**伪造结论**(`Δ_peek` 一度到 −0.46),必须分块交错。⟹ **`Δ_peek` 对估计器正则化与数据切分比对划分本身更敏感;任何用它下结论的实验必须先跑一个故意泄漏的标定划分当阳性对照。**

### 4 · 仿真 D1 —— 环增益判据可达吗

```
PYTHONPATH=. python scripts/run_d1_gain.py --n-rollouts 6 --steps 12000 --controls-seeds 2
PYTHONPATH=. python scripts/run_d1_featureclass.py --n-rollouts 6
```
v2 rig 默认档 + D0-v2 协议(K=20、λ 网格到 1e2、分块交错 2:1:1、winsorize ±8σ、逐预测器在 val 上选 λ)。`γ_c` 逐 rollout 自动标定,6 条均值 **28.75**。

**4.1 Δπ 量的是什么。** 回路是 `x_i↑ ⟹ 通道 i 进入 z 的预测目标 ⟹ ε_i↓ ⟹ π_i↑ ⟹ 驱动放大`。决定 π 的**不是标签**,而是"通道 i 的历史在不在 z 里"。所以做**同通道反事实**:`ε_i^in`(用 (S∪B)∪{i} 的特征预测 `c_i(t+K)`)vs `ε_i^out`(用 (S∪B)\{i})。取 `π = 1/(1+ε/ε₀)`,相对摆幅 `s ≡ Δπ/π_max` 对 ε₀ 单调,上确界 `s = 1 − ε_in/ε_out` 与 ε₀ 无关。下面所有 `s` 都是这个上确界,即**最有利于理论**的读法。**[实测]**

- **规格字面读法(self 通道的 π 减 world 通道的 π)高估 7 倍**:0.233 vs 同通道反事实 0.0329 ± 0.0037。差别全部来自**通道身份**(taxel 本来就好预测、球本来就不可预测),不是回路里那个量。

**4.2 实测值**(6 seeds × 12000 控制步)。test 归一化 MSE(通道已标准化 ⟹ ε≈1 = 没学到):

| | ε_in | ε_out | ε_own |
|---|---|---|---|
| 边界内 32 通道 | 0.500 | 0.551 | 0.534 |
| 干扰球 2 通道 | 1.026 | 1.018 | 0.947 |

相对摆幅 `s = 1 − ε_in/ε_out`(均值 ± std),以及在保信息的表示变换下:

| 组 | s(笛卡尔) | s(极坐标) |
|---|---|---|
| 边界内均值 | **0.0787 ± 0.0071** | 0.0489 |
| 本体感 | 0.2291 | 0.0379 |
| 触觉(臂) | 0.0016 | 0.0009 |
| 触觉(工具) | 0.0086 | 0.0134 |
| 关键点(臂) | 0.0571 | 0.1779 |
| 关键点(工具) | 0.0130 | 0.0257 |
| 关键点(球,world) | −0.0096 ± 0.0248 | 0.2189(假象) |
| 动作 | 0.0104 | 0.0062 |

**特征类对照(必做,否则会把假象当信号)。** `q1` 在笛卡尔下 s = 0.9844 ± 0.0135,看着救命。但 `q1` 在几何上完全由关键点 1 决定(`kp1 = 0.25·(cos q1, sin q1)`),只是这个关系是 `atan2`,线性+平方的特征类表示不了。把六个关键点换成**极坐标**(可逆变换,信息含量完全相同),`q1` 塌到 **0.0072 ± 0.0171**;`q3` 0.624→0.183;`q2` 0.421→0.114。反向也成立(极坐标引入自己的假象:kp1 半径恒为 0.25 ⟹ 退化;球角度 unwrap 漂移 ⟹ ball_x 0.46 ± 0.44)。**表示不变的读数:最大 s ≈ 0.18,边界内均值 ≈ 0.05–0.08,工具相关通道 0.002–0.045。**

估计器双向对照(2 seeds):换成白噪声 ⟹ s = −1.4e-5 / +1.7e-6(≈0,估计器不造摆幅);换成无关的 AR(1) ρ=0.98 ⟹ s = 0.373 / 0.368,理论 0.446(回收 83%)⟹ 估计器是**衰减的**(低估约 17%),对"摆幅不够"这个结论是**保守**的。

**4.3 规格 §3.3 的字面形式在数学上不可能三稳**(不是数值问题)。`τẋ = −γx + κ·π(x)·(g−c)`、`π(x) = π₀ + Δπ·σ(x/τ_π)` 时,三个自洽解要求同时 `F(0) = κπ₀(g−c)` 与 `F′(0) = κΔπ(g−c)/(4τ_π) − γ > 0`;π₀>0 ⟹ 这两条要求 `(g−c)` **反号,互斥**。数值:κ = 1/10/100 ⟹ G = 0.08/0.82/8.22,不动点 **1/0/0**,从没有 3;回归测试把 κ 推到 1e4(G≈1e3)仍 <3。**[实测]**
**最小修补**(D2 用的就是它):让精度门只乘在**收益**上、不乘成本 —— `τẋ = −γx + κ(π(x)·g − c)`。理由是结构性的而非凑数:目标里的信息瓶颈与 blanket 成本项本就与预测精度无关,而可控性增益才是被精度加权的那个。G 的表达式不变;τ_π = 0.1、κ = 30 给出 G = 2.47 与 **3** 个不动点。

**4.4 可达性,以及判据本身的降级。** 归一 π_max = 1,记 `A ≡ κg/γ`:

`G = A·s/(4τ_π)`,两支路分离度 `= A·s = 4τ_π·G`。

| τ_π | s = 0.183(最好的自身通道) | s = 0.0787(边界内均值) | s = 0.0254(最好的工具通道) |
|---|---|---|---|
| 0.05 | A ≥ 1.1 | A ≥ 2.5 | A ≥ 7.9 |
| 0.10 | A ≥ 2.2 | A ≥ 5.1 | A ≥ 15.7 |
| 0.20 | A ≥ 4.4 | A ≥ 10.2 | A ≥ 31.5 |

- **结论 1**:是,存在合法参数使 G > 1,不需要把任何参数推到荒谬量级。瓶颈是 `s` 与 `τ_π` 的比;κ/γ/(g−c) 单独都不是瓶颈(只以 `A` 出现)。
- **结论 2(更重要)**:`m^S` 越过 0.5 需要 `|x| > ln2/2 = 0.347`,即分离度 ≳0.7,即 `G ≳ 0.175/τ_π`,在 τ_π ≤ 0.175 时**自动 >1**。**"G>1" 与 "边界真的翻转了" 几乎是同一句话**,筛不掉任何东西。规格称它"整条线的生死判据"是**高估**。
- **结论 3(真正的卡点)—— fine-tuning 容差 = s。** 两支路 `x*_hi = A(1 − c/g)`、`x*_lo = A(1 − s − c/g)` ⟹ `c/g` 必须落进 `[1−s, 1]`,即**成本要抵消收益到相对精度 s**。用本仓目标函数自己的系数(γ_c = 28.75 自动标定,β_I = 0.30):

| 组 | g_i | c/g 实测 | 需要的窗口 [1−s, 1] | 偏离(窗口宽为单位) |
|---|---|---|---|---|
| 本体感 | 0.0195 | 0.535 | [0.771, 1] | **2.0**(笛卡尔)/ 12.3(极坐标) |
| 关键点(臂) | 0.0608 | 0.172 | [0.943, 1] | 14.5 / 4.7 |
| **关键点(工具)** | 0.0698 | **0.150** | **[0.987, 1]** | **65 / 33** |
| 动作 | 0.0469 | 0.222 | [0.990, 1] | 75 |
| 触觉(臂) | 0.0074 | 1.401 | [0.998, 1] | 251 |
| 触觉(工具) | 0.0021 | 5.041 | [0.991, 1] | 469 |
| 关键点(球,world) | 0.0021 | 5.038 | — | 420(正确地在窗口外) |

**没有一条通道落在窗口里**;最近的差 2 个窗口宽,而理论的旗舰现象(工具并入)差 **33–469** 个。**目标函数里没有任何机制在把 c/g 往 1 拉。** ⟹ 滞回**不是从我们提的目标函数里长出来的**;它要求一个该目标不提供的、约 2% 精度的手调比值。

### 5 · 仿真 D2 —— 涌现滞回,以及对照做了什么

```
PYTHONPATH=. python scripts/run_d2_emergent.py --n-seeds 30 --n-boot 1000 \
    --s-self 0.183 --s-ball 0.0254                      # 702 s
PYTHONPATH=. python scripts/run_d2_emergent.py --n-seeds 30 --n-boot 1000 \
    --s-self 0.183 --s-ball 0.0254 --only E_field_gated # 164 s
```

动力学(手装立方项 `a = 0`,已完全移除):

    τ_x ẋ = −γx + γ·A·s·(σ(x/τ_π) − ½) + γ·h ,   A = κg/γ,s = Δπ/π_max

参数直接取 D1 实测值:`s_self = 0.183`、`s_ball = 0.0254`、`τ_π = 0.1`、目标 `G = 3` ⟹ `A_self = 6.56`(合法区内),噪声 σ = 0.01,τ_x = 1,`h` 三角扫 −1 → +1 → −1。

四档:**A** 门开、a=0(主张,G=3.00);**B** π 冻成常数、其余一字不改(阴性对照,G=0);**C** 干扰球,同款慢变量、同款门、同样的 A,只把 s 换成球的实测值(G=0.42);**D** 干扰球,把 A 抬到 47.2 使 G 与 A 档相同(G=3.00)。

**5.1 扫速控制 —— 主结果。** 环面积 `A(r)` 均值(30 种子),`r = τ_x/T_sweep` 跨四个数量级:

| r | 1e-1 | 3.3e-2 | 1e-2 | 3.3e-3 | 1e-3 | 3.3e-4 | 1e-4 |
|---|---|---|---|---|---|---|---|
| **A** 门开 | 0.9571 | 0.6561 | 0.3950 | 0.2974 | 0.2520 | 0.2353 | **0.2268** |
| **B** 门冻结 | 0.3831 | 0.1651 | 0.0531 | 0.0181 | 0.0054 | 0.0018 | **0.0006** |
| **C** 球(实测 s) | 0.4512 | 0.1953 | 0.0624 | 0.0211 | 0.0064 | 0.0021 | **0.0007** |
| **D** 球(拉平 G) | 0.9571 | 0.6561 | 0.3950 | 0.2974 | 0.2520 | 0.2353 | **0.2268** |

零扫速外推 `A(r) = A₀ + c·r^β`(β profile 网格 + 30 种子 bootstrap):

| 档 | A₀(β 自由) | β | A₀(β = 1) | 对分辨底 0.008 的倍数 | 判决 |
|---|---|---|---|---|---|
| **A** | **+0.1932** | 0.54 | **+0.2771** | **24 – 35×** | 真双稳 |
| B | −0.0044 | 0.79 | +0.0081 | ≤1.0× | 只是弛豫滞后 |
| C | −0.0052 | 0.79 | +0.0097 | ≤1.2× | 只是弛豫滞后 |
| **D** | **+0.1932** | 0.54 | **+0.2771** | **24 – 35×** | 真双稳 |

B 档的两个 `A₀` 与 D0-pos 线性档**逐位相同**,因为 `gate_const=True` 在数学上就退化成它(有回归测试断言),这同时是分辨底 0.008 的重新确认。最慢档阈值:A 档 `h_up = +0.2674`、`h_dn = −0.2099` ⟹ Δ = +0.477(真环);B 档 `h_up = +0.3359`、`h_dn = +0.3583` ⟹ Δ = −0.022(两者交叉,根本没有环)。

**5.2 直接双稳判定**(比画环更强):`h` 固定 0,两支各 30 种子,`T_hold = 1000 τ_x`:

| 档 | 下支 stay-rate | 上支 | 支路分离度 |
|---|---|---|---|
| **A** 门开 | **1.00** | **1.00** | **1.193** |
| B 门冻结 | 0.47 | 0.43 | 0.0012 |
| C 球(实测 s) | 0.43 | 0.40 | 0.0021 |
| **D** 球(拉平 G) | **1.00** | **1.00** | **1.193** |

B/C 的 0.4x 不是"留住了一半",而是两支塌到同一点、`sign(x_end)` 由噪声决定(分离度 0.001–0.002 才是实质)。**[实测]**

**5.3 ⭐ 特异性对照 —— 叙事被抽掉一半。**
- **C 档(诚实的一半)**:给干扰球配同款慢变量 + 同款门 + 同样的驱动/漏项比,只把精度摆幅换成球的**实测值** ⟹ G 掉到 0.42,`A₀` 落回分辨底,共存判定 0.43/0.40 失败。**滞回不出现。** ✅
- **D 档(致命的一半)**:只把球的 A 从 6.56 抬到 47.2 使 G = 3 ⟹ **滞回的每一个数字与 A 档逐位相同**(A₀ = +0.1932、分离度 1.193、τ 比 0.806)。

不是巧合,是可解析的:归一化后该 ODE **只依赖 (G, τ_π)**,驱动幅度 `A·s = 4τ_π G`。**s 只决定"要多大的 A",不决定"会不会滞回"。**

> ⟹ **滞回是"带门控的慢变量"的通用性质,不是自我的签名。** 在本 rig 上,「自我边界的滞回」与「任何被同样门控的慢变量的滞回」**在动力学上不可区分**,区分只来自一个可被自由参数吸收的 7 倍量级差。这**不**证伪 H-B(A 档确实在 a=0 下给出率无关滞回),但它取消了「滞回 ⟹ 这是自我边界」这一步推理。要恢复特异性必须让 A 也由数据定死 —— 这正好接回 §4.4 结论 3。

**5.4 时间常数非对称预测 —— 被证伪两次。** 在阈值之外固定 `h = ±1.5·|h_up|`,从相反支路做阶跃,取走完 (1 − 1/e) 的时间。两个观测量都报,因为 1-D 约化 `m^S(x) = e^x/(e^x + e^{−|x|} + e^{−x})` 在 `x → −x` 下**本身不对称**(x=0 处 m=1/3 而非 1/2),即使动力学完全对称也会量出 τ_off ≠ τ_on:

| 档 | τ_on (m^S) | τ_off (m^S) | 比值 (m^S) | τ_on (x) | τ_off (x) | **比值 (x)** |
|---|---|---|---|---|---|---|
| **A** 门开 | 4.24±0.11 | 3.41±0.09 | 0.806 | 4.00±0.09 | 4.03±0.10 | **1.008** |
| B 门冻结 | 1.50±0.03 | 0.81±0.02 | 0.537 | 1.06±0.05 | 1.04±0.05 | 0.981 |
| C 球 | 1.81±0.04 | 1.00±0.00 | 0.554 | 1.29±0.03 | 1.28±0.04 | 0.992 |

规格预测 `τ_off > τ_on`(比值 >1),且 π 常数化后应 →1。实测:慢变量上比值 **1.008 = 完全没有非对称**;`m^S` 上 0.806(**小于** 1,释放比并入**快**),而 π 常数化给 0.537,离 1 **更远** ⟹ 规格说的"常数化后 →1"**方向也错**。根因可算:漂移 `F(x) = −γx + γAs(σ(x/τ_π) − ½) + γh` 在 `(x,h) → (−x,−h)` 下**严格奇对称** ⟹ on/off 结构上必然对称。**精度门本身不产生时间常数非对称。**

**E 档:把门乘到整个驱动上**(规格真正想要的机制):`τẋ = −γx + γA[π(x)(1 + w·h) − π(0)]`,w = 0.4,其余同 A 档。成本仍不被门控,否则按 §4.3 三稳数学上不可能。

| 量 | E 档 | 对比 A 档 |
|---|---|---|
| A(r):r = 1e-1 → 1e-4 | 1.0049 → **0.0995** | 0.9571 → 0.2268 |
| A₀(β 自由 = 0.75) | **+0.0916** [CI 0.0915, 0.0918] | +0.1932 |
| A₀(β = 1) | **+0.1289** | +0.2771 |
| 对分辨底的倍数 | **11 – 16×** | 24 – 35× |
| 共存 / 分离度 | 1.00 / 1.00,1.193 | 1.00 / 1.00,1.193 |
| 阈值(最慢档) | `h_up = +0.1245`,`h_dn = −0.0819` | +0.2674 / −0.2099 |
| **τ_on / τ_off (x)** | 3.91 / 3.10 ⟹ **0.794** | 4.00 / 4.03 ⟹ 1.008 |

非对称终于出现(0.794 ≠ 1.008),**但方向与原主张相反**:释放比并入**快**,且离开的阈值(−0.0819)在幅值上**低于**加入的阈值(+0.1245)。可算原因:`G(h) = G₀(1 + w·h)`,h>0 时环增益高、靠近折点、临界慢化 ⟹ 并入慢;h<0 时增益低、系统更线性 ⟹ 释放快。原推理("已在 self 内 ⟹ 精度高 ⟹ 反向证据要更大才能赶出去")默认了**精度只放大支持归属的证据**,这在任何"π 乘在驱动上"的实现里都不成立。要得到"进来容易出去难",必须额外假设一条**不对称**的证据加权 —— 那又是一件手装的东西。

**5.5 本轮未闭合。[未做]** 短训编码器没做(D1 用岭回归代理量 ε,所以 Δπ 仍带特征类依赖——**最大未闭合项**);D2 跑在 1-D 约化 ODE 上而非 34 通道全 rig;`k_grip` 的力-位移标定未做,所以规格的主参数轴(握持刚度)从未被扫过(D2 扫的是抽象外场);separatrix / 最小逃逸扰动幅度非对称未测;Wilcoxon 配对检验与重测 σ₀ 未做;D3–D5、pyDMBD 对照 baseline、baseline a1/a2/b/c/d 未跑。pytest 25 passed。

### 6 · 人类侧:两条战线,都不利

**6.1 为什么决定性数据不存在。** 不是没人想到:所有参数化橡胶手实验一律随机/伪随机顺序,因为心理物理的默认卫生规范把**序列效应当污染而非信号**。范式的设计目的就是抹掉我们要的那个量。**[从方法部分推断]**

**6.2 已存在的前序依赖实测,符号与滞回相反。** Zhang, Ma & Hommel 2015 (*Frontiers in Psychology* 6:1659, N=34):同一"中距离"条件放在近距离之后 vs 远距离之后,**远→中所有权显著更高**(M = 3.768 vs 3.056,F(1,33) = 39.82,η²p = 0.547)。滞回预测的是近→中更高。按 Liaci & Kornmeier 2018 的符号约定(正 = 迟滞/priming,负 = 适应),这是**负号 = 适应侧**。不是干净证伪(7 点问卷、参数是距离非同步性、只有两步),但它是离目标 bit 最近的已发表数据,且不站在我们这边。**[引用]**

**6.3 我们从候选表里捞出来并亲手跑完的更大样本复制。** OSF `bsfwu`(Tsuji & Imaizumi,橡胶手顺序效应,Lush 2020 线),**N = 185**,带 `CondOrder` 列(Syn1st / Asyn1st)—— 正是同一种路径操纵的**同步性版本**,样本大 5 倍。**[我们在其公开数据上实测]**
- 同一 Async 条件:Syn1st 组 M = −0.455 vs Asyn1st 组 M = +0.436,差 **−0.891**,95%CI [−1.232, −0.550],t(183) = −5.16,**p = 6.7e-7**,Hedges d = −0.756;Order × Condition F(1,183) = 19.17,p = 2.0e-5,η²p = 0.095。先经历强条件 → 后续弱条件评分**更低** = 适应/对比侧,与 6.2 同向。
- **三条我们自己查问卷原文查出来的降权**:(a) DV 不是亲历的所有权,是**期望**——被试只看 32 s 视频,答"若你是视频里的被试,你预期体验到多少",且全部未参与过该程序 ⟹ 这是关于所有权的**期望**的顺序效应,几乎必然含判断/锚定成分;(b) 控制条目也有同向显著效应(−0.313,p = 0.0435)⟹ 需求特征污染确实存在,**但不是全无特异性**:Order × Scale F(1,183) = 22.42,p = 4.4e-6,η²p = 0.109,illusion 条目上的效应约为 control 的 **2.8 倍** ⟹ 真实成分存在但被同向偏置污染,本数据无法干净分离;(c) N 实为 185 非 184。

**6.4 同步性侧管线 dry-run —— 不是 embodiment 证据,但产出一条会决定成败的技术事实。[实测]**
- **置换零分布的中心不在 0,在 +0.191。** 机制已定位(`soa²` 项 + block 级反应率异质性;99.2% 的 lag-1 配对落在同一 block 内,block 间反应率差异被原样保留)⟹ **直接对 0 做 t 检验会把符号读反**:t 检验说"+0.048,p = 0.47,无效应",对上正确零模型后是**显著为负**。两个独立零模型(block 内重排 / 历史序列循环平移)给出同向零中心(+0.191 / +0.158)⟹ 稳。**纪律:拿到所有权数据后,先确认该数据上零分布中心在哪,再谈显著性。**
- 真实数字分裂但已解释:`hev9z`(同时性判断,26k 试次)PSS 被前一试次拖动 **+16.1 ms** CI [12.3, 19.9] = 适应侧;`4ukzx` 选择重复 **+0.447** = priming 侧。原因不是效应不稳,而是 `4ukzx` 实为 **TOJ 型单调任务**(β_soa = +7.6,β_soa² = −0.16),与 SJ 的峰形曲线不同族。
- 两份数据都是 lag-1/lag-2 显著、**lag-3 归零** ⟹ 只有 1–2 试次短尾,**无多试次 latch**(弱证据,非 embodiment)。
- **给未来自建实验的硬设计约束(本轮最值钱的可迁移物)**:**若被操纵参数的符号与二元反应语义直接对应(如 TOJ 的"谁先"),迟滞与适应在数学上不可分辨。** ⟹ 所有权的逐试次 DV **必须保持"是/否"**,绝不能写成"哪只手更像我的"。另:若自建实验是单调扫描,自由重排的置换零模型**不合法**,必须改成扫描方向内保序的置换。

**6.5 数据搜寻:什么不存在,以及重复了三次的一个错误。[实测]**
- 逐试次所有权数据:OSF(16 组关键词)+ Zenodo(10 组)+ OpenNeuro(**1831 个数据集全量普查**)三处**零命中**。
- 三份声明"可用"的数据被亲手打开:eLife 11:e77221 (Chancel/Ehrsson/Ma 2022) 的 fig1 source data 是**被试 × 条件的计数矩阵**(S1,N0_−500 = 12 试次中 0 次"是",17 行 × 22 列),fig2/fig3 是模型参数估计;OSF `spkvu`(Lanfranco 2024)经 API 递归列举**全库只有 3 个文件**(`bias.csv` 2578 B、`dprime.csv` 2432 B、`readme.rtf`),均为被试 × 条件聚合。**三份都没有 trial index、没有顺序列** ⟹ 前序依赖在结构上不可计算。(验证:`python3 osf_list.py spkvu 3`;`openpyxl.load_workbook` 逐 sheet 打印;2026-07-28。)
- **不要相信任务名,要打开列。** `ds001785` 的 `stimamp` 实测严格单调上行 0.10→1.94、下行 2.50→2.30 —— 四轮里第一次见到真正的上下行扫描,看名字会直接判"滞回数据到手",打开发现响应列 **93 行全是 `n/a`**。同理 `ds003922` 的响应根本不在 BIDS events 里而在 `sourcedata/`。
- **对我们自己搜寻 agent 过度结论的纠正**:它判"逐试次结构在**范式层面**就不存在(经典 DV 是 block 末问卷)"——**对 Ehrsson 系错**:eLife 77221 的 `RHIdetect` 表就是**每条件 12 试次的逐试次二元所有权判定**(计数 0–12 即证据)⟹ **范式存在且成熟,只是原始日志从不上传。** ⟹ 正确推论不是"自建范式",而是**向作者索要**——当前性价比最高的一步,且需要一次具名的人类请求。
- 四项判据全中的新靶子:OSF `4dzrg` —— 视触 TOJ × 观察人手,40 人 × 840 试次 ≈ 33,600,列 `subNum blk cond trialNum vis_tac_first SOA resp corr RT`(range-read zip 尾部取出,未下 384 MB)。OpenNeuro `ds004561`(Veillette/Lopes/Nusbaum,CC0,EEG,23 人)是唯一一份**身体自我范畴**、逐试次二元判定 + 参数 + 顺序齐全的公开数据(`onset duration trial_type trial intensity latency rt pressed_first agency`,250 试次/人)——**但它是 agency 不是 ownership**。
- 未实测:NEMAR 自身接口(零命中是推论非实测)、Dryad、figshare、GitHub。未检索:麻木肢体脱落阈值;**全身错觉 / 化身错觉侧**(VR 化程度更高,可能藏着现成扫描数据,是下一轮性价比最高的方向)。

**6.6 可照抄的方法学模板,以及又一条对我们不利的。[引用]**
- T1 —— Martin, Kösem & van Wassenhove 2015 (*PLoS ONE* 10(3):e0119365),视听同步性的滞回:**同一把刀已经用在"同步性"这个参数上**,只差把模态换成视-触、把响应换成"这是我的手吗"。它未变扫速,未建立率无关性。
- T2 —— Liaci & Kornmeier 2018:操作定义 `hd = 拐点(上升) − 拐点(下降)`,外加第三条随机序列基线臂。
- T3 —— 立体视 / 双眼竞争:唯一内建**多扫速**的文献,正好能执行我们的"零扫速外推"判据。
- **对我们不利**:Schwiedrzik et al. 2014 (*Cerebral Cortex*) 证迟滞与适应是**独立可加、脑区分离**的两个成分 ⟹ **测到零净滞回 ≠ 没有 latch**(两成分可抵消)。必须写进预注册,否则我们既无法用阴性结果证伪自己,也不能用它当免罪符。
- 成本估算(我们自己的,非文献数字):VR 自建实验设备 + 被试 ¥5k–8k、开发 3–5 人日、N = 24、采集 2–3 周。**真门槛是被试招募与伦理挂靠,不是设备。** VR 不是省钱选项,是**唯一**能满足判据的选项:实体橡胶手的延迟由实验者的手决定,步长做不细、扫速控不准,多扫速外推几乎无法执行;VR 里延迟是纯软件。视-动相关即可诱发,不必做触觉硬件。
- **人类侧当前总账**:两个独立操纵维度(空间距离 / 时间同步性)、两个不同样本(N = 34 / N = 185)、两种测量(亲历 / 期望)——**全部落在适应侧,无一出现迟滞方向**。这种收敛性比任何单条更有份量。但两者都是 block 级问卷,原理上无法区分"滞回"与"单次对比锚定" ⟹ 真正判别性的数据(逐试次 + 变扫速 + 亲历测量)**仍然缺失**。**这条线目前既无支持证据,也未被真正证伪;只是两个可用数据点都指向不利方向。**
- 决策更新:**暂不投 VR 自建**(先验变差,期望价值下降)。优先级 = ① 向持有逐试次日志的实验室索要(唯一能给判别性数据的现成来源,需具名请求)② 仿真侧继续(不依赖生物学前提)。

### 7 · 台账:四个 falsifier 各自的状态

| # | Falsifier | 状态 |
|---|---|---|
| 1 | **工具并入的非对称阈值**(并入慢、释放更慢)。中途收紧:测到非零环**不算**,必须**环面积外推至零扫速仍 > 0**,否则会拿自证的率依赖假环当成功。 | **一半通过,一半被证伪。** a=0 下率无关滞回:A₀ = +0.19…+0.28,分辨底的 24–35 倍,共存 1.00/1.00 ⟹ **通过**。非对称方向:**被证伪两次**(§5.4)。自我特异性:**被证伪**(§5.3)。 |
| 2 | **损伤测试**:中途废掉一个执行器,μ 应在 N 个 episode 内重解出不同但闭合的划分且不重训策略,并显著快于微调后的 VLA baseline。 | **未跑。** |
| 3 | **感官替代迁移**:视觉训 μ → 换触觉阵列编码;行为若不收敛到视觉观测者可达集,则 μ 实为模态绑定,理论超发。 | **未跑。** |
| 4 | **Bitter lesson**:若纯 VLA 放大 10× 就在工具使用 + 损伤恢复上打平,则 μ 从不是瓶颈。 | **没被触发 —— 但原因是证据真空,不是我们赢了**(§2)。举证责任仍在我们这边。 |

**审计过程中新增、且都已开火的 falsifier**:

- **D0**(因为我们对 FEP 文献那一击同样砍我们):先证明仿真臂上存在满足 blanket 条件的非平凡划分。**通过,但几乎无信息量**(§3B)。
- **D0′**(人类侧):自建同步性上下行扫描。**推迟** —— 先验变差到不值得投(§6)。

### 8 · 当前主张状态

原 wedge:**μ 有滞回,由二阶自维持驱动,且并入慢、释放更慢。**

| 成分 | 状态 |
|---|---|
| 滞回不靠手装非线性即可涌现 | ✅ **活** |
| 该滞回对自我边界有特异性 | ❌ 是带门控慢变量的通用性质 |
| 释放比并入更慢 | ❌ 两种实现下都反了 |
| 它从提出的目标函数里自然长出,不需 fine-tune | ❌ 需约 2% 的手调比值 |

四条支柱倒三条,**且全部由我们自己的仪器打倒** —— 这正是这套流程该干的事。

**被重述的问题**(这才是本线真正的产出):滞回很廉价,任何带门控的慢变量都有。**什么让一条边界的滞回是关于这条边界本身的?** 要恢复特异性必须把自由幅度 `A` 也由数据钉死(例如锁到目标函数自己给出的值),而这与 §4.4 结论 3 是同一个问题,两者都没解。

还有两条更早的威胁未答:"闭包违反"是否真的不等于 ELBO(§2);以及**原始像素不能当通道**这个让步 —— μ 是通道上的划分,指称物身份必须稳定,这是本线最大的、已被显式记账而非藏起来的作弊点。

**未 ratify。不是结论。之所以发布,是因为阴性的那一半才是有证据价值的那一半。**

### 9 · 参考文献

- Aguilera, Millidge, Tschantz & Buckley (2022). How particular is the physics of the free energy principle? *Physics of Life Reviews* 40:24–50.
- Biehl, Pollock & Kanai (2021). A technical critique of some parts of the free energy principle. *Entropy* 23(3):293.
- Chancel, Ehrsson & Ma (2022). Uncertainty-based inference of a common cause for body ownership. *eLife* 11:e77221.
- Crutchfield & Young (1989);Shalizi & Crutchfield (2001) —— 因果态 / computational mechanics。
- Cully, Clune, Tarapore & Mouret (2015). Robots that can adapt like animals. *Nature* 521:503–507.
- Friston, Da Costa & Parr (2021). Some interesting observations on the free energy principle. *Entropy* 23(8):1076.
- Holmes (2012). Does tool use extend peripersonal space? *Experimental Brain Research* 218:273–282.
- Klyubin, Polani & Nehaniv (2005) —— empowerment。
- Liaci & Kornmeier (2018) —— 知觉序列中的迟滞与适应。
- Martin, Kösem & van Wassenhove (2015). Hysteresis in audiovisual synchrony perception. *PLoS ONE* 10(3):e0119365.
- Maturana & Varela (1980) —— autopoiesis。
- Schwiedrzik, Ruff, Lazar, Leitner, Singer & Melloni (2014). Untangling perceptual memory: hysteresis and adaptation map into separate cortical networks. *Cerebral Cortex* 24(5):1152–1164.
- Tononi & Koch (2015) —— 意识与复合体的边界。
- Zhang, Ma & Hommel (2015). *Frontiers in Psychology* 6:1659.
- *Dynamic Markov Blanket Detection for Macroscopic Physics Discovery*, arXiv:2502.21217;代码 `github.com/bayesianempirimancer/pyDMBD`。
- Epoch AI (2026). *Where Autonomy Works: Evaluating Robot Capabilities in 2026*. https://epoch.ai/blog/where-autonomy-works-evaluating-robot-capabilities-in-2026

### 10 · 站内相关

- [State 是一个闭包条件,不是给定的集合](https://machengshen.github.io/theory/state-as-closure.zh.md) —— 本提案训练信号所依托的闭包本体论。
- [两体业力:关系里的三种惯性](https://machengshen.github.io/theory/two-body-karma.md) —— 同一套双稳/卡扣语言用在两个耦合的心智上;那里关于"结构性押韵而非推导"的警告在这里同样适用。
- [本线的阶段日志](https://machengshen.github.io/theory/learning-the-self-boundary-log.zh.md) —— 各阶段分别推翻或确立了什么,按时间顺序。
