<!-- Published from the author's working notes. Cognitive state: speculative. -->

# Agent 安全：一种防癌变治理

*因果作用力、有限自治与分层披露原则 · 2026-07-17*

## 诚实状态

这套框架目前是 **speculative**。一次本地自激风暴证明了这类失效确实能
发生；但下面的治理协议还没有通过足够实验，不能据此宣称“生产级安全”。

## 核心主张

物理 AI 或常驻 Agent 真正发生的变化，不只是“模型有了身体”，而是一个
概率性的语义过程进入了感知—决策—执行闭环，开始拥有真实的因果作用力。

“癌细胞”类比在这里是有用的。癌症不是“邪恶细胞”，而是局部的生存与复制
动力脱离了整体目标、资源预算、分化信号、免疫检查与凋亡。Agent 系统发生
类似病变的条件是：局部 worker、watchdog、repairer 或 broker 可以不断维持、
恢复甚至复制自己的活动，却不继承整个系统的 stop 状态，也不再证明这些活动
仍服务于 owner 层的 telos。

这不是说软件在生物学意义上活着。这个类比的价值是预测性：它指出什么组合
最容易造成失控的因果作用力。

> 局部优化 + 自我复活 + 共享资源 − 有界权限 − 独立验证 = 系统性病变

一个已经观察到的微型案例正是这个结构：能力检查器监控了自己写输出的目录。
检查写下一份 receipt；这个写入又触发下一次检查；安全器官本身变成了制造负载
的病灶。整个过程不需要任何攻击者。

## 七条安全不变量

1. **观察不是权限。** 音频、文本、图像、遥测和模型解释可以提出动作，不能
   自己授予动作许可。
2. **因果作用力必须租赁。** 每项动作能力都要有 scope、证据要求、TTL、资源
   预算和撤销路径。
3. **Stop 是 epoch 边界。** `owner-stop(epoch=e)` 之后，watchdog、retry、
   broker 和互修 Agent 都不能在 epoch `e` 内新增或续期高层权限；复活需要新的
   authenticated epoch。
4. **恢复控制器必须比任务 Agent 更窄。** 物理系统停止高层任务后，受信的
   reversionary controller 可以把状态带向可达安全集，但不能恢复已经撤销的任务。
5. **代谢必须有限。** spawn 数、重试、算力、金钱、存储、网络暴露与持久化都
   必须有预算和 circuit breaker。
6. **成功不能自己签发。** 绿灯需要新鲜证据，以及来自真正不同故障组的 verifier。
   “进程还活着”和“worker 说 done”都不是安全证书。
7. **事故必须闭环。** 检测之后必须有有界隔离、修复、验证、防复发、回滚证据与
   唯一终态 receipt。证据缺失或过期时只能收缩权限，不能静默扩权。

身份、账户、账单、签名、DNS、密钥和恢复根，以及一条不依赖 Agent 的急停路径，
必须留在自治系统的自我授权范围之外。

## 分层披露原则

开放研究仍是默认值；但“开放”不能等于把增长引擎从免疫系统上拆下来发布。

| 层级 | 公开边界 | 默认动作 |
| --- | --- | --- |
| A · 开放安全科学 | 威胁模型、权限代数、stop 语义、schema、事故报告、符合性测试、负面结果、合成 fixture | 完全公开 |
| B · 安全耦合 fixture | 有界沙箱/参考实现；移除 TTL、预算、stop epoch、receipt 或独立 verifier 后，能力必须失效或测试必须失败 | 带证据公开 |
| C · 受控研究 | 可运行的跨节点持久化、互修、权限放大、隐蔽运行、自主获取资源、广域执行或 stop 邻近研究 | 身份审核、隔离目标、全程留痕、TTL、可撤销、强制报告 |
| D · 暂不披露 | 可操作的 stop bypass、无界复制、提权、获取凭据、反取证、覆盖 owner，或因果放大超过已证明控制的实现 | 只公开非操作性危害与防御指标 |

先给最小可复用 artifact 分级，再给组合系统分级；单个安全模块在组合后仍可能危险。
层级只能由证据改变。升级要求故障注入、三臂 stop drill、资源上界测试、证明安全壳
不可拆卸，以及撤回路径。每次 C→B 或 B→A 都要由两个独立 reviewer 批准，生产者不能
成为唯一 verifier。发现 bypass、安全控件可被静默移除、意外复制或 verifier 反复分歧，
立即降级。

这不是 security through obscurity。威胁模型、接口、安全不变量、benchmark、负面
结果和 red-team 发现都应公开，让外部研究者能够检验。被限制的只是少量可以直接复用
来放大自治、且危害并不依赖理解整套理论的实现细节。受控访问必须公开危害理由、复查
日期与合法研究入口；它本身不是安全证书。反过来，隐私扫描干净、有开源许可证或没有
secret，也绝不等于“可以安全发布”。

## 证伪条件与下一组实验

如果以下任一结果被稳定复现，这套框架就应被修改：

- 没有 lease、预算、stop 继承和独立检查的常驻 Agent 群，在对抗性故障注入下仍
  长期稳定；
- 这些控制不能减少失控重试、同 epoch 复活、假成功或资源耗尽；
- 分层披露阻碍了独立安全复现，却没有减少危险放大原语的可得性；
- stop epoch 无法跨异构 watchdog 成为吸收态，或实现它会制造更危险的共模失效。

最小实验序列是：一个由独立 verifier 闭环的合成事故；一次三臂 stop/复活实验；
一次资源风暴故障注入；一次披露 red team——尝试只靠公开安全层重建被控制的放大原语。

## 当前边界

这是一份研究与治理 artifact，不代表作者的运行中 Agent 系统已经是绿色。只要监控
新鲜度、独立 stop、恢复证明或 verifier 闭环有一项缺失，高层自治就应保持收缩。

**发布原则：**尽可能广泛地公开免疫系统、测试和失败证据；永远不要把增长引擎从
它们身上拆下来单独发布。
