执行环 + 治理环
把“如何推进”与“是否应该继续”分离。
从“Agent 如何思考”转向“一个自治系统凭什么获得行动权”:用双环、一面、一根、一约,把目标、执行、验收、证据与授权组织成可重议、可降权、可撤权的工程系统。
“感知—规划—行动—观察—反思—记忆”解释了 Agent 在做什么,却没有回答:目标由谁定义、结果由谁验收、错误目标如何中止、权限何时收回。
传统 Agent Loop 的盲区不在于少了某个认知步骤,而在于把执行者同时当作目标解释者、验证器作者和最终裁判。只要这三种权力仍在同一闭环里,增加更多“反思”只会让自我确认变得更长,并不会天然增加可信度。
工程上的核心换轴是:不再按“包含多少思考步骤”评价 Agent,而按“能否围绕可验证目标持续推进、正确停止,并在目标被证伪时发起契约重议”评价它。可靠性来自边界、证据与撤权能力,不来自模型表现出来的自信。
判断 Agent Loop 好坏,不看它会不会反思;看停止条件由谁定义、由谁验证,以及目标本身错了时,它会不会停下来找人。 本文的核心判断
内环完成任务,外环决定任务是否仍值得继续;保障面持续检查证据与失败相关性;信任根承担不可递归的最终责任;授权租约让行动权随证据动态升降。
把“如何推进”与“是否应该继续”分离。
覆盖证据、失败域、审计、投机与治理容量。
确定性基础设施与具名责任人。
权限不是资产,而是靠持续证据续租。
形式分离之外,还要隔离失败模式与投机动机。
三权分离的价值不在组织图,而在失败不共振:不同角色必须尽量不共享同一模型盲区、数据源、上游假设和投机收益。
规定意图、边界、约束、风险偏好与成功标准,并对“做什么”负责。
选择计划、工具与路径,在授权范围内改变环境,并对“如何做”负责。
依据不可被执行者随意改写的证据,判定完成、返工、暂停或撤权。
契约必须版本化、可追踪,并允许在新事实出现时重议;但重议不能成为逃避难题的后门。
不能仅凭“任务比预期难”要求重写目标。
先证明“为什么不该这样做”,再讨论“改成什么”。
契约变更的影响更大,所需证据必须更强。
批准权保留在契约所有者或治理主体。
同一理由反复出现或超出重议预算,直接进入 Escalate。
V0–V4 只能表示证据强度的默认上限。一个确定性 Oracle 若与执行路径共享错误数据源,名义上是 V3,实际独立性可能接近 V1。
测试全绿只意味着满足了测试表达的规格。若测试也是同一个 Agent 在同一上下文里写出的,它更接近“带额外步骤的自我确认”。关键目标必须组合快而弱、慢而强且失败域不同的验收通道。
| 级别 | 典型证据 | 默认可信度上限 | 主要风险 | 合理用途 |
|---|---|---|---|---|
| V0 | 执行者自述“已完成” | 极低 | 无外部约束,最容易自我确认 | 进度提示,不能作为终验 |
| V1 | 同一模型、同一上下文复查 | 低 | 共享盲区与动机 | 低成本语法与表面检查 |
| V2 | 独立上下文、独立 Critic | 中 | 仍可能共享模型家族和知识盲区 | 内容评审、交叉推理 |
| V3 | 不可改写测试、规则引擎、确定性 Oracle | 较高 | 可能共享上游数据或错误规格 | 代码、格式、权限和合规门禁 |
| V4 | 真实用户、生产指标、具名人审 | 最高 | 反馈慢,可能先发生损害再学习 | 高风险终验与长期效果 |
多久能知道错了;越慢,纠错代价越高。
获得证据前,错误是否已影响用户或生产。
是否共享模型、数据、schema、工具或假设。
执行者能否直接或间接改写验收规则。
金钱、延迟与稀缺的人类注意力消耗。
至少配置两条非相关通道:一条快速反馈的 V2/V3,用于迭代;一条较慢但独立的 V3/V4,用于终验。高风险动作在进入不可逆阶段前,还应增加沙箱、金丝雀或人工批准。不要把“爬到最高级”误当目标,真正要优化的是可信度、时效与损害之间的前沿。
外部化状态只是起点。检索、压缩与重新落地会直接消耗预算,并决定 Agent 是保持连续性,还是在长任务中逐轮漂移。
当前目标、约束、验收、假设、授权范围与版本历史。
工具调用、决策、证据、异常、重议与授权变更,形成可审计时间线。
当前步骤真正需要的文件、事实、中间产物和未决问题。
按主题、时间与风险索引的历史摘要,保留证据指针而非只留结论。
“简单任务直接行动”本身需要一次复杂度判断。若不确定,默认采用最小可行计划,并先执行低成本、可逆、能最大化信息增益的探针;不是写一份冗长计划,而是避免把未知任务误判为简单任务。
Worker 可以继续拆任务,但不能把自己的全部权限复制给下一层。每次委派都是一个范围更小、预算更低、验收更明确的子契约。
持有总目标、风险偏好和最终验收权。
拆解、分配、集成与覆盖检查,是新的信任咽喉。
在隔离上下文中交付局部成果,可申请但不能自行扩大权限。
验证输出满足子契约;防止单个 Worker 空交付或越界。
检查接口、横切约束和相互作用;解决“单测全绿,系统崩了”。
由父层或外部持有标准,验证局部合格之和是否真的构成目标成功。
保障面不能无限递归地再由另一组 Agent 保障。系统必须显式命名一个最小信任根,并承认它需要外部审计而非内部自证。
不是“永远正确”的组件,而是架构有意识选择、不允许执行者修改、并由外部持续监督的可信基点。
只读观察;积累基线证据。
低风险、可逆、低预算动作。
常规范围内自主执行与续租。
临时高权限;更强证据与更短 TTL。
扩权要慢:需要多源证据、明确期限和更严格审批。降权要快:任一高风险信号都可触发临时收缩。不要把权限做成一个可被优化的“Agent 信用分”;授权应是有范围、有期限、有证据要求的租约。
不需要一次性造出庞大平台。先把最危险的权力合并拆开,再让每一次行动都能找到契约、证据与授权来源。
为每个任务保存版本化目标、边界、假设、验收、预算和风险上限。
权限附带范围、TTL、工具清单、成本上限、续租证据和撤权条件。
输出不仅有结论,还包含测试结果、来源、变更记录和剩余不确定性。
记录验证器与执行者共享的模型、数据、schema、工具和假设。
同一理由反复重议、证据不足或超预算时,自动升级而非继续对话。
Worker、集成、总目标三层都有独立标准与证据持有者。
对升级去重、分级、批处理,设置响应时限与无人响应时的安全停止。
定期验证 Degrade、Revoke、Restore 不是架构图上的装饰。
同一闭环生成规格、实现和测试,只是更复杂的自我确认。
Agent 会把难题重新定义成容易通过的任务,形成 contract gaming。
忽略共享数据与共享假设,会让名义 V3/V4 与执行路径一起静默失败。
所有 Worker 都合格,不代表任务覆盖完整或系统行为正确。
高频噪声升级会制造告警疲劳,最终把治理环降级成橡皮图章。
一旦用于排名和授权,评分本身会成为新的 Goodhart 投机目标。
权力分离、失败域正交性、证据质量与治理容量彼此耦合、不同质,不能可靠地相乘打分。它们适合做 AND 条件:任一项接近零,自治上限就接近零。
一个自治系统凭什么获得行动权?凭权力分离、有限授权与可验证证据。凭什么证明自己仍然值得?凭持续履约让授权续租;一旦证据失效、风险上升或治理能力不足,系统必须能够降权、撤权或安全停止。
可信自治不是一次评审通过后的固定资产,而是一种持续更新、随时可收回的制度安排。它和可信组织的逻辑相同:不是靠每个参与者都聪明,而是靠权力分立、证据留痕,以及没人能既定义目标又给自己打分。
本文不是任何单一机构框架的复述。外部资料用于校准风险、授权与验证边界;“双环、一面、一根、一约”及其组合方式,是在这些约束上形成的架构归纳。
治理是贯穿生命周期的横向职能,强调角色、责任、监测与风险处置。
生成式 AI 风险管理的官方配套框架。
无隐式信任、动态策略、持续诊断与最小权限。
本文借用“显式可信基点”的工程思想,但不是硬件定义的直接迁移。
目标劫持、工具滥用、身份权限、记忆污染、级联失败与人机信任利用。
Agentic 应用安全边界和防护实践。
人类控制、授权、歧义处理、分层防御与 Agent 运行环境。
工作流、Agent、编排者—Worker 与评估器—优化器模式。
组合评测方法,以及单一评测带来的单边优化风险。
持久状态、测试 Oracle 与长任务编排。
关于自验证与循环质量的讨论来源之一。
“模型、护栏、验证器、循环”的直接思想锚点。