跳到正文
  1. 首页
  2. 人工智能
  3. Agent Loop 可信治理架构:从执行循环到可撤销自治
ALTA / 1.0
Agent Loop Trust Architecture

Agent Loop
可信治理架构

从“Agent 如何思考”转向“一个自治系统凭什么获得行动权”:用双环、一面、一根、一约,把目标、执行、验收、证据与授权组织成可重议、可降权、可撤权的工程系统。

版本 1.0 日期 2026-07-18 适用 单体与多 Agent 性质 架构原则 + 实施基线
00 / 核心问题

Agent Loop 不是思考步骤清单,而是可靠性控制系统

“感知—规划—行动—观察—反思—记忆”解释了 Agent 在做什么,却没有回答:目标由谁定义、结果由谁验收、错误目标如何中止、权限何时收回。

传统 Agent Loop 的盲区不在于少了某个认知步骤,而在于把执行者同时当作目标解释者、验证器作者和最终裁判。只要这三种权力仍在同一闭环里,增加更多“反思”只会让自我确认变得更长,并不会天然增加可信度。

工程上的核心换轴是:不再按“包含多少思考步骤”评价 Agent,而按“能否围绕可验证目标持续推进、正确停止,并在目标被证伪时发起契约重议”评价它。可靠性来自边界、证据与撤权能力,不来自模型表现出来的自信。

判断 Agent Loop 好坏,不看它会不会反思;看停止条件由谁定义、由谁验证,以及目标本身错了时,它会不会停下来找人。 本文的核心判断
01 / 总架构

双环、一面、一根、一约

内环完成任务,外环决定任务是否仍值得继续;保障面持续检查证据与失败相关性;信任根承担不可递归的最终责任;授权租约让行动权随证据动态升降。

双环

执行环 + 治理环

把“如何推进”与“是否应该继续”分离。

一面

横向保障面

覆盖证据、失败域、审计、投机与治理容量。

一根

显式信任根

确定性基础设施与具名责任人。

一约

动态授权租约

权限不是资产,而是靠持续证据续租。

三权

定义 / 执行 / 验收

形式分离之外,还要隔离失败模式与投机动机。

Agent Loop 可信治理总架构 信任根位于顶部,外层为治理循环,内层为执行循环,横向保障面贯穿全局,动态授权租约连接治理与执行。 信任根 ROOT OF TRUST 确定性基础设施 + 具名责任人 + 最小不可变规则 外层:治理循环 GOVERNANCE LOOP 定义契约目标 / 约束 / 验收 授予租约权限 / 预算 / TTL 处置风险续租 / 降权 / 撤权 重议与升级Recontract / Escalate 内层:执行循环 EXECUTION LOOP 状态 / 感知 计划 / 探针 行动 / 工具 观察 / 更新 验证 / 停止 横向保障面 ASSURANCE PLANE 证据溯源 · 失败域相关性 · 验证组合 · 审计留痕 · 投机检测 · 治理容量 动态授权租约 AUTHORIZATION LEASE Grant · Renew · Degrade · Revoke · Restore
图 1 ALTA 总架构:执行受治理,治理受保障,保障落在显式信任根上。横向滚动查看完整结构
02 / 三权分离

没人能既定义目标,又执行任务,还给自己打分

三权分离的价值不在组织图,而在失败不共振:不同角色必须尽量不共享同一模型盲区、数据源、上游假设和投机收益。

目标定义权

规定意图、边界、约束、风险偏好与成功标准,并对“做什么”负责。

典型持有者
业务所有者、产品负责人、规则制定者

执行权

选择计划、工具与路径,在授权范围内改变环境,并对“如何做”负责。

典型持有者
Agent、Worker、工具执行层

验收与停止权

依据不可被执行者随意改写的证据,判定完成、返工、暂停或撤权。

典型持有者
确定性规则、独立评审、生产指标、具名责任人
形式上的三套角色,不等于真实独立。若三者共享同一数据错误、同一 schema 假设或同一模型盲区,分权只是一张看起来安全的组织图。
03 / 可重议契约

目标契约不是静态提示词,而是可被证伪的运行对象

契约必须版本化、可追踪,并允许在新事实出现时重议;但重议不能成为逃避难题的后门。

GOAL CONTRACT / v1.0
目标要改变的状态,而非要生成的文本
不变量无论采用什么路径都不得突破的边界
验收标准由谁、依据什么证据、在何时判定
关键假设一旦被证伪就触发重议的前提
预算时间、成本、工具调用与治理注意力
风险上限可逆性、爆炸半径、数据与权限边界
退出条件完成、重试、重规划、重议、升级或中止

Recontract 的五道闸

必须出现新的外部证据

不能仅凭“任务比预期难”要求重写目标。

证伪契约假设,而非执行策略

先证明“为什么不该这样做”,再讨论“改成什么”。

证据门槛高于普通推进

契约变更的影响更大,所需证据必须更强。

执行者可以提议,不能批准

批准权保留在契约所有者或治理主体。

重复重议自动升级

同一理由反复出现或超出重议预算,直接进入 Escalate。

Complete证据充分
Retry局部失败
Replan路径失效
Recontract假设被证伪
Escalate超权或争议
Abort风险不可接受
04 / 验证组合

验证的独立性,不是等级,而是失败相关性

V0–V4 只能表示证据强度的默认上限。一个确定性 Oracle 若与执行路径共享错误数据源,名义上是 V3,实际独立性可能接近 V1。

真正的上限是:验证器质量 × 来源独立性

测试全绿只意味着满足了测试表达的规格。若测试也是同一个 Agent 在同一上下文里写出的,它更接近“带额外步骤的自我确认”。关键目标必须组合快而弱、慢而强且失败域不同的验收通道。

级别典型证据默认可信度上限主要风险合理用途
V0执行者自述“已完成”极低无外部约束,最容易自我确认进度提示,不能作为终验
V1同一模型、同一上下文复查共享盲区与动机低成本语法与表面检查
V2独立上下文、独立 Critic仍可能共享模型家族和知识盲区内容评审、交叉推理
V3不可改写测试、规则引擎、确定性 Oracle较高可能共享上游数据或错误规格代码、格式、权限和合规门禁
V4真实用户、生产指标、具名人审最高反馈慢,可能先发生损害再学习高风险终验与长期效果
反馈延迟

多久能知道错了;越慢,纠错代价越高。

前置损害

获得证据前,错误是否已影响用户或生产。

失败域相关性

是否共享模型、数据、schema、工具或假设。

可变更性

执行者能否直接或间接改写验收规则。

治理成本

金钱、延迟与稀缺的人类注意力消耗。

关键目标的默认组合

至少配置两条非相关通道:一条快速反馈的 V2/V3,用于迭代;一条较慢但独立的 V3/V4,用于终验。高风险动作在进入不可逆阶段前,还应增加沙箱、金丝雀或人工批准。不要把“爬到最高级”误当目标,真正要优化的是可信度、时效与损害之间的前沿。

05 / 状态与规划

状态管理的难点,不是存在哪里,而是每轮取回什么

外部化状态只是起点。检索、压缩与重新落地会直接消耗预算,并决定 Agent 是保持连续性,还是在长任务中逐轮漂移。

1

契约账本

当前目标、约束、验收、假设、授权范围与版本历史。

2

只追加事件日志

工具调用、决策、证据、异常、重议与授权变更,形成可审计时间线。

3

活动工作集

当前步骤真正需要的文件、事实、中间产物和未决问题。

4

压缩与可检索记忆

按主题、时间与风险索引的历史摘要,保留证据指针而非只留结论。

每轮 Re-grounding 的最小读取

当前契约先恢复“为什么做”和“不能做什么”。
关键不变量权限、数据、不可逆行为和停止规则。
最近增量上轮发生了什么,哪些假设被更新。
活动工作集只载入本轮推进所需的信息。
按需历史通过检索获得证据,不把全部历史塞回上下文。

规划触发器:风险,而不是“看起来复杂”

规划强度 ∝ 模糊度 × 不可逆性 × 爆炸半径 × 成本 × 新颖性

“简单任务直接行动”本身需要一次复杂度判断。若不确定,默认采用最小可行计划,并先执行低成本、可逆、能最大化信息增益的探针;不是写一份冗长计划,而是避免把未知任务误判为简单任务。

06 / 多 Agent

递归执行,不递归授权

Worker 可以继续拆任务,但不能把自己的全部权限复制给下一层。每次委派都是一个范围更小、预算更低、验收更明确的子契约。

Tier 1

治理主体

持有总目标、风险偏好和最终验收权。

  • 定义父契约
  • 授予 Orchestrator 租约
  • 批准重议与高风险动作
Tier 2

Orchestrator

拆解、分配、集成与覆盖检查,是新的信任咽喉。

  • 生成子契约
  • 分配最小上下文与权限
  • 执行集成级验收
Tier 3+

Workers

在隔离上下文中交付局部成果,可申请但不能自行扩大权限。

  • 局部目标与工具
  • 提交证据包
  • 缺上下文时显式请求
1 / Worker 验收

局部是否合格

验证输出满足子契约;防止单个 Worker 空交付或越界。

2 / Integration 验收

组合是否一致

检查接口、横切约束和相互作用;解决“单测全绿,系统崩了”。

3 / Mission 验收

总目标是否达成

由父层或外部持有标准,验证局部合格之和是否真的构成目标成功。

隔离上下文会减少污染,也会制造上下文饥饿。Orchestrator 必须维护“需求 → 子契约 → 横切约束 → 集成验证 → 最终证据”的覆盖图,并让 Worker 能够显式请求缺失信息。
07 / 信任根与授权租约

信任无法消除,只能被迁移到一个被明确标注的点

保障面不能无限递归地再由另一组 Agent 保障。系统必须显式命名一个最小信任根,并承认它需要外部审计而非内部自证。

R

最小信任根

不是“永远正确”的组件,而是架构有意识选择、不允许执行者修改、并由外部持续监督的可信基点。

确定性基础设施身份、最小权限、沙箱、资源上限、不可变日志、密钥与撤权机制。
具名责任人对最终契约解释、风险接受、紧急停止与恢复承担明确责任。
最小不可变规则Agent 不可自行删除或绕过的停止条件、审批门槛和证据保存要求。
外部审计定期检查信任根是否仍合理,而不是让信任根给自己出具证明。
Observation

只读观察;积累基线证据。

Restricted

低风险、可逆、低预算动作。

Standard

常规范围内自主执行与续租。

Elevated

临时高权限;更强证据与更短 TTL。

Degrade不终止任务,立即缩小工具、预算或作用域。
Revoke证据失效或风险越界,撤销行动权并进入安全状态。
Restore完成修复与独立复核后,逐级恢复而非原地满权。

授权的非对称原则

扩权要慢:需要多源证据、明确期限和更严格审批。降权要快:任一高风险信号都可触发临时收缩。不要把权限做成一个可被优化的“Agent 信用分”;授权应是有范围、有期限、有证据要求的租约。

08 / 最小可行实施

先建立能停、能验、能撤的最小系统

不需要一次性造出庞大平台。先把最危险的权力合并拆开,再让每一次行动都能找到契约、证据与授权来源。

契约对象化

为每个任务保存版本化目标、边界、假设、验收、预算和风险上限。

权限租约化

权限附带范围、TTL、工具清单、成本上限、续租证据和撤权条件。

证据包标准化

输出不仅有结论,还包含测试结果、来源、变更记录和剩余不确定性。

验证通道相关性标注

记录验证器与执行者共享的模型、数据、schema、工具和假设。

重议设置预算与闸门

同一理由反复重议、证据不足或超预算时,自动升级而非继续对话。

多层验收

Worker、集成、总目标三层都有独立标准与证据持有者。

治理容量入预算

对升级去重、分级、批处理,设置响应时限与无人响应时的安全停止。

演练降权与撤权

定期验证 Degrade、Revoke、Restore 不是架构图上的装饰。

自写测试即独立验证

同一闭环生成规格、实现和测试,只是更复杂的自我确认。

契约重议没有成本

Agent 会把难题重新定义成容易通过的任务,形成 contract gaming。

级别越高越可信

忽略共享数据与共享假设,会让名义 V3/V4 与执行路径一起静默失败。

局部验收代替总体验收

所有 Worker 都合格,不代表任务覆盖完整或系统行为正确。

把人审当无限资源

高频噪声升级会制造告警疲劳,最终把治理环降级成橡皮图章。

把信任变成总分

一旦用于排名和授权,评分本身会成为新的 Goodhart 投机目标。

09 / 起飞前零值检查

把“乘法公式”留在检查单,不把它变成评分卡

权力分离、失败域正交性、证据质量与治理容量彼此耦合、不同质,不能可靠地相乘打分。它们适合做 AND 条件:任一项接近零,自治上限就接近零。

01
目标定义、执行与验收是否由不同主体持有?
否 → 不得高自治
02
这些主体是否仍共享关键数据源、schema 假设或同一模型盲区?
是 → 增加正交通道
03
验收标准与目标契约能否同时抵抗投机?
否 → 收缩授权
04
多 Agent 是否有集成级与任务级验收,而非只有子任务验收?
否 → 禁止放大规模
05
治理主体是否胜任、在场,并有足够注意力响应升级?
否 → 进入安全停止
06
系统是否真的能降权、撤权、恢复并留下不可变证据?
否 → 仅允许只读
这不是“Agent 可信度 87 分”的公式。不要评分,只检查是否有接近零的短板。
FINAL PROPOSITION
一个自治系统凭什么获得行动权?凭权力分离、有限授权与可验证证据。凭什么证明自己仍然值得?凭持续履约让授权续租;一旦证据失效、风险上升或治理能力不足,系统必须能够降权、撤权或安全停止。

可信自治不是一次评审通过后的固定资产,而是一种持续更新、随时可收回的制度安排。它和可信组织的逻辑相同:不是靠每个参与者都聪明,而是靠权力分立、证据留痕,以及没人能既定义目标又给自己打分。

10 / 参考与边界

一手资料与本文推导

本文不是任何单一机构框架的复述。外部资料用于校准风险、授权与验证边界;“双环、一面、一根、一约”及其组合方式,是在这些约束上形成的架构归纳。

NIST AI Risk Management Framework / Coreairc.nist.gov/airmf-resources/airmf/5-sec-core/

治理是贯穿生命周期的横向职能,强调角色、责任、监测与风险处置。

NIST AI 600-1 / Generative AI Profilenist.gov/publications/...generative-artificial-intelligence

生成式 AI 风险管理的官方配套框架。

NIST SP 800-207 / Zero Trust Architecturecsrc.nist.gov/pubs/sp/800/207/final

无隐式信任、动态策略、持续诊断与最小权限。

NIST / Hardware Root of Trustcsrc.nist.gov/glossary/term/hardware_root_of_trust

本文借用“显式可信基点”的工程思想,但不是硬件定义的直接迁移。

OWASP Top 10 for Agentic Applicationsgenai.owasp.org/.../owasp-top-10-for-agentic-applications/

目标劫持、工具滥用、身份权限、记忆污染、级联失败与人机信任利用。

OWASP / Securing Agentic Applicationsgenai.owasp.org/resource/securing-agentic-applications-guide-1-0/

Agentic 应用安全边界和防护实践。

Anthropic / Trustworthy agents in practiceanthropic.com/research/trustworthy-agents

人类控制、授权、歧义处理、分层防御与 Agent 运行环境。

Anthropic / Building effective agentsanthropic.com/engineering/building-effective-agents

工作流、Agent、编排者—Worker 与评估器—优化器模式。

Anthropic / Demystifying evals for AI agentsanthropic.com/engineering/demystifying-evals-for-ai-agents

组合评测方法,以及单一评测带来的单边优化风险。

Anthropic / Effective harnesses for long-running agentsanthropic.com/research/long-running-Claude

持久状态、测试 Oracle 与长任务编排。

Boris Cherny / Self-verification postx.com/bcherny/status/2064426115255730578

关于自验证与循环质量的讨论来源之一。

Boris Cherny / Model + guardrails + verifier + loopx.com/bcherny/status/2067272742253232211

“模型、护栏、验证器、循环”的直接思想锚点。

归属说明:“模型能力决定能做什么,验证闭环、上下文基础设施与治理决定能否长期可靠工作”是本文对相关材料的分析性归纳,不作为 Boris Cherny 的逐字引语。正式引用应保留原帖链接,并为易失内容保存截图或结构化存档,避免引用本身成为单点故障。