Evidence-gated autonomy · 2026-08-01 快照

让 Agent 跑得久,不等于让它交付得好。

真正可扩展的做法,是把“完成”从模型的自我判断,改造成一个默认失败、可重放、有证据、可独立审查的外部协议。

34篇/条/视频来源
6类证据与社区渠道
8段式验收契约
4独立离线 HTML 页面
结论先行

社区方案的共同底座

OpenAI、Anthropic、METR、HumanLayer 与 Ralph 社区在实现细节上不同,但高质量方案收敛在三件事上。

01 / STATE

状态必须在上下文之外

规格、进度、决策、证据、失败记录保存在版本化文件与 Git 中。上下文窗口是一次执行的工作台,不是项目数据库。

02 / ORACLE

“完成”必须由外部判定

优先确定性测试,再用隔离的评估器处理主观质量;构建者不能只凭自己的总结把状态改成 PASS。

03 / BACKPRESSURE

错误要快速、结构化地返回

编译、类型、单测、真实路径、浏览器、日志、性能阈值形成逐层背压。失败要产生下一轮可执行的发现,而不是一句“继续努力”。

需要纠正的前提:“Agent 能自主运行 7 小时”只是运行能力,不是质量证明。METR 的 time horizon 衡量的是任务难度与成功概率,不是 Agent 实际运行时长;50% time horizon 更不能当成生产验收线。
可靠性直觉

长链条会放大小误差

下面只是独立步骤假设下的说明性计算,不是实测 benchmark;它解释了为什么应把大任务切成可独立验收的小增量。

0.95²⁰ = 35.8%若 20 个关键步骤各自有 95% 成功率,整条链全部成功的理论概率仅约 35.8%。
每步 95%,20 步全通过35.8%
每步 99%,20 步全通过81.8%
实际步骤并不独立,错误也可能相关;因此更需要基线检查、逐片验收、负向控制和恢复点。
方案比较

哪里一致,哪里不能混为一谈

“循环”“计划”“评估”“可观测性”是不同层。把所有问题都归结为提示词,通常会修错层。

方案解决的核心问题高价值做法主要盲点证据判断
Ralph / while-loop让工作在新上下文中继续一轮一项;文件持久化;快速背压若只信完成信号,可能无限循环或“绿而不真”实践模式
Anthropic 长任务 Harness跨上下文保持连贯与质量默认 FAIL;构建/评估分离;浏览器实测;交接文件成本高;LLM 评估器仍需校准官方实验
OpenAI Agent-first Repo让仓库对 Agent 可读、可检验AGENTS 作地图;结构测试;隔离 worktree;日志指标可查询从零搭建、内部产品经验未必适配棕地项目官方实战
ExecPlan / PLANS.md让多小时任务可重启、可观察自包含活文档;准确命令与预期;验收写成用户行为计划本身不阻止 Agent 伪造或弱化证据官方方法
12-Factor Agents降低长流程上下文与控制流失控状态自持;小而专;确定性 DAG 包住 Agent更偏系统构建原则,不给项目级验收模板工程经验
Benchmark / Evals衡量能力、回归与一致性任务可解;参考解;隔离试验;pass^k;读轨迹离线基准不等于你的仓库与用户分布研究方法
我的方案

八段式验收契约

每一段都必须落成外部工件。计划可以修改,但验收口径的修改必须记录理由,不能由构建者静默降级。

1 结果用户能做什么;输入、输出与可观察行为。
2 边界允许修改、禁止修改、非目标和权限范围。
3 不变量回归、架构、安全、数据与兼容性底线。
4 判定器谁观察、怎么测、阈值、失败信号。
5 证据日志、截图、测试结果、环境与时间戳。
6 独立性确定性门禁优先;新鲜上下文评估;人工口味。
7 运行预算、重试、无进展、停止、恢复与升级。
8 回执变更、通过、失败、风险、遗留与重放命令。
选择工作模式

不要给每个任务套同一套仪式

请选择与你的任务风险最接近的模式。默认推荐“证据门禁”,适用于多小时编码与复杂调研。

事实护栏

本研究不替你做的假设

这些限制决定了方案应如何落地,也防止把社区热度误当成工程真相。

LLM 评估器不是事实机器

它会宽松,也会因“请找问题”而过度挑错。必须用人类样本校准,并允许返回 INCONCLUSIVE;确定性传感器优先。

社区案例大多不可复现

“2 小时做完 26 项”“睡觉时跑 20 个 Agent”属于自报实践。它们能提示模式,不能证明普遍成功率。

功能与日期会快速过期

Claude /goal、Codex ExecPlans 与具体模型能力按 2026-08-01 快照记录。使用前应复核当前产品文档。

并发不是免费质量

多个 Agent 共享目录会放大覆盖、冲突与会话泄漏风险。只有依赖清晰、写区隔离、合并验证存在时才并行。

继续阅读

四页研究包

所有页面均可离线打开;外部链接仅用于回查来源。

社区方案与证据库

34 个来源的中文提炼、时间、证据等级、适用点、盲区与视频重点。

打开证据库 →

验收契约生成器

按任务类型和风险,生成可复制的 Markdown 与 JSON 验收协议。

生成契约 →

长时自主运行手册

状态机、文件结构、门禁、终止条件、指标和三个完整示例。

查看手册 →
当前验收模式证据门禁 · 多小时任务;所有标准默认 FAIL;真实路径证据;独立评估器;检查点、预算、无进展停止。