生活类比:餐厅后厨
厨师连续做菜 8 小时,只能证明厨房没有停。是否能出餐,还要看订单、温度、过敏原和最终品控。
哪里不像:软件任务可以自动回滚与重放,真实餐食通常不能。
Agent Acceptance · 零基础速通讲义
你将用 30 分钟搭起一个能让 Codex 等 Agent 持续工作、用外部证据证明结果、在停滞或越权前自动停下的最小系统。
CHAPTER 01 · 5 MIN
很多人问:“怎样让 Agent 无人值守地跑 8 小时?”这个问题少了后半句:8 小时后,谁来证明它交付的是正确结果?
厨师连续做菜 8 小时,只能证明厨房没有停。是否能出餐,还要看订单、温度、过敏原和最终品控。
哪里不像:软件任务可以自动回滚与重放,真实餐食通常不能。
Agent 是执行者;验收契约是订单;测试与真实操作是温度计;独立评价器是品控;预算和停止条件是总控台。
误解:模型更强,就可以删掉 harness。
实际:模型能力会改变需要多少控制,但生产任务仍需要权限、证据、预算和退出条件。
CHAPTER 02 · ROUTE
时间有限时,不必先读完 34 个来源。按下面顺序建立最小闭环,再去完整研究版查证。
CHAPTER 03 · CONTRACT
验收标准不是“代码看起来不错”,也不是把实现步骤写死。它描述可观察结果,并额外固定安全、证据和运行边界。
坏:“实现头像上传,代码优雅,测试完善。”
好:“已登录用户可上传 JPG/PNG,刷新后仍显示;超大文件和伪装扩展名被拒绝且不持久化;既有设置页、鉴权和路径安全测试继续通过;评价器在运行中的应用完成正反两条路径。”
通常不是。它是实现约束。除非框架本身是兼容性或组织边界,否则验收应优先写用户可观察结果。
CHAPTER 04 · SEPARATION
不一定需要四个不同模型,但必须让职责和权限能被区分。最关键的一条:Builder 不能仅凭自己的总结把任务改成 PASS。
像让另一位验收员只看订单和成品,而不是听厨师复述自己多努力。它不能消除偏差,但能减少沿着同一实现假设自证。
LLM grader 可能宽松、过度挑错或被漂亮解释带偏。确定性判定优先;主观评价要用人工样本校准,并允许返回 INCONCLUSIVE。
CHAPTER 05 · EVIDENCE
每个切片都跑全量 E2E 会很慢,只跑单测又容易“绿而不真”。分层门禁让反馈速度和证据强度同时可控。
Agent 可能弱化断言、改 fixture、增加只返回预期值的 mock,或测试根本没有经过新增代码。防线是:测试变更单独审查、路径覆盖证据和一个应当失败的 negative control。
CHAPTER 06 · LONG RUN
长时自主不是把一个对话无限拉长,而是让新会话能从外部状态可靠接班。
repo/ ├─ AGENTS.md # 地图,不是百科全书 ├─ docs/ACCEPTANCE.md # 冻结的人类可读验收契约 ├─ .agent/acceptance.json # 机器状态,初始全部 FAIL ├─ .agent/PROGRESS.md # 已做 / 下一步 / 失败签名 ├─ .agent/DECISIONS.md # 为什么这样做 ├─ .agent/evidence/ # 日志、截图、命令与轨迹 ├─ .agent/STEER.md # 人类引导 ├─ .agent/STOP # 优雅停止开关 └─ RUN_RECEIPT.md # 最终交接
mandatory 全部 PASS,集成门与回执完整。
达到时间、轮次、成本、磁盘或 API 限额。
连续 2 轮无有效 diff,或同一失败签名连续 3 次。
需要未授权权限、破坏性动作、外部协调或证据不足。
while budget.remaining and not STOP.exists:
criterion = first_mandatory_false()
builder.run_one_slice(criterion)
deterministic_gates.run()
fresh_readonly_evaluator.verify(criterion)
controller.check_progress_signature()
checkpoint_state_and_evidence()
这是控制协议伪代码,不是无限执行脚本。实际 runner 还要处理进程树、锁、心跳、磁盘上限和秘密隔离。
CHAPTER 07 · WORKED EXAMPLE
贯穿例子从模糊需求开始,逐步变成 Agent 可执行、Evaluator 可证伪、Controller 可停止的任务。
| 阶段 | 具体做法 | 产生的证据 |
|---|---|---|
| 冻结结果 | 合法图片上传并持久化;超大和伪装扩展名拒绝。 | C01–C04 = FAIL |
| 基线 | 登录、设置页、上传 API 冒烟;保存既有失败。 | baseline 日志、commit |
| 最小切片 | 先实现服务端格式/大小校验,不同时重构认证。 | 紧凑 diff、定向测试 |
| 真实路径 | 在运行中的页面上传合法图并刷新,再上传伪装文件。 | 操作轨迹、请求、存储前后状态 |
| 负向控制 | 把校验临时指向错误阈值,确认测试会失败后恢复。 | grader 有识别失败的能力 |
| 独立评价 | 新上下文只读检查目标 commit,逐条更新状态。 | 状态、理由、证据 URI |
| 集成与退出 | 全量回归、路径安全检查、最终回执。 | 全部通过才 PASS |
CHAPTER 08 · SELF-CHECK
指定的 grader。确定性条件由程序判定;主观条件由经过标定的独立评价器或人判定。Builder 的总结不是证据。
只有失败产生了新诊断或新证据路径、仍在预算内、且没有触及权限边界时。原样重复同一失败不是进展。
准备、验证和回滚演练可以高度自治;真正改变生产、权限、数据或对外发送的动作需要明确批准。
CHAPTER 09 · FULL RESEARCH
这份速通讲义重排了学习顺序,但没有替代原研究。下面四页按原始文件完整保留,可用于查来源、生成契约和落地运行。
CHAPTER 10 · SOURCE & BOUNDARY
直接材料:《Agent 长时自主交付验收研究》四页 HTML,研究快照为 2026-08-01,包含 34 个公开来源与 6 个视频入口。
教学重建:本页按“错误目标 → 验收契约 → 角色分离 → 证据门禁 → 运行控制 → 完整演练”重排,并增加餐厅类比、头像上传贯穿案例和自检题。类比只帮助理解,不是技术机制本身。
事实边界:OpenAI、Anthropic、METR 和社区案例的数字均有各自任务与时间边界。社区自报不能证明普遍成功率;产品能力在 2026-08-01 之后可能变化。
版权与署名:本专题以“知萃研究整理”署名发布,原创整理与交互页面来自用户提供的研究包;外部资料版权归各来源所有,页面只做摘要、转述与链接。内容所有者已于 2026-08-02 确认授权公开发布。