状态必须在上下文之外
规格、进度、决策、证据、失败记录保存在版本化文件与 Git 中。上下文窗口是一次执行的工作台,不是项目数据库。
真正可扩展的做法,是把“完成”从模型的自我判断,改造成一个默认失败、可重放、有证据、可独立审查的外部协议。
OpenAI、Anthropic、METR、HumanLayer 与 Ralph 社区在实现细节上不同,但高质量方案收敛在三件事上。
规格、进度、决策、证据、失败记录保存在版本化文件与 Git 中。上下文窗口是一次执行的工作台,不是项目数据库。
优先确定性测试,再用隔离的评估器处理主观质量;构建者不能只凭自己的总结把状态改成 PASS。
编译、类型、单测、真实路径、浏览器、日志、性能阈值形成逐层背压。失败要产生下一轮可执行的发现,而不是一句“继续努力”。
下面只是独立步骤假设下的说明性计算,不是实测 benchmark;它解释了为什么应把大任务切成可独立验收的小增量。
“循环”“计划”“评估”“可观测性”是不同层。把所有问题都归结为提示词,通常会修错层。
| 方案 | 解决的核心问题 | 高价值做法 | 主要盲点 | 证据判断 |
|---|---|---|---|---|
| Ralph / while-loop | 让工作在新上下文中继续 | 一轮一项;文件持久化;快速背压 | 若只信完成信号,可能无限循环或“绿而不真” | 实践模式 |
| Anthropic 长任务 Harness | 跨上下文保持连贯与质量 | 默认 FAIL;构建/评估分离;浏览器实测;交接文件 | 成本高;LLM 评估器仍需校准 | 官方实验 |
| OpenAI Agent-first Repo | 让仓库对 Agent 可读、可检验 | AGENTS 作地图;结构测试;隔离 worktree;日志指标可查询 | 从零搭建、内部产品经验未必适配棕地项目 | 官方实战 |
| ExecPlan / PLANS.md | 让多小时任务可重启、可观察 | 自包含活文档;准确命令与预期;验收写成用户行为 | 计划本身不阻止 Agent 伪造或弱化证据 | 官方方法 |
| 12-Factor Agents | 降低长流程上下文与控制流失控 | 状态自持;小而专;确定性 DAG 包住 Agent | 更偏系统构建原则,不给项目级验收模板 | 工程经验 |
| Benchmark / Evals | 衡量能力、回归与一致性 | 任务可解;参考解;隔离试验;pass^k;读轨迹 | 离线基准不等于你的仓库与用户分布 | 研究方法 |
每一段都必须落成外部工件。计划可以修改,但验收口径的修改必须记录理由,不能由构建者静默降级。
请选择与你的任务风险最接近的模式。默认推荐“证据门禁”,适用于多小时编码与复杂调研。
这些限制决定了方案应如何落地,也防止把社区热度误当成工程真相。
它会宽松,也会因“请找问题”而过度挑错。必须用人类样本校准,并允许返回 INCONCLUSIVE;确定性传感器优先。
“2 小时做完 26 项”“睡觉时跑 20 个 Agent”属于自报实践。它们能提示模式,不能证明普遍成功率。
Claude /goal、Codex ExecPlans 与具体模型能力按 2026-08-01 快照记录。使用前应复核当前产品文档。
多个 Agent 共享目录会放大覆盖、冲突与会话泄漏风险。只有依赖清晰、写区隔离、合并验证存在时才并行。
所有页面均可离线打开;外部链接仅用于回查来源。