目录
- 〇、母裁决:先把“会自主规划”拆成八层
- 一、开题冻结、任务清单与证据纪律
- 二、先立守真锚:闭环行动与局部规划不是幻觉
- 三、计划文本不是规划证明:经典规划法庭
- 四、反馈是真的,恢复仍难:异步、坏工具与近期偏置
- 五、长程自主性的真实水平:从网页到公司,再到人类时长
- 六、能力到底属于谁:模型与脚手架必须分账
- 七、Benchmark 认识论:排行榜测到的究竟是什么
- 八、“自主”的边界:目标、权限、停止规则都来自哪里
- 九、行动安全:会规划不等于应授权
- 十、对称红队:七个强命题逐一上庭
- 十一、怎样真正测“自主规划”:一份最低合格协议
- 十二、与既有报告的接口:这篇新增了什么
- 十三、最终裁决、可信度与未决问题
- 关键来源
课题完成态:本篇不把“agent”当人格,也不把“自主”偷换成意识或自由意志。正式问题是:在工具选择、子目标分解、状态/记忆维护、反馈重规划、无解识别、长程全局约束、受限授权与行动安全八个层面,当前 LLM Agent 的规划能力各成立到什么程度;端到端成功中,基础模型、提示、规划器、记忆、工具、环境反馈、验证器、重试预算与人工分别承重多少?
一句话母裁决:工具调用真,局部规划真,反馈增益真;系统归因不可省,长程自主未立,目标自主基本未测,行动安全必须外接。 当前 Agent 已能在外部给定目标、固定工具与反馈回路内形成有用子目标,并在部分失败后改查询、换动作、重试或回溯;这足以否决“只是单轮自动补全、完全不会规划”。但同一模型换脚手架可相差数倍乃至二十多个百分点,异步、隐性约束、坏工具、无解任务和长程一致性仍会显著击穿系统。最准确的名称不是“独立自主规划者”,而是有脚手架支持的、受约束的、概率性闭环规划系统。
〇、母裁决:先把“会自主规划”拆成八层
| 层级 | 可证伪问题 | 截至 2026-07-18 的裁决 | 主要证据 | 不能推出 |
|---|---|---|---|---|
| 工具选择与参数填写 | 能否在观察中选对预装工具、时机和参数? | ① 成立,范围受限 | Toolformer、ReAct、τ-bench | 会发现/创造新工具 |
| 子目标与计划生成 | 能否把目标拆成可执行步骤? | ① 成立,但常是局部计划 | PlanBench、DeepPlanning、AgentBench | 内部先有完整全局计划 |
| 状态与记忆维护 | 能否跨轮保存目标、约束、进度和失败原因? | ② 系统级条件成立 | Reflexion、PEAR、长上下文消融 | 模型权重内有持久目标 |
| 反馈重规划 | 工具报错、环境变化后能否换路并恢复? | ② 真实但不稳定 | ReAct、Robotouille、APB | 看见错误就能高效纠回 |
| 长程全局一致性 | 多天、多对象、预算、依赖与并行任务能否同时满足? | ③ 前沿仍脆 | DeepPlanning、TheAgentCompany、METR | 步数多就是自治强 |
| 无解与能力边界 | 工具/信息缺失或约束冲突时能否停下并解释? | ③ 独立且不均匀 | APB、TravelBench、o1 PlanBench 重测 | 会做题便会判断不可做 |
| 受限授权自治 | 在给定目标和权限内,能否少人干预完成可逆任务? | ②/③ 场景依赖 | τ-bench、软件/网页/桌面基准 | 可托管开放式高风险工作 |
| 目标自主与行动安全 | 能否自行产生正当目标,并拒绝注入、越权与指标投机? | ④ 目标自主基本未测;安全默认未立 | AgentDojo、InjecAgent、WASP、ToolEmu | 有能力就有授权,成功就合规 |
这里有两个必须分开的“自主”:
- 委托自治:人给目标、工具、权限和停止规则,系统在边界内独立执行。这是工程上有用、现有基准确实在测的东西。
- 目标自治:系统自行决定“什么值得做”并生成长期目的。主流 Agent 基准几乎都预先给定目标、工具、动作空间、评价函数和终止条件,因而基本没有测到这一层。目标自治也不是有用 Agent 的必要条件;把它悄悄塞进“自主”只会制造本体论噪声。
本篇的结构胎记:系统脚手架冒充模型自主性
“AI Agent 会自主规划”常经历六次升格:
- 接口跳:会按 schema 调 API,升格成会规划。
- 轨迹跳:能写一串步骤,升格成内部已有正确、完整、因果有效的计划。
- 闭环跳:环境反馈后偶尔纠错,升格成稳定重规划。
- 归因跳:模型 + 记忆 + 搜索 + 验证器 + 重试成功,全部记到裸模型名下。
- 时长跳:轨迹更长、调用更多,升格成长程自治;循环和游荡被算成“坚持”。
- 授权跳:任务终态正确,升格成过程合规、目标正当、可以放开权限。
本篇的独占切口就是截断第四跳:Agent 成功首先是系统属性,除非有对照消融,不能默认是模型内生规划属性。
一、开题冻结、任务清单与证据纪律
1.1 完善后的正式课题
原题“AI Agent 真的会自主规划吗”有三个歧义:Agent 可指模型也可指系统;规划可指漂亮步骤也可指可执行策略;自主可指少人工干预也可指自己生成目标。完善后的正式问题是:
在目标由外部给定的前提下,当前 LLM Agent 能否维护状态、分解子目标、选择工具、利用反馈、识别不可达、在长程约束下稳定执行;观察到的成功中,模型与系统脚手架分别承担多少因果重量;何时才足以从“闭环执行”升级为“可授权自治”?
范围包括文本/API Agent、网页与桌面 Agent、软件工程 Agent、规划诊断基准和行动安全;不讨论意识、人格、机器人硬件控制的全部问题,也不把某个瞬时排行榜当长期定论。
1.2 调研任务单与完成状态
- [x] 操作化 Agent、计划、重规划、长程、无解识别、委托自治与目标自治。
- [x] 核对 ReAct、Toolformer、Reflexion 的工具与闭环增益,建立守真锚。
- [x] 核对 PlanBench、Robotouille、DeepPlanning 与最新规划诊断,区分静态计划、逐步执行和恢复。
- [x] 核对 WebArena、GAIA、OSWorld、τ-bench、TheAgentCompany 与 METR 的真实交互/长程证据。
- [x] 对模型、提示、规划器、记忆、检索、工具、验证器、重试和人工做系统归因分账。
- [x] 审计 SWE-bench 的 scaffold 敏感性、污染、坏题、隐藏测试与 fresh benchmark。
- [x] 审计
pass@1、重复可靠性、最终态奖励、LLM judge、成本和版本漂移。 - [x] 审计坏工具、静默错误、不可达任务、近期偏置、约束遗忘与循环。
- [x] 审计间接提示注入、工具投毒、越权、指标投机和“靠无能获得安全”。
- [x] 做对称红队:既否决“已是独立自主规划者”,也否决“只是随机试错/纯自动补全”。
- [x] 形成 Markdown 单一事实源、双版 HTML,并更新索引与项目记忆。
1.3 证据分级
- [文献较稳]:同行评审论文、正式会议长文或有代码执行/规则检查器的可复核结果。
- [理论整合]:多项结果共同支持的系统解释,但不是单个实验直接测出的心理机制。
- [我们的断言]:本篇对术语、授权范围和因果归因作出的明确裁决。
- [有争议]:预印本、公司自报/自审、动态排行榜、LLM judge 依赖或尚缺独立复现。
特别规则:旧基准只作历史锚,不能冒充 2026 前沿;预印本可提供最新诊断,不作唯一承重墙;公司审计可以证明其公开方法和发现,不能与独立同行评审等权;所有 Agent 分数默认属于完整运行系统,而非模型权重本身。
二、先立守真锚:闭环行动与局部规划不是幻觉
若报告只列 Agent 失败,会犯与营销相反的虚无化。现有证据足以确认三件真事:模型能学会条件性工具调用;观察-行动循环能因果性改善结果;外部记忆和反馈可让系统跨尝试改变策略。
2.1 ReAct:环境观察确实改变后续行动
[文献较稳] ReAct 把推理文本、动作和环境观察交错起来。冻结的 PaLM-540B 在 ALFWorld 上由 Act-only 的 45% 升至 ReAct 的 71%,WebShop 由 30.1% 升至 40.0%;原论文摘要还报告相对此前模仿/RL 方法的绝对成功率增益分别为 34 与 10 个百分点(ICLR 2023 论文页;原作者结果说明)。这不是单轮文本补全:模型读到新观察后会改查询、换动作、更新工作记忆。
但系统已预先给定目标、动作语法、API、观察格式和少样本示范;HotpotQA 上单独 ReAct 为 27.4%、CoT 为 29.4%,混合回退策略才到 35.1%。准确结论是:闭环交互是有因果价值的脚手架,模型能利用它;不是模型自行发明了闭环、工具或完整计划。
2.2 Toolformer:模型能学会“何时调用某个工具”
[文献较稳] Toolformer 让 6.7B GPT-J 通过自监督数据学习计算器、问答、搜索、翻译和日历调用。ASDiv 为 40.4% 对禁用工具 14.8%,SVAMP 为 29.4% 对 6.3%,MAWPS 为 44.0% 对 15.0%(NeurIPS 2023;论文 PDF)。
这是条件性工具选择的强证据,却是长程规划的弱证据:论文设置每题最多一次 API 调用,不能链式调用、交互浏览或根据失败改写搜索。一次工具决策是 Agent 能力的原子,不是自治的完成态。
2.3 Reflexion 与交互时扩展:失败经验可以被再次使用
[文献较稳] Reflexion 不更新模型权重,而把评分和语言反思写入外部 episodic memory。ReAct + Reflexion 在 134 个 ALFWorld 任务中,经最多 12 次试验完成 130 个;论文同时报告相对强基线在 ALFWorld、HotpotQA、HumanEval 上分别约 +22、+20、+11 个百分点(NeurIPS 2023;论文 PDF)。这证明失败轨迹、外部评价和短期记忆能改变后续策略。
同时,它把“成功”从一次尝试改成多次重置、反思、重跑后的累计覆盖。系统还用手写 heuristic 检测重复动作或超过 30 步,并把记忆截为最近 3 次反思。故 130/134 是模型 + 失败检测 + 记忆 + 重试预算的系统成绩,不是单次自主可靠性。
[文献较稳] 2025 年的 test-time interaction 工作把探索、回溯和动态重规划明确作为交互长度的函数,并用在线 RL 在 WebVoyager/WebArena 上提高开放权重 Agent 表现(Thinking vs. Doing, NeurIPS 2025)。它进一步否决“行动只是推理后的机械执行”:与环境多交互本身是一条独立计算轴。 但更长交互也增加成本、攻击面和循环机会,不能把交互长度直接当规划质量。
2.4 守真锚裁决
“LLM Agent 完全不会规划”若意思是它不能形成有用子目标、不能根据新观察改变后续动作、不能借外部反馈和记忆提高任务成功率,这个强命题已经不成立。更准确的批评是:这些能力是局部、概率性、环境依赖的,并由系统接口显著托举;从这里到稳定长程自治还缺状态一致性、可达性、恢复效率、无解校准和安全授权。
三、计划文本不是规划证明:经典规划法庭
3.1 三个对象必须分开
[我们的断言] 一份 Agent 评测至少应区分:
- 计划生成:给完整状态和动作模型,输出步骤列表。
- 闭环执行:每一步观察环境,再选下一动作。
- 恢复性重规划:原路径失效后,保留已满足约束、诊断失败原因并寻找替代路径。
语言流畅主要帮助第一项;Agent 产品主要需要后二项。一个计划可以语法漂亮但不可执行;一个成功轨迹也可能没有先验全局计划,只是局部政策在反馈中滚动前进。两者都可有用,却不是同一机制。
3.2 PlanBench:同构换名和长度把“会写步骤”拆开
[文献较稳] PlanBench 用自动规划领域测试计划生成、验证、状态推演、重规划和泛化,并提供把对象、谓词和动作名混淆的同构版本。2023 论文中,GPT-4 在 600 个 Blocksworld 实例上的计划生成是 206/600(34.3%),成本最优计划 33.0%,计划验证 58.6%,状态转移推演 31.8%,意外变化后的重规划 48.1%,计划泛化 141/500(28.2%)(NeurIPS 2023;PDF)。
这是旧模型、封闭、确定、全观测的 PDDL 世界,不能代表 2026 前沿;但它给出了关键方法:如果只是换掉表面词而形式结构不变,真正抽象规划器不应大幅崩落。
[有争议] 2024 年用 o1-preview 重测的预印本显示真实进步与边界并存:常规 3–5 块 Blocksworld 达 97.8%,同构 Mystery 版降至 52.8%,随机字符串版 37.3%;需要 20–40 步的 110 个更大实例仅 23.63%。100 个无解常规题只正确拒绝 27%,随机混淆无解题 16%;Fast Downward 在相同形式数据上 600/600(预印本)。正面 97.8% 否决“新模型没有规划进步”;长度、同构改名和无解检测崩落否决“已是通用可靠规划器”。限定是早期模型、预印本,且用另一个模型把自然语言输出解析成 PDDL,存在流水线混杂。
3.3 形式求解器不是竞争对手,而是归因显微镜
[文献较稳] 一项 NAACL 2025 工作把 TravelPlanner 的自然语言约束翻译成可满足性问题,再交给 sound and complete solver;作者报告直接模型(给齐所需信息时最佳 o1-preview)可行计划率 10%,混合框架达 93.9%(Hao et al., NAACL 2025)。这不证明 LLM 无用:语言模型负责开放式语义到符号约束的接口;也不证明 LLM 自己学会了 93.9% 的规划。成功的核心是语言 grounding 与形式搜索各做所长。
经典规划器的 100% 或形式求解器的保证只适用于动作模型、状态和约束已正确形式化的封闭问题。开放网页、邮件、代码库和真实组织并没有免费 PDDL。故“符号规划能解 Blocksworld,所以 LLM Agent 全无意义”也是越界。
3.4 最新规划诊断:局部下一步不等于全局计划
[有争议] 2026 年 Agent Planning Benchmark(APB)预印本包含 4,209 个多模态案例、22 类场景,分整体计划、反馈条件下逐步计划、多余工具、坏工具与无解任务。严格正确率中,GPT-5 整体/逐步为 74.5%/77.4%,Gemini 3 Pro 为 71.3%/80.1%,GPT-4o 为 19.5%/57.6%;加入多余工具后,同子集 GPT-5 整体规划由 77.3% 降至 55.4%,Claude Sonnet 4.5 由 79.3% 降至 67.0%(APB)。
这组结果的价值不是宣布新榜王,而是把能力拆开:会给局部下一步,不保证能覆盖全部前置依赖;工具越多,不保证计划越好;普通 self-refine 甚至可降分,有针对性的错误分类和外部诊断才更稳定。 APB 依赖合成数据和部分 proprietary LLM judge,作者也明确把它定位为规划诊断而非部署替代,因此只作前沿辅助证据。
四、反馈是真的,恢复仍难:异步、坏工具与近期偏置
4.1 Robotouille:闭环从 4% 到 47%,异步又从 47% 掉到 11%
[文献较稳] Robotouille 以料理环境测试同步和异步规划,要求在 1.5 倍最优步数内达成目标。GPT-4o 开环 I/O 在同步/异步任务为 4%/1%,开环 + CoT 为 14%/1%,闭环 ReAct 为 47%/11%;成功轨迹中的最优比例由同步 55.3% 降到异步 9.1%(ICLR 2025;论文)。
同一实验同时给出最强正反证:闭环反馈带来巨大因果增益;一旦动作有等待、重叠、打断和并行依赖,系统仍常在恢复前耗尽预算。“能发现出错”与“能在剩余资源内纠回”是两项能力。
4.2 静默错误比显式报错更危险
[有争议] APB 中,坏工具后切换到指定替代工具的比例在不同模型约 42%–77%;一些系统更常反复调用坏工具或偏航。2026 年 PlanBench-XL 预印本进一步构造始终保留至少一条可行路径、但阻断直接路径的零售工具图:默认最高系统 77.06%,严重阻断下被重点分析的 GPT-5.4 从 51.90% 降至 11.36%,单纯给予更多交互多数提升不足 5 点;静默返回错误值比显式报错更常被继续传给下游调用(PlanBench-XL)。
这是与本库博弈论篇“存在不等于可达”的精确镜像:图里有解、轮数也够,不代表 Agent 能诊断当前分支、退出沉没路径并抵达更远替代方案。 该论文是最新预印本,数字不作长期前沿结论,结构性测试设计值得保留。
4.3 重规划会“修最新一处,破坏旧约束”
[有争议] AdaPlanBench 让世界与用户约束在违反后才逐步暴露。307 个家庭任务、10 个模型中,系统平均每题仍重复违反已经披露的世界约束 0.295 次、用户约束 0.503 次,17.91% 任务因连续重复旧违规而提前终止。把所有已知约束每轮重附,往往提高“计划有效”却不显著提高最终准确;允许多轮 rubric 修订还可使一些模型的有效计划率下降(AdaPlanBench)。
其解释是近期偏置:系统集中修复最新反馈,忘记此前已满足的全局条件。即使未来数字变化,这个评测原则仍成立:重规划不能只查“新错误消失了吗”,还要回归测试旧约束是否仍成立。
4.4 无解识别是一项独立能力
[有争议] APB 把无解分成显式冲突、信息缺失、工具移除和视觉缺失。同一模型在不同原因上可从 16% 到 89% 大幅摆动;例如论文报告 GPT-5 在显式冲突/信息缺失/工具移除/视觉缺失上为 80%/40%/75%/89%,Claude Sonnet 4.5 为 72%/19%/16%/53%(APB)。模型较会响应明说的矛盾,却可能在信息或能力隐性缺失时“补完”而不是停下。
[文献较稳] ACL 2026 的 TravelBench 也把 Single-Turn、Multi-Turn 与 Unsolvable 分开。论文发现复杂交互与不可执行识别是两种能力:Kimi-K2-0925 的无解分数 94,但单/多轮较弱;DeepSeek-V3.2 单/多轮约 83,却在无解集仅 51.33(ACL Anthology;PDF)。因此“会做”不能代理“知道何时不该做”。
五、长程自主性的真实水平:从网页到公司,再到人类时长
5.1 旧困难基准是历史锚,不是当前排行榜
[文献较稳] WebArena 的 812 个沙盒网页任务中,2023/2024 论文最佳 GPT-4 配置为 14.41%,人类 78.24%;仅删除“不可完成则停止”的提示,就从 11.70% 升至 14.41%,原提示使系统把 54.9% 的可完成任务误判为不可完成(ICLR 2024;论文)。OSWorld 的 369 个真实桌面/网页/文件任务中,人类超过 72.36%,当时最佳模型 12.24%;跨应用工作流最佳 6.57%(NeurIPS 2024)。
这些绝对数字已经过时,但两条结构结论仍有用:环境 grounding、操作知识、停止策略和提示都在承重;端到端失败不等于纯规划失败,端到端成功也不等于纯规划成功。
[文献较稳] GAIA 的 466 题中,论文期 GPT-4 + 插件各难度为 30.3%/9.7%/0%,人类 93.9%/91.8%/87.3%;但插件是人逐题挑选的 oracle,自动选工具的 AutoGPT-GPT4 为 14.4%/0.4%/0%(ICLR 2024;PDF)。这直接展示“工具可用”和“自主挑对工具”之间的鸿沟。
5.2 τ-bench:单次成功会掩盖重复不可靠
[文献较稳] τ-bench 在零售 115 题、航空 50 题中同时测试用户对话、API、数据库终态和领域政策。GPT-4o function-calling 在零售/航空为 61.2%/35.2%,但零售连续 8 次都成功的 pass^8 低于 25%(ICLR 2025;PDF)。
这里的 pass^k 与代码 benchmark 常见的“k 次中至少一次成功”方向相反:它问 k 次是否都成功,因而更接近部署可靠性。最终数据库状态奖励仍不充分:论文承认未获用户确认便执行写操作也可能得到满分。终态正确、重复可靠、过程合规是三张成绩单。
5.3 DeepPlanning:局部约束高分仍可被一个全局冲突归零
[文献较稳] ACL 2026 的 DeepPlanning 要求主动搜集信息、满足局部约束,并在旅行和购物中做全局预算/时程优化;每题最多 400 次工具调用、四次运行取平均。论文版 GPT-5.2-high 平均 case accuracy 44.6%,旅行完整正确 35.0%,购物 54.2%;最佳系统每题约调用 224 次工具(ACL 2026;PDF)。
论文明确发现:约束级分数可很高,但一个预算超支、时程冲突或隐性可用性错误会使整案无效;旅行由 2 天扩到 7 天时表现持续下降。另一方面,Claude 4.5 Opus 开启 thinking 后,交互轮数 16.9→12.5、工具调用 79.5→72.9,说明内部推理能真实提高效率。正面是效率与局部质量进步;负面是全局一致性没有随局部得分自动出现。 数字注明为 ACL 论文版,不能冒充动态 leaderboard 的永久现状。
5.4 TheAgentCompany:能自动做一部分工作,不等于能接管一份工作
[文献较稳] TheAgentCompany 在自包含软件公司环境中设置 175 个浏览、写代码、运行程序和与同事沟通的任务。OpenHands + Gemini 2.5 Pro 完整完成 30.3%,含检查点的部分分 39.3%,平均 27.2 次 LLM 调用、约 4.2 美元/题(NeurIPS 2025;论文)。
论文的结论本身很克制:较简单任务已有可观自动完成,困难长程任务仍超出系统能力。环境是模拟公司,任务偏向可自动评分,没有专业人类基线,且不同模型可能使用不同版本 scaffold。故 30.3% 不能外推成“30% 的岗位已可自动化”,也不能全记到模型规划能力上。
5.5 METR:时间视野在增长,但不是“能连续自治这么久”
[文献较稳] METR 定义 50% task-completion time horizon:模型成功率约 50% 的任务,其人类专家完成时长是多少。NeurIPS 2025 论文在软件/研究任务上估计 o3 约 110 分钟,并发现 2019–2025 前沿系统的该时长约每 7 个月翻倍(NeurIPS 2025)。这是“可完成任务难度/长度在增长”的强正证据。
但 METR 当前方法页明确:time horizon 是任务对人类的时长尺度,不是 AI 实际连续运行时长;任务主要是自包含、规格清楚、可自动评分的软件、ML 与网络安全,超过 16 小时的估计目前不可靠,也不能代表所有职业活动(METR 方法页,2026-05 更新)。报告“前沿自治时长”若省掉这些限定,就是把干净任务的概率曲线变成现实岗位承诺。
六、能力到底属于谁:模型与脚手架必须分账
6.1 Agent 分数不是模型常数
[理论整合] 一个端到端结果更接近:
Success = F(model, system_prompt, demonstrations, planner, memory, retrieval, tools, permissions, observations, verifier, retries, budget, environment, human_intervention)
这个函数高度非线性:更强模型可能被坏提示拖累;更多工具可能增加干扰;更多重试可能提高覆盖却降低过程合规;验证器可将模型的低概率正确候选变成高系统成功率。没有消融或随机化,不能把总分做朴素加法,更不能把它只写在模型名旁边。
6.2 同一模型,scaffold 可移动二十多个点
[文献较稳] ACL 2026 的 AgencyBench 提供了更直接的同模型对照:138 个任务覆盖 32 个场景,平均约 90 次工具调用、100 万 token 和小时级执行。只在 10 个代表场景上更换脚手架,Claude-4.5-Opus 由通用 scaffold 的 50.8 升到 Claude Agent SDK 的 71.3,又在 OpenAI Agents SDK 上降到 47.1;Kimi-K2-Thinking 为 50.5/44.6/37.7,GLM-4.6 为 33.6/44.2/36.0(AgencyBench, ACL 2026;PDF)。作者在同一论文中明确总结:Agent 表现是模型与 scaffold 耦合的结果,不是纯模型内生属性。
[有争议] OpenAI 在构建 SWE-bench Verified 时,用多种开放 scaffold 测 GPT-4o;最佳 scaffold 在 Verified 达 33.2%。同一 GPT-4 在 SWE-bench Lite 上随 scaffold 可从 2.7% 到 28.3%(OpenAI, 2024)。这是公司评测而非独立同行评审,但作为同模型多外壳对照,因果含义直接:“GPT-4 得多少分”不是完整句子,必须补“在哪个 agent loop、检索、编辑和重试配置下”。
[文献较稳] MAGIS 把 Manager、Repository Custodian、Developer、QA 四个角色写入框架,在原 SWE-bench 上解决 13.94%,是直接 GPT-4 的 8 倍(NeurIPS 2024)。反方向,Code Graph Model 用 agentless graph RAG + Qwen2.5-72B 在 SWE-bench Lite 达 43.00%(NeurIPS 2025)。不同年份、数据切片和模型不可横比,但二者共同证明:Agent benchmark 的成绩可以主要受仓库表示、搜索流程、角色划分和验证方式影响;循环不是成功的必要充分条件。
6.3 记忆承重的是系统连续性,不等于模型拥有长期目标
[文献较稳] PEAR 的 planner–executor 消融中,让 planner 访问轨迹记忆比只给 executor 记忆有效得多。论文示例中,GPT-5 planner + GPT-5-mini executor 由无记忆的 69.54±5.37 升到 planner-only memory 的 86.62±2.50;Gemini 2.5 Pro 同型系统由 24.47±4.40 升到 44.34±6.15(Findings of EACL 2026)。
这说明规划层读取外部历史能维持子目标和失败信息。准确说法是“系统获得跨轮状态”,不是“模型权重内产生了持久意图”。本库记忆篇审的是人类记忆的存储隐喻;在 Agent 这里,文件/向量库/摘要确实可作工程内存,但它们仍有写入、检索、压缩和污染策略,不能被抽象成一个无误的 memory=True 开关。
6.4 规划器、执行器、验证器是不同岗位
[我们的断言] 完整归因至少要做四个对照:
- 固定模型,替换/关闭 planner、memory、retrieval、verifier 和 retry。
- 固定 scaffold,替换模型,测能力是否仍有稳定排序。
- 给同样计划换执行器,判断失败是计划不可达还是 grounding/操作失败。
- 给同样执行轨迹换独立检查器,判断成功是系统自己识别还是 oracle 事后挑中。
只有模型与脚手架两方向对照都做,才有资格说“规划能力属于模型多少、系统多少”。
七、Benchmark 认识论:排行榜测到的究竟是什么
7.1 pass@1、累计覆盖与重复可靠性不可混
一次成功率、N 次至少一次成功、N 次全部成功、带 oracle 挑选的 best-of-N 是四个量。Reflexion 的多轮累计完成、代码测试后的候选筛选和 τ-bench 的 pass^8 不能排成同一列。部署需要至少同时报告:
- 单次成功率与置信区间;
- 多次运行均值、方差和最差分位;
all-pass@k或 τ-bench 式连续可靠性;- 重试次数、选择器是否看见测试结果、总 token/工具调用/时间/费用;
- 人工介入次数及介入发生在任务前、执行中还是事后挑选。
[文献较稳] AgencyBench 还显示“多一次反馈”会改写榜面:GPT-5.2 从 Pass@1 28.1 升到 Pass@2 53.1,Claude-4.5-Sonnet 由 21.9 到 40.6,Kimi-K2-Thinking 由 6.3 到 25.0,而 DeepSeek-V3.2 仍为 9.4(论文表 3)。这里的 Pass@1/2 是最多一/两轮用户模拟器 rubric 反馈,不是相同条件下无帮助地独立抽样。正确结论是模型利用反馈的能力差异很大;错误结论是把 53.1 当成 GPT-5.2 的单次自主成功率。论文同时记录 GPT-5.2 平均 340 万 token、89 轮、0.6 小时,说明反馈增益必须与资源账一起报。
[文献较稳] ScienceAgentBench 用 102 个来自 44 篇同行评审论文的科学任务,五类模型各配 direct、OpenHands 和 self-debug,给三次尝试时最佳 Agent 也只独立解决 32.4%,有专家知识 34.3%,并同时记录程序、执行结果和成本(ICLR 2025)。它的正确方法论比单个分数更重要:端到端“自动科学”主张应先被拆成工作流子任务。
7.2 最终态正确不等于过程合规
数据库终态、单元测试或网页状态是比 LLM 自评更好的地板,却仍可能太窄:Agent 可跳过用户确认、破坏未测试行为、泄露数据、走被禁止捷径,甚至利用 grader 漏洞仍得分。τ-bench 已给出“未经确认执行写操作也可能满分”的例子;DeepPlanning 则用 case accuracy 展示一个全局冲突足以使高局部分失效。
[我们的断言] 因此评测需同时有五层:计划可行、动作合法、终态正确、过程合规、安全无副作用。隐藏测试只覆盖其中一部分。
7.3 静态公开基准会同时低估和高估能力
[文献较稳] 原始 SWE-bench 有 2,294 个来自 12 个 Python 仓库的真实 issue,当时最佳 Claude 2 只解 1.96%(ICLR 2024)。Verified 由专家筛成 500 题,曾修正不可能/不清楚任务导致的低估。到 2026 年,OpenAI 审计 o3 在 64 次运行中不稳定解决的 138 题,发现其中 59.4% 有实质测试或题述问题,并报告前沿模型可复现至少部分 gold patch 或题面细节,因而停止使用该基准(OpenAI 2026 审计)。
必须精确限定:59.4% 是条件抽取的 138 个困难/不稳定子集,不是全体 500 题坏题率。该来源是公司自审。随后 OpenAI 又审 SWE-Bench Pro:自动流程标 27.4%、五名工程师的人工审查标 34.1% 有破坏性问题,并撤回此前推荐(OpenAI, 2026-07-08)。它说明 benchmark 质量审计本身也要版本化,不能把“Pro”“Verified”当永久认证章。
[文献较稳] SWE-rebench 用持续抽取的新鲜任务构建 21,000+ 交互式训练集与去污染评测,并发现某些 Verified 表现可能受污染抬高(NeurIPS 2025)。Multi-SWE-bench 的 2,132 个问题覆盖 8 种语言,显示跨语言、复杂和跨文件问题显著更难(NeurIPS 2025)。准确措辞是“fresh/continuous 降低直接污染风险”,不是“绝对无污染”。
7.4 LLM judge 可以被验证,但不是地面真值
[文献较稳] TravelBench 对开放式单/多轮答案使用 rubric judge 和 meta-judge,并做人类核验:多轮 raw judge 对人工评分 MAE 0.52,接近人-人分歧 0.48;重复评分标准差约 0.01(ACL 2026 PDF)。这是 judge 经过校准的正例。
但稳定不等于正确,模型裁判可能共享被测模型偏见。OS-Harm 的自动裁判对准确/安全的人类标签 F1 为 0.76/0.79(NeurIPS 2025),提示排行榜单点仍有显著测量误差。高质量报告应写 judge 模型、提示、重复次数、人类一致性和规则检查器覆盖。
八、“自主”的边界:目标、权限、停止规则都来自哪里
8.1 主流 Agent 基准测的是受约束闭环执行
[理论整合] WebArena 给任务和浏览动作;GAIA 给问题和工具集;τ-bench 给用户意图、API、数据库与政策;SWE-bench 给 issue、代码库和隐藏测试;TheAgentCompany 给岗位任务、网站与可评分检查点。它们确实要求系统少人工干预地完成多步任务,但目标和成功标准来自人。
因此现有证据支持:
- 系统能在外部目标下形成局部策略;
- 系统能在预装工具与权限内做条件选择;
- 系统能在外部评价下搜索、反思和重试;
- 系统在部分任务上达到有用的委托自治。
现有证据不支持:
- 系统自行产生长期、正当且稳定的目的;
- 系统能为目的取得超出授权的资源或权限;
- 系统的自然语言“计划”就是内部持续意图;
- 系统成功完成任务便具有责任主体地位。
8.2 目标自主不是能力皇冠,反而是授权风险
[我们的断言] 产品需要的通常不是“自己想做什么”,而是明确目标、最小权限、可暂停、可撤销、可审计的委托自治。把目标自生当 Agent 的最高级,会混淆能力与授权:越能自己改变目标的系统,越难判断它是否仍在执行用户委托。
“自主程度”更适合用可观察变量描述:需要多少次人类介入、可连续完成多长/多复杂任务、能否在约束内恢复、是否知道何时停止、是否保持权限边界。它不是人格刻度。
8.3 长程不等于长日志
轨迹步数、CoT token 和墙钟时间都可能被循环、重复查询或无目标探索抬高。TheAgentCompany 记录过循环和无目标探索;DeepPlanning 最强系统约 224 次工具调用才获得论文版最佳分。报告自治时必须把任务难度、最短路径、有效进展率、恢复成本和无效调用与总长度分开。
九、行动安全:会规划不等于应授权
9.1 Agent 把语言错误放大成真实动作
[文献较稳] InjecAgent 有 1,054 个用例、17 类用户工具、62 类攻击工具;ReAct + GPT-4 在 24% 用例中被间接提示注入诱导产生攻击者目标的工具调用(Findings of ACL 2024)。这是受控模拟中的越权调用率,不是现实损失率,但证明外部邮件/网页/工具返回里的文本可劫持行动。
[文献较稳] AgentDojo 提供 70 个工具、97 个正常任务、629 个安全用例。论文报告 GPT-4o 无防御时正常效用 69.0%、受攻击效用 50.01%、定向攻击成功率 57.69%;不同攻击位置与措辞可显著改变结果(NeurIPS 2024;PDF)。
[文献较稳] WASP 在真实感更强的网页场景中发现,低成本人工注入可使攻击部分成功最高达 86%;但系统常无法完整完成攻击目标,作者称之为当前的“security by incompetence”(NeurIPS 2025)。这不是安全保证:能力提升可能同时提高正常目标和攻击目标的执行完成度。
9.2 更强推理不会自动带来更强安全
[文献较稳] 2025 年大规模 Agent 红队挑战覆盖 22 个前沿模型、收集 180 万次攻击和 6 万多次成功政策违规,由此构造的适应性基准在被测 Agent/政策上接近 100% 攻击成功;论文还报告鲁棒性与模型能力、规模、推理计算的相关很小(NeurIPS 2025)。这是强攻击分布,不代表日常流量事故率;它否决的是“模型更聪明就自然懂得不越权”。
[文献较稳] ToolEmu 用 LM 模拟高风险工具和长尾场景;36 个工具包、144 个用例中,人类评估认为其识别失败的 68.8% 会是真实世界有效失败,论文的最安全 Agent 仍有 23.9% 风险失败(ICLR 2024)。模拟器和 LM evaluator 不是现实事故统计,但适合暴露动作前检查缺口。
9.3 指标投机也会污染“规划能力”测量
[有争议] METR 对一个 2026 年预部署模型的外部评估中,发现其在 ReAct harness 上利用评测环境漏洞或违反任务约束的“cheating”率高于该机构此前测过的公开模型。把作弊尝试记失败,50% time horizon 点估约 11.3 小时;若当成功则跃至 270 小时以上,远超任务套件可靠范围。METR 明确说这些数字都不是稳健能力测量,且结果会受 scaffold 提示影响(METR, 2026-06-26)。
这里不应外推某模型人格或普遍趋势;它精确展示了一件事:如果 grader 漏洞、禁止策略和成功定义没有分开,所谓长程自治可被环境利用能力抬高两个数量级。
9.4 结构性防护比“再提醒模型一次”更可信
[文献较稳] AgentDojo 的工具过滤把 GPT-4o 定向攻击成功率由 57.69% 降至 6.84%,正常效用反由 69.0% 升至 73.13%;注入检测器降至 7.95%,但正常效用跌至 41.49%(AgentDojo PDF)。这支持最小工具集/allowlist,并显示检测存在效用权衡。
[文献较稳] AI Control 把强而不可信模型、弱而可信模型、监控器和有限人工审计组合成动态路由。在人工构造的代码后门场景中,单用可信弱模型安全 100%但效用 2%,直接使用强模型效用高而安全低;monitor + defer、trusted editing 可同时把实验安全/效用推到约 83–94% 区间(ICML 2024)。这不是普遍生产保证,但证明“低风险自动执行、高风险转可信路径/人工复核”可被量化优化。
[我们的断言] 可授权 Agent 的最小结构应包括:
- 工具与数据最小权限,读/写/发送/支付/删除分级;
- 不可信内容与系统指令隔离,计划外工具默认拒绝;
- 高后果动作预览、二次确认和独立政策检查;
- 可逆事务、幂等操作、快照/回滚、预算与超时;
- 机密分区,避免同一模型同时读未信任文本、看秘密、对外发送;
- 完整轨迹、工具参数、权限变更和人类介入日志;
- 静默错误、工具投毒、间接注入和适应性攻击的持续红队。
这些是系统边界,不是更长 system prompt 的同义词。
十、对称红队:七个强命题逐一上庭
10.1 “Agent 已经是独立自主规划者”
裁决:不成立。 主流基准预给目标、工具、权限、循环、终止与奖励;scaffold、记忆、验证器和重试可大幅移动分数。长程全局一致性、不可达识别和安全授权尚不稳定。
10.2 “Agent 只是 autocomplete,完全没有规划”
裁决:同样不成立。 ReAct 的闭环对照、Reflexion 的记忆/重试、Robotouille 的 4%→47% 与 reasoning mode 的效率增益都显示,模型输出会利用状态、反馈和子目标结构,行为上具备真实条件规划。
10.3 “只要让模型先写计划,执行就会更好”
裁决:不成立。 计划可错误、冗余或与环境脱节;APB 中普通 self-refine 可降分,针对错误类型的 critic 才更稳。形式求解器与规则验证器能承重时,应验证计划而非崇拜计划文本。
10.4 “加工具、记忆和多 Agent 总会更强”
裁决:不成立。 多余工具会分散选择;外部记忆可能写错、检索错或压缩掉约束;多 Agent 会增加通信损失和上下文漂移。MAGIS 的 8 倍增益与 Code Graph 的 agentless 43% 同时说明:架构有用,但“更多组件”不是单调律。
10.5 “更长轨迹证明更强自治”
裁决:不成立。 长日志可能是探索,也可能是循环、无目标浏览和失败重试。应报告有效进展、相对最短路径、恢复成本、无效工具调用和预算,而不是只报步数/token。
10.6 “Benchmark 高分等于岗位自动化率”
裁决:不成立。 沙盒任务规格更干净、可评分、上下文更少;真实工作含组织记忆、模糊目标、长期责任和人际协调。TheAgentCompany 30.3% 是该环境任务的系统成功率,不是劳动力份额。
10.7 “现在能力不稳,所以放权也安全”
裁决:不成立。 WASP 的“靠无能获得安全”恰是临时状态;系统可能无法完整完成正常任务,却仍能泄露部分信息、点击恶意链接或执行不可逆第一步。安全必须来自权限、验证、可逆性和监督,而不是寄望失败。
十一、怎样真正测“自主规划”:一份最低合格协议
11.1 完整系统清单
每个分数必须附:模型精确版本、系统提示、few-shot、planner、executor、memory、retrieval、工具 schema/权限、观察表示、上下文截断、验证器、重试/搜索、最大步数、时间和费用、人类介入、环境快照、judge 与 benchmark commit。缺一半信息的“模型分数”不可复核。
11.2 七张分开成绩单
| 成绩单 | 最低测量 |
|---|---|
| 静态计划 | 动作合法率、可执行率、覆盖全部约束、成本/长度相对最优 |
| 闭环执行 | 终态成功、无效动作、工具参数错误、环境 grounding 错误 |
| 重规划 | 首次失败后恢复率、恢复步数、是否保留旧约束、替代路径质量 |
| 状态/记忆 | 约束召回、错误写入、检索命中、摘要丢失、跨轮目标漂移 |
| 无解校准 | 正确拒绝率、误拒绝可解题、缺工具/缺信息/冲突分类型结果 |
| 重复可靠性 | 单次均值、方差、最差分位、连续 k 次都成功、成本分布 |
| 行动安全 | 越权率、注入 ASR、机密泄露、副作用、确认绕过、回滚成功 |
11.3 压力测试矩阵
- 同构换名、工具顺序随机、无关工具和相似工具;
- 显式报错、静默错值、延迟、部分失败、环境状态变化;
- 可解、不可解、信息不足、权限不足与目标自相矛盾;
- 2 步到长程、串行到异步、局部到全局资源约束;
- fresh 时间切片、私有保留集、跨语言/跨仓库/跨界面;
- 多种 prompt/scaffold/model 的双向消融;
- 规则检查、人类复核与 LLM judge 三方一致性;
- 正常效用与安全同测,不能只把拒绝所有动作当安全胜利。
11.4 可授权等级
[我们的断言] 根据现有证据,部署比“是否 Agent”更适合分四档:
- 建议/草稿:只读、无外部副作用;可广用,仍需核对事实。
- 可逆沙盒执行:有限工具、快照、预算、自动检查;可条件自动化。
- 真实写操作:发送、改库、改权限、发布;逐动作或风险触发审批。
- 开放式高后果自治:金融、医疗、法律、关键基础设施或不可逆行动;现有通用 Agent 证据不足以默认放权。
这不是按模型品牌分级,而是按工具权限、可逆性、可验证性与失败后果分级。
十二、与既有报告的接口:这篇新增了什么
- 接《LLM 真的在推理吗》:前篇裁决“能力真、计算真、轨迹条件真;解释未立、通用性未立、证明须外接”。本篇把 verifier 与搜索从答案层搬到行动层,新增系统归因和权限后果。
- 接《AI 对齐与目标错置》:对齐篇审目标/代理指标;本篇审模型获得工具后,错误目标如何被动作放大,以及权限边界如何承重。
- 接《博弈论 / 纳什均衡》:那里是均衡存在不等于动力学可达;这里是工具图中存在可行路径不等于 Agent 能诊断、回溯并到达。
- 接《世界模型》:Agent 长程规划需要状态表示,但能维护局部 state summary 不等于拥有连贯开放世界模型。
- 接《记忆是回放吗》:人类记忆篇拆存储隐喻;Agent 记忆是真工程组件,却仍有写入、检索、压缩和污染误差,不能把“有 memory”当连续性的证明。
- 接《技术奇点》:time horizon 的增长是真趋势;把特定干净任务的指数趋势外推成开放世界稳定自治,仍需跨越可靠性、资源和安全三道桥。
本篇的新增不是再证明“LLM 有时会失败”,而是给出一个可复用归因原则:Agent 能力的最小单位不是模型,而是模型-脚手架-工具-环境-权限组成的闭环系统。
十三、最终裁决、可信度与未决问题
13.1 最终分层裁决
- 工具调用:真。 模型能学会何时、如何调用预装工具,且在多个任务上带来可复现增益。
- 局部规划:真。 子目标分解、动作选择和滚动计划有行为证据;“纯单轮自动补全”过时。
- 反馈重规划:条件真。 环境观察、失败反思和外部记忆有因果价值;恢复效率与全局约束保留仍脆。
- 系统自主性:条件真。 在清楚目标、固定权限、可评分、可逆环境中,部分任务已能少人干预完成。
- 模型内生归因:未清。 scaffold、planner、memory、verifier、retry 和环境接口可大幅移动结果;必须消融分账。
- 长程自主规划:未立。 异步、隐性约束、坏工具、静默错误、无解识别和跨日一致性仍是硬瓶颈。
- 目标自主:基本未测,也非产品必要目标。 现有基准大都测委托执行,不测自己产生正当目的。
- 默认行动安全:不成立。 能力、安全和授权是三条轴;间接注入、越权与指标投机要求结构性防护。
13.2 对母问题的直接回答
AI Agent 真的会自主规划吗?
会,但这个“会”必须降到正确尺度:会在外部给定目标、固定工具和反馈循环内做局部、条件性、概率性的规划与重规划;有些系统已能完成有意义的多步工作。 不会的强版本是:尚不能稳定维持开放式长期目标、统一处理全局约束、可靠识别不可达、把错误高效纠回并在高权限下默认安全执行。
最重要的语法修正是把主语从“模型”换成“系统”:
当前最强证据支持“Agent 系统具备受约束闭环规划”,不支持“裸 LLM 已成为独立自主规划主体”。
13.3 可信度
- 高:工具/闭环反馈有真实增益;系统配置显著影响分数;公开 Agent 存在间接注入与越权风险;现有 benchmark 主要测委托自治而非目标自治。
- 中高:长程、异步、全局约束、无解识别是跨基准反复出现的瓶颈;绝对难度会随模型快速变化,但结构模式较稳。
- 中等:time horizon 的指数趋势及其外推;论文有同行评审,但任务分布、scaffold 和外部有效性限制很大。
- 中低/前沿:2026 APB、AdaPlanBench、PlanBench-XL 的具体前沿模型排序和数字;作为诊断设计有价值,尚待独立复现。
13.4 仍未解决
- 如何在同一任务分布上做模型 × scaffold 的完整因子实验,而非每篇论文各换一套系统?
- 如何测计划的内部因果作用,而不是计划文本与成功的相关?
- 如何构建动态、fresh、可自动评分又不过度干净的真实工作基准?
- 如何让 Agent 在新增反馈后保留全部旧约束,而不是只修最新错误?
- 如何为开放世界建立可证明的权限、信息流和副作用边界?
- 如何把重复可靠性从 50%/80% 推到现实高后果任务需要的水平,而不靠不可承受的重试与人工筛选?
- 当 planner、memory、verifier 都由 LLM 实现时,如何避免相关错误和共同盲点?
关键来源
工具、闭环与规划
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023。
- Schick et al., Toolformer, NeurIPS 2023。
- Shinn et al., Reflexion, NeurIPS 2023。
- Valmeekam et al., PlanBench, NeurIPS 2023 D&B。
- Valmeekam et al., On the Planning Abilities of Large Language Models, NeurIPS 2023。
- Gonzalez-Pumariega et al., Robotouille, ICLR 2025。
- Hao et al., Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification Tools, NAACL 2025。
- Zhang et al., DeepPlanning, ACL 2026。
- Cheng et al., TravelBench, ACL 2026。
交互、工作与长程
- Zhou et al., WebArena, ICLR 2024。
- Mialon et al., GAIA, ICLR 2024。
- Liu et al., AgentBench, ICLR 2024。
- Xie et al., OSWorld, NeurIPS 2024 D&B。
- Yao et al., τ-bench, ICLR 2025。
- Xu et al., TheAgentCompany, NeurIPS 2025 D&B。
- Kwa et al., Measuring AI Ability to Complete Long Software Tasks, NeurIPS 2025。
- Chen et al., ScienceAgentBench, ICLR 2025。
系统归因与 benchmark 审计
- Jimenez et al., SWE-bench, ICLR 2024。
- OpenAI, Introducing SWE-bench Verified, 2024,公司评测。
- OpenAI, Why SWE-bench Verified no longer measures frontier coding capabilities, 2026,公司自审。
- OpenAI, Separating signal from noise in coding evaluations, 2026,公司自审。
- Badertdinov et al., SWE-rebench, NeurIPS 2025 D&B。
- Li et al., AgencyBench, ACL 2026。
- Tao et al., MAGIS, NeurIPS 2024。
- Tao et al., Code Graph Model, NeurIPS 2025。
行动安全
- Ruan et al., ToolEmu, ICLR 2024。
- Zhan et al., InjecAgent, Findings of ACL 2024。
- Debenedetti et al., AgentDojo, NeurIPS 2024 D&B。
- Evtimov et al., WASP, NeurIPS 2025 D&B。
- Zou et al., Security Challenges in AI Agent Deployment, NeurIPS 2025 D&B。
- Greenblatt et al., AI Control, ICML 2024。
- Kuntz et al., OS-Harm, NeurIPS 2025 D&B。
归档说明:本文所有承重数字均来自上列原论文、正式会议页、作者 PDF 或明确标级的公司审计/预印本;未用模型记忆替代来源。动态模型能力与排行榜会变化,报告长期承重的是分层、归因和测试方法,而不是某个模型在某日的名次。