[CVPR 2025 视角] StructuredAgent:通过 AND/OR 树攻克长程 Web 任务的复杂规划

STRUCTUREDAGENT: Planning with AND/OR Trees for Long-Horizon Web Tasks

总结
问题
方法
结果
要点
摘要

本文提出了 StructuredAgent,一种用于处理复杂长程(Long-horizon)Web 任务的分层规划框架。该方法核心在于引入了动态的 AND/OR 树规划机制和结构化记忆模块,通过将复杂任务解构为子目标和替代策略,显著提升了 LLM 智能体在网页浏览任务中的成功率。

TL;DR

在自动驾驶网页的征途中,开发者们发现现有的 LLM Agent 往往是“走一步看一步”的贪婪决策者。StructuredAgent 通过引入经典的 AND/OR 树 (AND/OR Trees) 规划机制,将复杂目标拆解为严密的逻辑树,并配合结构化记忆 (Structured Memory) 实时对比多项约束,在长程、多约束的 Web 任务(如:寻找满足 5 项参数的廉价投影仪)中,成功率显著超越了传统的单路径 Agent。


1. 痛点:为什么 LLM Agent 在长程任务中容易“触礁”?

在 WebArena 或 WebVoyager 等真实网页环境中,任务往往需要数十步交互。现有方法(如 AgentOccam 等)的局限性在于:

  • 贪婪行为 (Greedy Behavior):智能体倾向于选择当前概率最高的动作,缺乏对多种策略(OR 分支)的并行考量。
  • 缺乏错误回溯:一旦某个中间步骤出错,系统往往直接崩溃或陷入死循环,无法像人类一样“换条路试试”。
  • 约束丢失:在浏览了大量 20k+ tokens 的网页后,Agent 极易忘记原始任务中的细节约束(如:必须是不锈钢内胆、价格必须低于 $100)。

2. 核心架构:AND/OR 树的动态进化

StructuredAgent 的核心贡献在于将规划与执行交叉进行。它不仅仅是在生成代码,而是在构建一个动态的逻辑结构。

2.1 节点类型定义

  • AND 节点:表示“且”关系。只有当所有子目标(Sub-goals)都成功,该节点才算成功。
  • OR 节点:表示“或”关系。它代表了备选策略(Strategies),只要其中一个分支成功,整体即可推进。
  • ACTION 节点:叶子节点,代表具体的浏览器操作(如:Click, Type, Scroll)。

2.2 改进型 DFS 搜索

传统的 DFS 是在静态图上搜索,而 StructuredAgent 在 DFS 过程中加入了三种状态管理:ENTERING(进入)、EXITING(退出) 和 FAILED(失败)。这使得框架能够灵活动态地进行 Node Repair(节点修复) 或 Global Tree Update(全局树更新),实现真正的在线修正。

模型架构图 图 1:StructuredAgent 框架概览,展示了 LLM 如何作为控制器与 AND/OR 树管理器交互。


3. 结构化记忆:防遗忘的“Excel 表格”

对于复杂的购物或信息检索任务,作者设计了 Structured Memory。它不同于非结构化的笔记,而是将提取出的约束条件(Constraints)与发现的候选实体(Candidates)组织成动态表格。

结构化记忆示例 图 2:结构化记忆模块如何通过表格形式精准对比不同投影仪方案是否满足 4K、亮度、屏幕赠送等所有约束。


4. 实验结果:统治长程任务

在 Amazon Hard(需要 10-30 步交互的超复杂购物任务)中,StructuredAgent 展现了统治级的表现:

  • 性能飞跃:在 Amazon Hard 任务上,相比 AgentOccam,其成功率提升了 7%-9%(基于不同 LLM Judge 的评估结果)。
  • 效率权衡:虽然 StructuredAgent 的执行轨迹往往比对手长(因为它会系统性地探索备选方案而非快速放弃),但在处理复杂难题时,这种“深思熟虑”是成功的保障。

实验结果对比 表 1:在 Amazon 和 WebVoyager 基准上的成功率对比,StructuredAgent 在 Hard 任务中优势明显。


5. 深度洞察:为什么这很重要?

StructuredAgent 的真正价值在于它提供了一种可解释的 (Interpretable) 规划范式。通过可视化的逻辑树(见图 13),人类开发者可以一眼看出 Agent 是在哪个子目标上出现了偏差,甚至可以手动干预(Human Intervention)来纠正树的分解逻辑。

这种“逻辑归内核,推理归 LLM”的思路,避开了让 LLM 完全掌管全局规划时可能出现的幻觉问题,为解决自动驾驶、企业工作流自动化等高容错要求的任务开辟了新路径。


总结与展望

StructuredAgent 证明了即便在 LLM 时代,经典的规划算法(AND/OR Tree)依然具有强大的生命力。虽然增加的规划步数带来了更高的推理成本,但在复杂场景下的鲁棒性收益是无可替代的。未来的研究方向可能在于如何进一步通过强化学习(RL)来优化 OR 分支的启发式评分,从而在保持成功率的同时,压减搜索的冗余路径。

发现相似论文

试试这些示例

  • 查找最近其他将分层规划 (Hierarchical Planning) 应用于网页自动化或通用 LLM Agent 的研究论文。
  • StructuredAgent 中使用的 AND/OR 树理论起源于哪篇经典的 AI 规划论文,本文在动态环境(如 Web)中对其做了哪些具体改进?
  • 探究 StructuredAgent 的结构化记忆模块如何被扩展到多模态任务或需要高度跨域知识的复杂研究任务中。
目录
[CVPR 2025 视角] StructuredAgent:通过 AND/OR 树攻克长程 Web 任务的复杂规划
1. TL;DR
2. 1. 痛点:为什么 LLM Agent 在长程任务中容易“触礁”?
3. 2. 核心架构:AND/OR 树的动态进化
3.1. 2.1 节点类型定义
3.2. 2.2 改进型 DFS 搜索
4. 3. 结构化记忆:防遗忘的“Excel 表格”
5. 4. 实验结果:统治长程任务
6. 5. 深度洞察:为什么这很重要?
7. 总结与展望