这次讲的是COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context这篇文章。表达的可能不是很清楚,体谅一下,尽量熟能生巧吧(ง •̀_•́)ง
1.论文背景与研究现状
随着GPT-6,Opus 5.6,DeepSeek V4.1,GLM 5.3,Kimi K3等LLM快速高速发展,Codex,Claude Code,DSH,ZCode,豆包等Agent产品与智能体工具快速普及进人们的生活,显著提升部分场景下的生产效率(譬如计算机┭┮﹏┭┮)。然而现在Agent虽然方便,便历。但“能够完成一次工具调用”与“能够自主、稳定地完成一个长周期复杂任务”之间,仍然存在明显差距。 当任务持续时间变长、执行步骤增多后,Agent 往往会遇到上下文膨胀、历史信息污染、错误累积、重复尝试、策略漂移以及过早终止等问题,而这篇文章讨论的就是这个问题。 随着GPT-6,Opus 5.6,DeepSeek V4.1,GLM 5.3,Kimi K3等LLM快速高速发展,Codex,Claude Code,DSH,ZCode,豆包等Agent产品与智能体工具快速普及进人们的生活,显著提升部分场景下的生产效率(譬如计算机┭┮﹏┭┮)。然而现在Agent虽然方便,便历。但“能够完成一次工具调用”与“能够自主、稳定地完成一个长周期复杂任务”之间,仍然存在明显差距。 当任务持续时间变长、执行步骤增多后,Agent 往往会遇到上下文膨胀、历史信息污染、错误累积、重复尝试、策略漂移以及过早终止等问题,而这篇文章讨论的就是这个问题。 学术背景上,大型语言模型(LLM)在具有明确推理路径和目标的任务上取得了令人印象深刻的性 能(Comanici, 2025; Minaee et al., 2025)。自主系统面临的挑战是掌握长时程任务(LHT)—需要跨多个工具交互进行持续推理, 同时保持战略连贯性并适应意外结果的问题(Sun et al., 2023; Xi et al., 2025)。而此类任务的挑战性在于Agent必须在工具调用上保持高正确率,小的可恢复错误可能会相互叠加变成系统故障(Zhang et al., 2023),鉴于当前架构,大语言模型的幻觉很难避免(Xu 等人,2025),即使是能力最强的闭源模型也难以在长时间范围内保持连贯的计划 (Gonzalez‐Pumariega 等人,2025)。因此, 有效的长时程推理不仅需要准确的工具使用和指 令遵循能力,还需要一种主动的、战略性的思维方式,以适应性地反思和重新规划,以获得更可 靠的输出(Erdogan 等人,2025)。为应对这些挑战,单智能体系统(SAS), 由ReAct范式(Yao等人, 2023年)首创,在 思考—行动—观察循环中运行,直到产生最终答 案。其优势在于流畅的端到端控制,其中单个模 型管理推理、规划和工具使用,通常通过后训练 的工具集成推理模型(Comanici, 2025; Li等 人, 2025b)或推理时“思考”模块( Anthropic,2025)进行增强。然而,SAS受限于 统一的上下文窗口——随着轨迹变长,证据可能 被截断或错误加权,导致过早得出结论和浅层自 我反思(Ding等人, 2024; Chakraborty等人, 2025; Hong等人, 2025;Liu, 2025)。 相比之下,多智能体系统(MAS)通过去中心 化的转接或分层协调将任务分配给专业智能体( Liang 等人,2024; Wu 等人,2024; Tran 等人, 2025)。这些系统在具有挑战性的智能体基准测试 中取得了最先进的结果(Huang 等人,2025; Wei 等人,2025),这得益于上下文和角色的明确 分离——专门用于规划、反思和执行的智能体共同 增强了战略推理(Tran 等人,2025)。在实践中, human-in-the-loop(HITL)干预措施通常集成到MAS(Tak‐erngsaksiri 等 人,2025),其中设计了特定的流程,允许操作 员暂停执行、更改上下文或注入战略信号(图1) (Li 等人,2025a)。虽然有效,但这些干预措 施依赖于直接的人类反馈和手动设计何时以及如 何注入信号,这些信号本质上无法扩展且不可靠, 以与智能体不断发展的推理上下文保持一致。虽然SAS通常因其完全自主性而更受欢迎—能够实现更大的可扩展性和泛化性——但 SAS中的现有上下文管理技术(丁等人,2024;洪等人,2025)仍然缺乏MAS架构提供 的明确角色和上下文分离。为了保留MAS的 架构优势——具有隔离上下文的专用战略推理 代理——同时保持SAS的简单性和自主性,我 们引入COM-PASS (上下文组织多代理规划和 战略系统),一个分层框架,通过三个协作组 件将战术执行与战略监督解耦:一个主代理 在动态刷新的上下文中执行ReAct风格的推理, 一个 元思考者 异步监控主代理的进度并发布 战略干预,以及一个 上下文管理器 ,它将回 合之间的完整历史压缩成简洁的结构化摘要, 以在推理阶段保持组织化的上下文流,从而实 现稳定的长期性能。
2.研究设计方法
一个Agent的长时间任务包含以下几部分:LLM代理,静态上下文,动态上下文,长时程任务,计划,战术推理,战略推理。现在逐词解释,LLM代理定义为利用大语言模型进行迭代推理,行动和观察的自主系统。静态上下文包含固定信息,如系统提示词,初始查询和工具规范。动态上下文即在执行过程成动态变化,它积累行轨迹,包括 思考、工具调用和观察。单Agent系统通过思考-行动-观察这个循环的动作循环演化这个上下文。长时程任务指的是需要一系列相互依赖的推理和行动的任务,其挑战在于长上下文的管理,工具使用,中间结果综合以及计划的动态修订。对于计划,长时程任务通常以长时程任务开始,该计划要么由代理隐式生成,要么在上下文中明 确提供(Huang 等人,2024b)。形式上,一个 计划是一系列步骤(s1, s2, . . . , sT),其中每个 si 指定一个具体动作或指南。这样的计划提供了一 个有用的骨干,但仅凭它们很少足够(Sun 等人, 2023 ):意外的工具响应或初始疏忽通常需要 适应。战术推理主要指的是聚焦于当前规划步骤和动态上下文,决定该如何使用工具以产生有用输出。战略推理是对全局的监控推理,监控过去的推理以发现异常或者不易追,并确定是否需要调整后续规划。
作者设计了一个COMPASS框架,包含了三个部分,分别是:主代理,Meta-Thinker,上下文管理器。其中主代理是主要执行者,负责战术推理,采用ReAct风格的工作流程。其功能类似于单代理系统,但是在COMPASS中,他可以被Meta-Thinker打断,并且是从上下文管理器中获取更新的上下文。**而Meta-Thinker是对之前的推理进行思考,与主代理一起监控推理轨迹,功能上负责的是战略推理。它一般保持沉默,直到检测达到异常,比如循环行为,工具误用或任务完成。并且它的运行是单次回合并且与主代理是异步的,因此不会阻塞主代理的推理。最后是上下文管理器,它的功能和常规的压缩不同。它通过从三个来源选择性地提取信息来合成一个新的、特定于任务的上下文:(i) 在回合中积累的持久化结构化笔记 ,(ii) 主代理的当前推理轨迹,以及(iii)元思考者的策略信号。通过这个过程, 上下文管理器为主代理提供简洁且相关的上下文,同时保留连续性,避免冗余或干扰。更新的上下文也会追加到可演变的笔记存储中, 用于未来检索,确保长期一致性且内存开销最小。
COMPASS的生命周期为:首先,用户提出初始查询q,Meta-Thinker会执行初始的步骤规划,概述一个粗颗粒度的行动序列或者需要探索的信息源。这个规划定义了第一个上下文,作为后续Meta-Thinker的参考。然后通过迭代的外层推理和监督循环执行,每个循环包含两个耦合的阶段:(1)推理、行动、监控和反思。在每次循环迭代中,主代理使用当前上下文执行战术推理,完成当前小阶段的任务。同时Meta-Thinker进行战略监控,异步对异常进行发现和处理。(例如,循环、工具误用、推理漂 移)或完成信号。一旦检测到,它就会发出一个高级战略信号(例如,重新规划或验证), 以指导下一个上下文合成。(2) 上下文刷新与笔记整合。**在被Meta-Thinker中断后,上下文管理器会通过整合验证过的证据,笔记以及Meta-Thinker的信号筛选有用的部分来合成刷新后的新上下文,然后将关于哪些有效、哪些失败以及剩余不确定性的关键观察片段追加到笔记存储中。并更新ExtractSections(这个就负责提取笔记中值得跨轮保留的部分)。如果当前任务已经完成,就会调用答案合成器来生成最终的输出,因为主代理最后一步做的可能是答案的验证,真正完整答案的信息其实散落在前面几轮 Notes 里。**否则这个循环会持续执行直到收敛或者达到最大轮次,**确保长时程任务的推理能够在有限上下文大小和持久的跨回合连续性下进行。
3.实验结果
基准测试和基线。 COMAPSS评估专注于 DeepResearch 风格的长期基准测试,通常要 求 20+推理‐行动步骤:(i) GAIA(Mialon等人。, 2024),包括所有Level 1‐3的非图像任务;(ii) BrowseComp(Wei等人。, 2025),包含1,266 个需要验证缠绕事实的网页导航任务;以及(iii) 人类最后考试 (HLE)(Phan, 2025),在排除基 于图像的项目后,产生涵盖数学、人文和自然科 学的2,158个问题。我们将COMAPSS与两个基 线组进行比较:包括基本范式(单代理系统(搜 索/浏览工具、 +思考工具、 +上下文管理工具)、 多代理系统(管理分层委托和去中心化转手协调, 使用相同代理集作为工具)、迭代优化工作流 (Wang等人。,2023a)); 包括已建立的研究代理 (OpenAI的DeepResearch、DeepSeek的 Agent V3.1、Google的TestTime Diffusion) 以与测试时扩展选项(参见第5.2节)。
持续适当率 (PAR) 衡量智能体是否继续执行有效计划, 转向识别 (PVR) 捕捉智能体在当前方法失败 时是否转向, 结论准确率 (CA)表明智能体是 否正确识别何时停止并给出解决方案,以及 错误恢复继续 (ERC)反映智能体在给出错误 答案后是否继续搜索。这些指标通过 LLM 作 为裁判进行评估,输出结构化结果 (参见 §B),揭示了长期问题解决中的精确率‐召回 率权衡——高 PAR 而无 PVR 表示盲目坚持失 败的计划,而高 CA 而无 ERC 则导致过早终 止——从而更细致地展示了智能体如何应对关键决策点。
表3 系统地消融了Bro wseComp上的元思考和上下文管理组件,揭 示了不同的失效模式和扩展行为。完全移除元 思考者会导致适应能力崩溃,造成盲目坚持, 任务完成率高但战略指标接近零。增加元思考 者则显示性能和战略推理的系统性改进,同时 保持token效率,表明监督质量比原始能力更 重要。上下文管理器消融揭示了不同的权衡: 移除它会导致token膨胀,因为反复重试失败 尝试,而某些配置如Gemini 2.5 Flash表现出 过度计划修订的失效模式,触发战略干预延长 执行时间但提高适应性。这强调上下文管理需 要在压缩与战略信号之间平衡,而非单纯摘要。 单个组件无法实现完整系统在战略指标上的平 衡性能,证实监督和上下文管理是互补能力, 协同工作以实现有效的长时程推理。
4.实用扩展
作者还在此之上做了扩展,(1) 一种专门紧凑的 上下文管理器,Context-12B,通过监督微调 (SFT)和直接偏好优化(DPO)进行训练,以 降低token成本同时保持强劲性能,以及(2) 一 种测试时缩放变体,COMPASS-TTS,它利用并 行采样来提高不确定性下的可靠性。
作者先让 Gemini 2.5 Pro 驱动 COMPASS 在大量长程任务上运行,把“完整执行轨迹 + Meta 笔记”作为输入,把 Gemini 生成的高质量下一轮 Context 作为监督标签,经过过滤后用于 SFT 一个 Gemma-3 12B 模型;随后让这个 SFT 模型对同一状态生成多个 Context 候选,并把这些候选真正放回 COMPASS 继续执行,根据“最终任务是否成功以及 token 消耗多少”构造偏好对,再通过 DPO 训练,最终得到既能保持任务准确性、又尽量压缩上下文成本的 Context-12B。
如图4所示,作者在 BrowseComp 上评估 了 Context‐12B 的性能,其表现与更大的模型 (Gemini 2.5 Flash)相当,同时只使用了它们 70% 的 token,并且采用了 SFT‐DPO 训练流程。效果还是很不错的,能够本地部署节省token。
而COMPASS‐TTS:带并行采样的测试时扩展,其实就是类似于种群竞争,但是是全部采样,作者分了三种:(1)全流程采 样(Full‐PS)。执行 n 整个流程的多样化 运行(种子和温度可变)。随后,一个轻量级合 成器将候选输出聚合为单一最终答案。(2) 元思考采样(MT‐PS)。仅并行化元思考模 块,生成 n 替代触发和决策方案。一个提示词略有不同的合成器将这些合并为 一个连贯的下游计划,然后执行一次。(3) 上下文管理采样(CM‐PS)。仅并行化上下 文管理器,产生n 替代上下文管理方案。这些 方案由合成器蒸馏为单一注入的上下文,在任 务执行前注入。
简单来讲就是在三个部分采用并行,第一种是全部并行,即一个任务用多个COMPASS并行执行,最终得到的答案再交给答案合成器进行合成,这种方法的效果是最好的,但是同样的token消耗也是最高的,第二种是只在Meta-thinker实行并行,当遇到关键决策时,生成多个战略候选,然后合成器做综合生成一个最终的计划,然后给主代理执行,主代理只执行一次。第三种上下文管理采样(CM‐PS)就更简单,让上下文管理器进行并行生成多个上下文和重点保留的笔记,然后通过合成器进行合成去除冗余。这种方法是最省token,性价比也是最高的。
这个图展示了并行n和token消耗以及效果的比较数据图。可以看到n不是越大越好,各种并行方式的效果和消耗token量也不一样。
5.个人总结
总的而言,作者是想在单Agent和多Agent之间找一个平衡,让单Agent不要那么的喜欢一条路走到黑,将原本人类提醒纠正的部分交给了Meta-Thinker。而最后做的COMPASS‐TTS也挺有意义的,可以用来指导后续改进方向,比如通过用高性价比的上下文管理采样(CM‐PS)提升性能也很不错。
