一篇双引擎进化的长程Agents系统性综述

发布时间:2026/7/28 9:10:06
一篇双引擎进化的长程Agents系统性综述 今天分享人大北大清华等联合发表的最新长时程Agent综述这篇149页的综述给出了长时程AgentLong-Horizon Agent的第一个统一形式化定义Agent πθ ⊕ H即”基座策略 ⊕ 运行时Harness”的耦合系统并把整个领域梳理成一条”外化Harness工程×内化模型优化”的双螺旋共演化主线用六个视角串起了从Prompt工程到Harness的完整技术版图。一、概念混战终结者“自我进化Agent”“自主Agent”“长时运行Agent”……这些词在社区里长期混用导致一个问题长时程能力的进步到底该归功于模型还是工程没人说得清。Figure 1 长时程Agent研究全景这篇综述的核心主张是长时程能力不是基座模型单独的属性而是外化Harness工程loops、记忆、工具、编排、Hooks、验证与内化模型优化架构、数据、训练、RL、自进化共演化的产物——Harness机制逐步被内化进策略更强的策略又反过来解锁更高级的Harness。Figure 2 全文分类法全文的分类法也按这条主线展开从演化史、Harness六大组件、优化全生命周期到五大应用形态与前沿开放问题二、Foundation第一次把长时程说清楚2.1 定义看依赖链不看时长论文明确反对用”跑了多久”来定义长时程。真正的判据是任务内部耦合的逻辑依赖一个长时程任务可能一开始就欠规范、需要在求解中逐步澄清解法路径多、子任务深度耦合必须把大量相互依赖的决策组合成一条连贯轨迹才能完成。形式化地长时程Agent被建模为基座策略 πθ 与Harness结构 H 的运行时耦合Agent πθ ⊕ H其中 H 决定模型何时被调用、动作如何被校验执行、什么状态跨步骤持久化整个系统在部分可观环境下运行POMDP奖励稀疏且延迟——这正是长时程信用分配难题的根源。2.2 三级任务 × 三级能力论文用”执行要跨出单个工作上下文多远”作为可操作的分级轴Figure 3 三级任务与能力级别任务形态要求的能力H1上下文内~分钟一个窗口内完成但决策链高度耦合C1上下文内交互式推理行动、吸收反馈、修正轨迹H2跨上下文~小时到天任务远超一个窗口需跨窗口/多Agent接力C2跨上下文状态与记忆压缩外化历史、读写记忆、断点续跑H3跨任务流~终身开放式任务流一个总目标横跨多个任务C3跨任务经验积累沉淀可复用技能、持续变强三者嵌套C1 ⊂ C2 ⊂ C3每级都在前一级之上叠加新的失效模式。2.3 前沿Agent的时间视界正在加速翻倍基于METR截至2026年5月8日的实测数据前沿Agent的50%任务完成时间视界从GPT-2时代的秒级涨到 Claude Opus 4.6 的约12小时、Claude Mythos Preview 的≥16小时——几年内跨了近4个数量级。拟合的翻倍时间约196.5天6.5个月若只看2023年后的新方法论序列翻倍时间缩短到130.8天4.3个月——在加速。Figure 4 前沿Agent时间视界的经验增长2.4 与三个相邻概念划清界限长时程Agent ≠ 长时运行跑批不依赖耦合决策、≠ 自主Agent自主是治理属性长时程是能力属性、≠ 自进化Agent自进化只是服务H3的一种机制。它是三者的交集而非任何一个的子集。Figure 5 与相邻概念的关系三、Evolution控制面三次外扩——Prompt → Context → Runtime论文把领域演进梳理为三个嵌套而非替代的阶段每阶段都由基座模型能力跃迁开启、被新的长时程瓶颈终结Figure 6 三阶段共演化Stage IPrompt Engineering2020–2023。唯一能动的控制面是”查询的语言”。CoT、Zero-shot CoT 证明推理能力是潜藏在权重里的Self-Consistency、Least-to-Most、Plan-and-Solve、ToT 搭出了”分解-规划-执行-修正”的Agent雏形InstructGPT 则完成了第一次”Harness→策略”的能力内化。Stage IIContext Engineering2023–2025。控制面扩大到”模型能看到什么信息”RAGHyDE、RAPTOR、Self-RAG打通外部证据Toolformer、Gorilla、ReAct 打通工具调用MemGPT 等开始管理上下文与记忆。Stage IIIRuntime Harness2025至今。控制对象变成整条轨迹Agent Loop、Hooks、治理机制环绕模型运转长时程Agent才真正登场。Table 1 三阶段对比四、Harness能力外化的六大组件这是全文的”Pillar I”。Harness是让长时执行可规约、可操控、可验证、可恢复的运行时层论文拆成六个组件Figure 7 Agent Harness总览Loops Workflows线性流一条演进轨迹、Plan-Execute显式跟踪与子目标、分支流先评估后承诺maker-checker分离防自评偏差。Context Memory工作上下文的丢弃/压缩/选择 持久记忆的内容与操作——Harness是工作流与状态之间的接口治理者。Figure 8 上下文与记忆Tools, MCP Skills工具接口与协议、主动工具发现、技能库——MCP解决M×N集成问题Skill库让经验以可调用资产沉淀。Orchestration任务分解与角色、协调拓扑、编排优化、Agent间协议A2A等。Figure 9 编排总览Hooks Middleware预定义规则Hook、自定义Hook、运行时自适应Hook不确定度驱动/行为驱动/威胁驱动——从被动执行壳变成主动控制器。Figure 10 Hooks与中间件Verification评估对象正确性/安全/忠实性/多Agent、验证层级步骤级/运行结束级、验证器策略自动标签与奖励、验证器引导搜索、计算最优验证。五、Optimization能力内化的七段流水线“Pillar II”回答Harness脚手架里的能力如何逐步内化进模型权重。论文给出一条完整的Agentic训练流水线Figure 11 Agentic训练流水线架构基座显式上下文、压缩状态、混合架构、高吞吐机制——决定长轨迹能否被表示、训练、低成本解码数据与环境合成任务、环境、轨迹三类合成提供可验证的长时程经验预训练/中训注入推理先验、长上下文状态、多模态感知让Agent行为”原生”而非”提示出来”微调指令选择与混合、课程学习、蒸馏灌输行为与工具使用纪律Agentic RL直面稀疏延迟奖励下的长时程信用分配围绕四个关键问题展开——信用分配、策略优化、采样策略、交互模式Figure 12 Agentic RL四问On-Policy蒸馏在策略自身状态分布上巩固行为减少分布偏移自进化离线自进化生成-过滤-训练、在线自进化实时交互中学习、Agent-环境共进化难度与分布同步调整维持”可学习的能力边界”。Figure 13 自进化三模式各阶段的机制与代表作对应关系见下表Table 5 Agentic训练流水线各阶段六、Application按Agent-环境接口分的五大形态论文不按行业、而按接口结构组织应用——因为接口决定了观测、动作、状态与反馈的形态也就决定了长时程压力的形态Figure 14 五大应用形态从”有界可验证环境”到”开放异构世界”反馈信号一路减弱长时程难度一路升高。对应的系统与评测资源SWE-bench、WebArena、OSWorld、GAIA、Terminal-Bench、METR等汇总于论文Table 7Table 7 代表性系统与基准七、Frontier四轴九向Harness是下一个主战场论文最后把开放问题组织成四条轴、九个具体前沿Table 8 四轴九前沿一个反复出现的判断下一阶段的突破大部分要发生在Harness层。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】