
【免费下载链接】AgentEvolverAgentEvolver: Towards Efficient Self-Evolving Agent System项目地址https://gitcode.com/gh_mirrors/ag/AgentEvolver点击查看免费下载AgentEvolver 是一款面向高效自进化 Agent 系统Self-Evolving Agent System的强化学习训练框架其中的**经验管理Experience Management**模块是其核心能力之一。本文带你深入理解 AgentEvolver 的Self-Navigating框架与ReMe 经验池如何把 Agent 过去任务中的成功轨迹沉淀为可检索的经验在新任务中自动复用从而显著减少试错、加速策略收敛。为什么 Agent 需要经验管理传统强化学习依赖大量试错式的 rollout每一步都从零探索产生大量冗余轨迹收敛慢、成本高。而人类学习的特点是——总结过去、复用经验、指导未来。Self-Navigating 框架正是借鉴这一思路把 Agent 的训练从无引导的盲目探索转变为知识驱动的自我改进。整个 AgentEvolver 系统分为三大自进化环节如上图中间的Self-Navigating部分所示经验管理覆盖四个关键环节环节说明经验获取从历史轨迹Historical Trials中蒸馏出经验写入经验池经验混合 rollout同一任务的多条 rollout 中部分注入经验w/ Exp、部分自由探索w/o Exp经验注入训练通过exp mask区分经验引导样本与自由样本分别计算损失策略增强基于混合样本优化策略P(trajectorytask) 持续上升完整流程还包含左侧的 Self-Questioning自动任务生成与右侧的 Self-Attributing信用分配经验管理是承上启下的中枢。系统架构Experience Manager 在哪里工作从系统全景图可以看到Experience Manager 与 Rollout Workers、Trainer Workers 协同工作关键协作流程Master下发任务给Rollout Workers后者执行轨迹探索Rollout Workers 通过B.2 Get Exp向 Experience Manager 检索相关经验Exp. Recall经验被注入 promptAgent 带着提示完成任务训练结束后Master 触发C. Summarize ExperiencesExperience Manager 的Semantic Summary把新轨迹蒸馏为经验回写经验池。核心代码分布在两处经验调度与分配exp_manager.py 中的ExperienceManager任务级/rollout 级经验分配和ExperienceWorker经验注入与清理ReMe 服务通信em_client.py 中的EMClient封装了/retrieve_task_memory经验检索与/summary_task_memory经验蒸馏两个接口。快速上手三步启动 ReMe 经验池经验池由外部的ReMe 服务Reflective Memory Engine托管负责经验的存储、蒸馏与向量检索。第一步安装 ReMe 环境项目自带一键安装脚本 install_reme.sh会创建名为reme的 conda 环境Python 3.12并安装reme-aibash external/reme/install_reme.sh第二步启动 ReMe 服务在 ReMe 目录下以 HTTP 后端启动服务默认监听127.0.0.1:8001reme \ configdefault \ backendhttp \ http.host127.0.0.1 \ http.port8001 \ vector_store.default.backendlocal使用本地向量库时每个经验池按workspace_id隔离会以 JSONL 文件形式保存在ReMe/local_vector_store/{workspace_id}.jsonl方便查看和管理。第三步配置训练实验在实验配置中打开exp_manager相关开关。项目默认配置见 agentevolver.yamlexp_manager段推荐的完整示例可直接参考 overall.yamlexp_manager: val_rollout_mode: woexp # 验证集不使用经验保证评估无偏 train_rollout_mode: mixed # 训练集 rollout 时按比例注入经验 rollout_ratio: 0.5 # 每个任务组内 50% 的 rollout 使用经验 train_sample_mode: alldiscard # 训练样本统一剥离经验文本 init_exp_before_training: True # 训练前先用验证集轨迹冷启动经验池 reme: base_url: http://127.0.0.1:8001 workspace_id: default enable_summarizer: True # 开启经验蒸馏 enable_context_generator: True # 开启经验检索与注入 retrieve_top_k: 3 # 每次检索 top-3 相关经验训练主流程的接入点在 ae_ray_trainer.py训练开始前调用initialize_exp_pool()冷启动经验池每个训练步后由submit_summary_task()异步提交蒸馏任务互不阻塞。两级动态经验分配探索与复用的平衡ExperienceManager最巧妙的设计是两级自适应分配动态平衡探索与利用Rollout 级分配谁看经验由train_rollout_mode/val_rollout_mode控制某个任务的一组 rollout 中多少条注入经验模式含义woexp全部不使用经验纯探索验证集推荐all全部注入经验完全引导mixed按rollout_ratio随机抽取部分注入如 0.5 一半引导、一半探索训练样本级分配经验文本留不留由train_sample_mode控制 rollout 完成后训练样本中是否保留注入的经验文本模式含义alldiscard全部剥离经验文本模型学习无提示下的纯推理能力allkeep全部保留经验hybrid按train_sample_keepratio任务级比例选择性保留官方推荐起步配置是alldiscardrollout 时借经验少走弯路训练时剥离经验最终学到的是不依赖外部提示的本领。两种组合对应了不同研究范式详见 exp_manager/README.md方法train_rollout_modetrain_sample_mode特点ECExperience Continualmixedkeeprollout 与训练都保留经验EIExperience Injectionmixeddiscard只用于 rollout训练样本干净HET混合经验训练mixedhybrid按比例混合兼顾两者经验如何注入又如何消失注入ExperienceWorker.manage_rollout_context()在 rollout 前通过EMClient从 ReMe 检索 top-K 相关经验按experience_template模板拼接到初始 prompt 末尾Some Related Experience to help you to complete the task:EXP{}/EXP清理训练样本若被标记为discardmanage_training_context()会用正则精确匹配EXP.../EXP模板把经验文本从训练消息中剥离同时保留原文供分析保证训练数据与经验策略一致。损失处理经验引导样本属于 off-policy 数据直接混入 PPO 更新可能 destabilize 训练。het_core_algos.py 中的异构 PPO 损失用exp_mask把 on-policy 与 off-policy token 分开前者用常规 clip 范围后者用更保守的off_cliprange_high默认 1.0约束信任域两类损失再按掩码合并保证引入历史经验的同时策略更新依然稳定。⚙️六种使用模式经验池生命周期管理通过组合几个布尔开关AgentEvolver 支持完整的经验池生命周期模式典型场景关键配置No Pool基线对照两个 enable 开关均为 FalseInit Only只建池、不训练init_exp_only: TrueInit Train⭐冷启动 训练中复用init_exp_before_training: TrueInit Train Update建池 复用 持续更新updated_freq: kk≠0Exist Train复用已有经验池指定已存在的workspace_idExist Train Update已有池 持续更新存在 ID updated_freq: kupdated_freq每隔 k 个训练步把新轨迹异步蒸馏进经验池经验池随训练一起长大workspace_id不同工作空间互相隔离换新 ID 建池用旧 ID 复用支持断点续训。官方建议大多数场景从Init Train模式起步验证收益后再开启updated_freq做在线更新。实际效果经验复用能带来多大提升开启经验管理后AgentEvolver 在小模型上达到了超越更大参数量模型的完成任务率AppWorld 与 BFCL v3 基准在多智能体游戏场景Avalon中结合经验管理训练 150 步后验证集奖励曲线稳步上升策略质量持续提升小结AgentEvolver 的经验管理体系可以用一句话概括把踩过的坑变成下次的路标。 ReMe 服务负责经验的存储、蒸馏与向量检索ExperienceManager负责何时用、用多少的动态分配️ 两级掩码 异构 PPO 损失保证经验混入后训练依然稳定workspace_idupdated_freq让经验池可复用、可增长。如果你想动手尝试从 examples/overall.yaml 抄一份配置启动 ReMe 服务后运行examples/run_overall.sh即可体验完整的 Self-Navigating 训练流程更多细节可阅读官方指南 docs/guidelines/exp_manager.md 与 docs/tutorial/quick_start.md。赞分享【免费下载链接】AgentEvolverAgentEvolver: Towards Efficient Self-Evolving Agent System项目地址https://gitcode.com/gh_mirrors/ag/AgentEvolver点击查看免费下载相关推荐OpenViking Experience Memory 实战指南让 Agent 检索并复用历史任务经验OpenViking Experience Memory 实战指南让 Agent 检索并复用历史任务经验 经验记忆Experience Memory是 O人工智能AI AgentAgent 记忆RAG后端数据库Ruflo 中的 ReasoningBank 与 AgentDB用自适应学习让 Agent 从轨迹中沉淀可复用经验Ruflo 中的 ReasoningBank 与 AgentDB用自适应学习让 Agent 从轨迹中沉淀可复用经验 本篇围绕 ReasoningBank wi人工智能AI Agent多智能体Agent 编排Agent 记忆工具调用代码智能体MCP 服务AI 评测MemOS 反馈经验生成链路深度修复Hermes 适配器 traceId 贯通与 LLM 经验提炼实战MemOS 反馈经验生成链路深度修复Hermes 适配器 traceId 贯通与 LLM 经验提炼实战 导读 本文以 MemOS Local 插件 apps人工智能大模型Agent 记忆AI AgentRAG知识图谱dsh-plugin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考