阅界资讯

[Agent Memory / 强化学习] MemPO源码学习笔记

阅阅界编辑部1阅读8分钟

《[Agent Memory / 强化学习] MemPO源码学习笔记》是近期博客园技术区的好帖,信息密度大。下面分段讲清它的核心内容,看到结尾你就知道该怎么做了。

[Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 目录 [Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 0x00 概要 0x01 原理 1.1 为什么MemPO必须用RL而不是SFT? SFT 的劣势 RL解决方式 MemPO的实际路径 小结 1.2 RL 方案的通俗解释 第1步:出题(准备数据) 第2步:让侦探们自由发挥(Rollout) 第3步:打分(Reward) 第4步:算谁表现好(GRPO优势计算) 第5步:更新大脑(Policy Update) 第6步:反复循环200轮 1.3 协同优化 两个信号的数学定义 能力分工 token级别的双重优势叠加 与模型的 Think与、Action 进行联合优化 更精确的表述 完整输出 多个梯度 奖励信号 Outcome路径梯度 梯度来源机制 核心理解 协同机制的四个场景 0x02 GRPO 0x03 流程 3.1 训练流程精简版 3.2 训练流程图(四阶段) 3.3 logps 0x04 实现 4.1 训练主循环 4.2 关键点 & 阶段 4.3 Prompt特点全解析 训练端Prompt(极简设计) 评估端Prompt(详细格式指令) 两端Prompt的对比 训练 vs 评估的关键 Prompt 漂移 validate_format()作为隐式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 参考 0x00 概要 现有的基于强化学习的 Memory 管理方法往往缺乏一种有效机制针对 Memory 的更新内容进行引导优化,Memory 的内容难以保证质量。

[Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 目录 [Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 0x00 概要 0x01 原理 1.1 为什么MemPO必须用RL而不是SFT? SFT 的劣势 RL解决方式 MemPO的实际路径 小结 1.2 RL 方案的通俗解释 第1步:出题(准备数据) 第2步:让侦探们自由发挥(Rollout) 第3步:打分(Reward) 第4步:算谁表现好(GRPO优势计算) 第5步:更新大脑(Policy Update) 第6步:反复循环200轮 1.3 协同优化 两个信号的数学定义 能力分工 token级别的双重优势叠加 与模型的 Think与、Action 进行联合优化 更精确的表述 完整输出 多个梯度 奖励信号 Outcome路径梯度 梯度来源机制 核心理解 协同机制的四个场景 0x02 GRPO 0x03 流程 3.1 训练流程精简版 3.2 训练流程图(四阶段) 3.3 logps 0x04 实现 4.1 训练主循环 4.2 关键点 & 阶段 4.3 Prompt特点全解析 训练端Prompt(极简设计) 评估端Prompt(详细格式指令) 两端Prompt的对比 训练 vs 评估的关键 Prompt 漂移 validate_format()作为隐式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 参考 0x00 概要 现有的基于强化学习的 Memory 管理方法往往缺乏一种有效机制针对 Memory 的更新内容进行引导优化,Memory 的内容难以保证质量。 MemPO(Self-Memory Policy Optimization)使模型对 Memory 进行自管理,并引入了基于有效信息含量的 Memory-level 的优势估计,引导 Memory 保留对解决任务更有效的信息,进而提升记忆有效性。

[Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 目录 [Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 0x00 概要 0x01 原理 1.1 为什么MemPO必须用RL而不是SFT? SFT 的劣势 RL解决方式 MemPO的实际路径 小结 1.2 RL 方案的通俗解释 第1步:出题(准备数据) 第2步:让侦探们自由发挥(Rollout) 第3步:打分(Reward) 第4步:算谁表现好(GRPO优势计算) 第5步:更新大脑(Policy Update) 第6步:反复循环200轮 1.3 协同优化 两个信号的数学定义 能力分工 token级别的双重优势叠加 与模型的 Think与、Action 进行联合优化 更精确的表述 完整输出 多个梯度 奖励信号 Outcome路径梯度 梯度来源机制 核心理解 协同机制的四个场景 0x02 GRPO 0x03 流程 3.1 训练流程精简版 3.2 训练流程图(四阶段) 3.3 logps 0x04 实现 4.1 训练主循环 4.2 关键点 & 阶段 4.3 Prompt特点全解析 训练端Prompt(极简设计) 评估端Prompt(详细格式指令) 两端Prompt的对比 训练 vs 评估的关键 Prompt 漂移 validate_format()作为隐式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 参考 0x00 概要 现有的基于强化学习的 Memory 管理方法往往缺乏一种有效机制针对 Memory 的更新内容进行引导优化,Memory 的内容难以保证质量。 MemPO(Self-Memory Policy Optimization)使模型对 Memory 进行自管理,并引入了基于有效信息含量的 Memory-level 的优势估计,引导 Memory 保留对解决任务更有效的信息,进而提升记忆有效性。 MemPO的独特切入点:让模型把记忆写在每轮开头( ),形式上像"自我对话的草稿纸",既是记忆又是思考链的一部分。

[Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 目录 [Agent Memory / 强化学习] MemPO源码学习笔记 --- (2)--- 训练 0x00 概要 0x01 原理 1.1 为什么MemPO必须用RL而不是SFT? SFT 的劣势 RL解决方式 MemPO的实际路径 小结 1.2 RL 方案的通俗解释 第1步:出题(准备数据) 第2步:让侦探们自由发挥(Rollout) 第3步:打分(Reward) 第4步:算谁表现好(GRPO优势计算) 第5步:更新大脑(Policy Update) 第6步:反复循环200轮 1.3 协同优化 两个信号的数学定义 能力分工 token级别的双重优势叠加 与模型的 Think与、Action 进行联合优化 更精确的表述 完整输出 多个梯度 奖励信号 Outcome路径梯度 梯度来源机制 核心理解 协同机制的四个场景 0x02 GRPO 0x03 流程 3.1 训练流程精简版 3.2 训练流程图(四阶段) 3.3 logps 0x04 实现 4.1 训练主循环 4.2 关键点 & 阶段 4.3 Prompt特点全解析 训练端Prompt(极简设计) 评估端Prompt(详细格式指令) 两端Prompt的对比 训练 vs 评估的关键 Prompt 漂移 validate_format()作为隐式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 参考 0x00 概要 现有的基于强化学习的 Memory 管理方法往往缺乏一种有效机制针对 Memory 的更新内容进行引导优化,Memory 的内容难以保证质量。 MemPO(Self-Memory Policy Optimization)使模型对 Memory 进行自管理,并引入了基于有效信息含量的 Memory-level 的优势估计,引导 Memory 保留对解决任务更有效的信息,进而提升记忆有效性。 MemPO的独特切入点:让模型把记忆写在每轮开头( ),形式上像"自我对话的草稿纸",既是记忆又是思考链的一部分。这样, 变成可训练的策略变量,用RL信号端到端地教会模型"什么值得记、怎么记”。

行动建议:收藏这篇,下次碰到同类问题先翻出来对照做一遍。好经验的价值,在于用起来。你最近被这类问题卡过吗? 来源|博客园《[Agent Memory / 强化学习] MemPO源码学习笔记》,https://www.cnblogs.com/rossiXYZ/p/22864271.html

程序员技术场技术后端

评论(0)

暂无评论,来抢第一条。