[Agent Memory / 強化學習] MemPO源碼學習筆記
《[Agent Memory / 強化學習] MemPO源碼學習筆記》是近期博客園技術區的好帖,信息密度大。下面分段講清它的核心內容,看到結尾你就知道該怎麼做了。
[Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 目錄 [Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 0x00 概要 0x01 原理 1.1 爲什麼MemPO必須用RL而不是SFT? SFT 的劣勢 RL解決方式 MemPO的實際路徑 小結 1.2 RL 方案的通俗解釋 第1步:出題(準備數據) 第2步:讓偵探們自由發揮(Rollout) 第3步:打分(Reward) 第4步:算誰表現好(GRPO優勢計算) 第5步:更新大腦(Policy Update) 第6步:反覆循環200輪 1.3 協同優化 兩個信號的數學定義 能力分工 token級別的雙重優勢疊加 與模型的 Think與、Action 進行聯合優化 更精確的表述 完整輸出 多個梯度 獎勵信號 Outcome路徑梯度 梯度來源機制 核心理解 協同機制的四個場景 0x02 GRPO 0x03 流程 3.1 訓練流程精簡版 3.2 訓練流程圖(四階段) 3.3 logps 0x04 實現 4.1 訓練主循環 4.2 關鍵點 & 階段 4.3 Prompt特點全解析 訓練端Prompt(極簡設計) 評估端Prompt(詳細格式指令) 兩端Prompt的對比 訓練 vs 評估的關鍵 Prompt 漂移 validate_format()作爲隱式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 參考 0x00 概要 現有的基於強化學習的 Memory 管理方法往往缺乏一種有效機制針對 Memory 的更新內容進行引導優化,Memory 的內容難以保證質量。
[Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 目錄 [Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 0x00 概要 0x01 原理 1.1 爲什麼MemPO必須用RL而不是SFT? SFT 的劣勢 RL解決方式 MemPO的實際路徑 小結 1.2 RL 方案的通俗解釋 第1步:出題(準備數據) 第2步:讓偵探們自由發揮(Rollout) 第3步:打分(Reward) 第4步:算誰表現好(GRPO優勢計算) 第5步:更新大腦(Policy Update) 第6步:反覆循環200輪 1.3 協同優化 兩個信號的數學定義 能力分工 token級別的雙重優勢疊加 與模型的 Think與、Action 進行聯合優化 更精確的表述 完整輸出 多個梯度 獎勵信號 Outcome路徑梯度 梯度來源機制 核心理解 協同機制的四個場景 0x02 GRPO 0x03 流程 3.1 訓練流程精簡版 3.2 訓練流程圖(四階段) 3.3 logps 0x04 實現 4.1 訓練主循環 4.2 關鍵點 & 階段 4.3 Prompt特點全解析 訓練端Prompt(極簡設計) 評估端Prompt(詳細格式指令) 兩端Prompt的對比 訓練 vs 評估的關鍵 Prompt 漂移 validate_format()作爲隱式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 參考 0x00 概要 現有的基於強化學習的 Memory 管理方法往往缺乏一種有效機制針對 Memory 的更新內容進行引導優化,Memory 的內容難以保證質量。 MemPO(Self-Memory Policy Optimization)使模型對 Memory 進行自管理,並引入了基於有效信息含量的 Memory-level 的優勢估計,引導 Memory 保留對解決任務更有效的信息,進而提升記憶有效性。
[Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 目錄 [Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 0x00 概要 0x01 原理 1.1 爲什麼MemPO必須用RL而不是SFT? SFT 的劣勢 RL解決方式 MemPO的實際路徑 小結 1.2 RL 方案的通俗解釋 第1步:出題(準備數據) 第2步:讓偵探們自由發揮(Rollout) 第3步:打分(Reward) 第4步:算誰表現好(GRPO優勢計算) 第5步:更新大腦(Policy Update) 第6步:反覆循環200輪 1.3 協同優化 兩個信號的數學定義 能力分工 token級別的雙重優勢疊加 與模型的 Think與、Action 進行聯合優化 更精確的表述 完整輸出 多個梯度 獎勵信號 Outcome路徑梯度 梯度來源機制 核心理解 協同機制的四個場景 0x02 GRPO 0x03 流程 3.1 訓練流程精簡版 3.2 訓練流程圖(四階段) 3.3 logps 0x04 實現 4.1 訓練主循環 4.2 關鍵點 & 階段 4.3 Prompt特點全解析 訓練端Prompt(極簡設計) 評估端Prompt(詳細格式指令) 兩端Prompt的對比 訓練 vs 評估的關鍵 Prompt 漂移 validate_format()作爲隱式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 參考 0x00 概要 現有的基於強化學習的 Memory 管理方法往往缺乏一種有效機制針對 Memory 的更新內容進行引導優化,Memory 的內容難以保證質量。 MemPO(Self-Memory Policy Optimization)使模型對 Memory 進行自管理,並引入了基於有效信息含量的 Memory-level 的優勢估計,引導 Memory 保留對解決任務更有效的信息,進而提升記憶有效性。 MemPO的獨特切入點:讓模型把記憶寫在每輪開頭( ),形式上像"自我對話的草稿紙",既是記憶又是思考鏈的一部分。
[Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 目錄 [Agent Memory / 強化學習] MemPO源碼學習筆記 --- (2)--- 訓練 0x00 概要 0x01 原理 1.1 爲什麼MemPO必須用RL而不是SFT? SFT 的劣勢 RL解決方式 MemPO的實際路徑 小結 1.2 RL 方案的通俗解釋 第1步:出題(準備數據) 第2步:讓偵探們自由發揮(Rollout) 第3步:打分(Reward) 第4步:算誰表現好(GRPO優勢計算) 第5步:更新大腦(Policy Update) 第6步:反覆循環200輪 1.3 協同優化 兩個信號的數學定義 能力分工 token級別的雙重優勢疊加 與模型的 Think與、Action 進行聯合優化 更精確的表述 完整輸出 多個梯度 獎勵信號 Outcome路徑梯度 梯度來源機制 核心理解 協同機制的四個場景 0x02 GRPO 0x03 流程 3.1 訓練流程精簡版 3.2 訓練流程圖(四階段) 3.3 logps 0x04 實現 4.1 訓練主循環 4.2 關鍵點 & 階段 4.3 Prompt特點全解析 訓練端Prompt(極簡設計) 評估端Prompt(詳細格式指令) 兩端Prompt的對比 訓練 vs 評估的關鍵 Prompt 漂移 validate_format()作爲隱式 Prompt 工程 4.4 Update 4.5 Token ID 0xFF 參考 0x00 概要 現有的基於強化學習的 Memory 管理方法往往缺乏一種有效機制針對 Memory 的更新內容進行引導優化,Memory 的內容難以保證質量。 MemPO(Self-Memory Policy Optimization)使模型對 Memory 進行自管理,並引入了基於有效信息含量的 Memory-level 的優勢估計,引導 Memory 保留對解決任務更有效的信息,進而提升記憶有效性。 MemPO的獨特切入點:讓模型把記憶寫在每輪開頭( ),形式上像"自我對話的草稿紙",既是記憶又是思考鏈的一部分。這樣, 變成可訓練的策略變量,用RL信號端到端地教會模型"什麼值得記、怎麼記”。
行動建議:收藏這篇,下次碰到同類問題先翻出來對照做一遍。好經驗的價值,在於用起來。你最近被這類問題卡過嗎? 來源|博客園《[Agent Memory / 強化學習] MemPO源碼學習筆記》,https://www.cnblogs.com/rossiXYZ/p/22864271.html
評論(0)
暫無評論,來搶第一條。