閱界資訊

稀疏注意力如何泄密:SparLeak 重建提問與回答

閱閱界編輯部1閱讀7分鐘

《稀疏注意力如何泄密:SparLeak 重建提問與回答》這篇在博客園熱度很高,講的正是大家天天碰到的事。下面幫你把要點捋出來,結尾有能直接抄的結論。

一個沒人算過的成本項 長上下文推理現在是靠"稀疏注意力"撐起來的:既然只有一小部分 token 對注意力輸出有實質貢獻,那就別全算。H2O 這類基於激活顯著性的方法、Quest/MInference 這類塊級打分方法、以及 SeerAttention 這類學習型預測器,都遵循同一個思路——先挑出重要 token,再只對它們做注意力。 問題恰恰出在"挑"這個動作上。挑誰,取決於當前 query;而 query 來自用戶的輸入和模型剛生成的 token。也就是說, 稀疏注意力把一個祕密相關(secret-dependent)的決策,實現在了 KV cache 的訪存行爲裏 。這塊 KV cache 存在 GPU 的 HBM 上,由頁粒度的虛擬內存系統管理;同一張卡上只要還有別的進程在跑,緩存和 TLB 的競爭狀態就可能被觀測。

一個沒人算過的成本項 長上下文推理現在是靠"稀疏注意力"撐起來的:既然只有一小部分 token 對注意力輸出有實質貢獻,那就別全算。H2O 這類基於激活顯著性的方法、Quest/MInference 這類塊級打分方法、以及 SeerAttention 這類學習型預測器,都遵循同一個思路——先挑出重要 token,再只對它們做注意力。 問題恰恰出在"挑"這個動作上。挑誰,取決於當前 query;而 query 來自用戶的輸入和模型剛生成的 token。也就是說, 稀疏注意力把一個祕密相關(secret-dependent)的決策,實現在了 KV cache 的訪存行爲裏 。這塊 KV cache 存在 GPU 的 HBM 上,由頁粒度的虛擬內存系統管理;同一張卡上只要還有別的進程在跑,緩存和 TLB 的競爭狀態就可能被觀測。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的論文把這個現象命名爲 SIMA(Sparsity-Induced Memory Access) ,並給出了完整攻擊框架 SparLeak 。

一個沒人算過的成本項 長上下文推理現在是靠"稀疏注意力"撐起來的:既然只有一小部分 token 對注意力輸出有實質貢獻,那就別全算。H2O 這類基於激活顯著性的方法、Quest/MInference 這類塊級打分方法、以及 SeerAttention 這類學習型預測器,都遵循同一個思路——先挑出重要 token,再只對它們做注意力。 問題恰恰出在"挑"這個動作上。挑誰,取決於當前 query;而 query 來自用戶的輸入和模型剛生成的 token。也就是說, 稀疏注意力把一個祕密相關(secret-dependent)的決策,實現在了 KV cache 的訪存行爲裏 。這塊 KV cache 存在 GPU 的 HBM 上,由頁粒度的虛擬內存系統管理;同一張卡上只要還有別的進程在跑,緩存和 TLB 的競爭狀態就可能被觀測。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的論文把這個現象命名爲 SIMA(Sparsity-Induced Memory Access) ,並給出了完整攻擊框架 SparLeak 。核心結論:在真實的 LLM 服務配置下,屬性推斷平均成功率 90.9% ,逐 token 回答重建 87.3% 。

一個沒人算過的成本項 長上下文推理現在是靠"稀疏注意力"撐起來的:既然只有一小部分 token 對注意力輸出有實質貢獻,那就別全算。H2O 這類基於激活顯著性的方法、Quest/MInference 這類塊級打分方法、以及 SeerAttention 這類學習型預測器,都遵循同一個思路——先挑出重要 token,再只對它們做注意力。 問題恰恰出在"挑"這個動作上。挑誰,取決於當前 query;而 query 來自用戶的輸入和模型剛生成的 token。也就是說, 稀疏注意力把一個祕密相關(secret-dependent)的決策,實現在了 KV cache 的訪存行爲裏 。這塊 KV cache 存在 GPU 的 HBM 上,由頁粒度的虛擬內存系統管理;同一張卡上只要還有別的進程在跑,緩存和 TLB 的競爭狀態就可能被觀測。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的論文把這個現象命名爲 SIMA(Sparsity-Induced Memory Access) ,並給出了完整攻擊框架 SparLeak 。核心結論:在真實的 LLM 服務配置下,屬性推斷平均成功率 90.9% ,逐 token 回答重建 87.3% 。 SIMA:被"頁"糊掉的信號 先理解爲什麼這件事在原理上說得通。

一個沒人算過的成本項 長上下文推理現在是靠"稀疏注意力"撐起來的:既然只有一小部分 token 對注意力輸出有實質貢獻,那就別全算。H2O 這類基於激活顯著性的方法、Quest/MInference 這類塊級打分方法、以及 SeerAttention 這類學習型預測器,都遵循同一個思路——先挑出重要 token,再只對它們做注意力。 問題恰恰出在"挑"這個動作上。挑誰,取決於當前 query;而 query 來自用戶的輸入和模型剛生成的 token。也就是說, 稀疏注意力把一個祕密相關(secret-dependent)的決策,實現在了 KV cache 的訪存行爲裏 。這塊 KV cache 存在 GPU 的 HBM 上,由頁粒度的虛擬內存系統管理;同一張卡上只要還有別的進程在跑,緩存和 TLB 的競爭狀態就可能被觀測。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的論文把這個現象命名爲 SIMA(Sparsity-Induced Memory Access) ,並給出了完整攻擊框架 SparLeak 。核心結論:在真實的 LLM 服務配置下,屬性推斷平均成功率 90.9% ,逐 token 回答重建 87.3% 。 SIMA:被"頁"糊掉的信號 先理解爲什麼這件事在原理上說得通。 單個 token 每層的 KV 張量只有幾 KB,論文引用的量級是 10–30 KB 。

建議先收藏再實操:挑其中一個點今天就試試,跑通了再看下一個。知識只有過手纔是你的,你準備先試哪一點? 來源|博客園《稀疏注意力如何泄密:SparLeak 重建提問與回答》,https://www.cnblogs.com/frankzch/p/23201243.html

程式員技術場技术后端

評論(0)

暫無評論,來搶第一條。