阅界资讯

稀疏注意力如何泄密:SparLeak 重建提问与回答

阅阅界编辑部2阅读7分钟

《稀疏注意力如何泄密:SparLeak 重建提问与回答》这篇在博客园热度很高,讲的正是大家天天碰到的事。下面帮你把要点捋出来,结尾有能直接抄的结论。

一个没人算过的成本项 长上下文推理现在是靠"稀疏注意力"撑起来的:既然只有一小部分 token 对注意力输出有实质贡献,那就别全算。H2O 这类基于激活显著性的方法、Quest/MInference 这类块级打分方法、以及 SeerAttention 这类学习型预测器,都遵循同一个思路——先挑出重要 token,再只对它们做注意力。 问题恰恰出在"挑"这个动作上。挑谁,取决于当前 query;而 query 来自用户的输入和模型刚生成的 token。也就是说, 稀疏注意力把一个秘密相关(secret-dependent)的决策,实现在了 KV cache 的访存行为里 。这块 KV cache 存在 GPU 的 HBM 上,由页粒度的虚拟内存系统管理;同一张卡上只要还有别的进程在跑,缓存和 TLB 的竞争状态就可能被观测。

一个没人算过的成本项 长上下文推理现在是靠"稀疏注意力"撑起来的:既然只有一小部分 token 对注意力输出有实质贡献,那就别全算。H2O 这类基于激活显著性的方法、Quest/MInference 这类块级打分方法、以及 SeerAttention 这类学习型预测器,都遵循同一个思路——先挑出重要 token,再只对它们做注意力。 问题恰恰出在"挑"这个动作上。挑谁,取决于当前 query;而 query 来自用户的输入和模型刚生成的 token。也就是说, 稀疏注意力把一个秘密相关(secret-dependent)的决策,实现在了 KV cache 的访存行为里 。这块 KV cache 存在 GPU 的 HBM 上,由页粒度的虚拟内存系统管理;同一张卡上只要还有别的进程在跑,缓存和 TLB 的竞争状态就可能被观测。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的论文把这个现象命名为 SIMA(Sparsity-Induced Memory Access) ,并给出了完整攻击框架 SparLeak 。

一个没人算过的成本项 长上下文推理现在是靠"稀疏注意力"撑起来的:既然只有一小部分 token 对注意力输出有实质贡献,那就别全算。H2O 这类基于激活显著性的方法、Quest/MInference 这类块级打分方法、以及 SeerAttention 这类学习型预测器,都遵循同一个思路——先挑出重要 token,再只对它们做注意力。 问题恰恰出在"挑"这个动作上。挑谁,取决于当前 query;而 query 来自用户的输入和模型刚生成的 token。也就是说, 稀疏注意力把一个秘密相关(secret-dependent)的决策,实现在了 KV cache 的访存行为里 。这块 KV cache 存在 GPU 的 HBM 上,由页粒度的虚拟内存系统管理;同一张卡上只要还有别的进程在跑,缓存和 TLB 的竞争状态就可能被观测。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的论文把这个现象命名为 SIMA(Sparsity-Induced Memory Access) ,并给出了完整攻击框架 SparLeak 。核心结论:在真实的 LLM 服务配置下,属性推断平均成功率 90.9% ,逐 token 回答重建 87.3% 。

一个没人算过的成本项 长上下文推理现在是靠"稀疏注意力"撑起来的:既然只有一小部分 token 对注意力输出有实质贡献,那就别全算。H2O 这类基于激活显著性的方法、Quest/MInference 这类块级打分方法、以及 SeerAttention 这类学习型预测器,都遵循同一个思路——先挑出重要 token,再只对它们做注意力。 问题恰恰出在"挑"这个动作上。挑谁,取决于当前 query;而 query 来自用户的输入和模型刚生成的 token。也就是说, 稀疏注意力把一个秘密相关(secret-dependent)的决策,实现在了 KV cache 的访存行为里 。这块 KV cache 存在 GPU 的 HBM 上,由页粒度的虚拟内存系统管理;同一张卡上只要还有别的进程在跑,缓存和 TLB 的竞争状态就可能被观测。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的论文把这个现象命名为 SIMA(Sparsity-Induced Memory Access) ,并给出了完整攻击框架 SparLeak 。核心结论:在真实的 LLM 服务配置下,属性推断平均成功率 90.9% ,逐 token 回答重建 87.3% 。 SIMA:被"页"糊掉的信号 先理解为什么这件事在原理上说得通。

一个没人算过的成本项 长上下文推理现在是靠"稀疏注意力"撑起来的:既然只有一小部分 token 对注意力输出有实质贡献,那就别全算。H2O 这类基于激活显著性的方法、Quest/MInference 这类块级打分方法、以及 SeerAttention 这类学习型预测器,都遵循同一个思路——先挑出重要 token,再只对它们做注意力。 问题恰恰出在"挑"这个动作上。挑谁,取决于当前 query;而 query 来自用户的输入和模型刚生成的 token。也就是说, 稀疏注意力把一个秘密相关(secret-dependent)的决策,实现在了 KV cache 的访存行为里 。这块 KV cache 存在 GPU 的 HBM 上,由页粒度的虚拟内存系统管理;同一张卡上只要还有别的进程在跑,缓存和 TLB 的竞争状态就可能被观测。 Shandong University 的 Fahao Chen、Linkang Du、Jinhao Zhou、Peng Li、Zhou Su 在 2026 年 9 月 30 日提交的论文把这个现象命名为 SIMA(Sparsity-Induced Memory Access) ,并给出了完整攻击框架 SparLeak 。核心结论:在真实的 LLM 服务配置下,属性推断平均成功率 90.9% ,逐 token 回答重建 87.3% 。 SIMA:被"页"糊掉的信号 先理解为什么这件事在原理上说得通。 单个 token 每层的 KV 张量只有几 KB,论文引用的量级是 10–30 KB 。

建议先收藏再实操:挑其中一个点今天就试试,跑通了再看下一个。知识只有过手才是你的,你准备先试哪一点? 来源|博客园《稀疏注意力如何泄密:SparLeak 重建提问与回答》,https://www.cnblogs.com/frankzch/p/23201243.html

程序员技术场技术后端

评论(0)

暂无评论,来抢第一条。