KV cache 每 token 890 字节:DeepSeek 如何压缩注意力内存
模型卡给出的数字是每个 token 890 字节缓存,约为 V4-Flash 的四分之一;HBM 需求也降到上一代的四分之一。

DeepSeek-V4.1-Flash 规格里最值得看的数字不是参数量,而是内存。模型卡写明,全局 KV cache 每个 token 占 890 字节,约为 DeepSeek-V4-Flash 的四分之一。发行方的说明从基础设施角度讲了同一件事:HBM 内存需求降到四分之一,SSD 需求降到上一代的八分之一。
在智能体任务中,模型会反复读取长上下文。缓存命中占了账单的很大一部分,而 KV cache 又必须有地方实际存放。上下文达到几十万 token 时,缓存不再只是实现细节,而成为服务器吞吐量和成本的主要瓶颈。
三套机制,而不是一个技巧
压缩靠几种彼此独立的方法实现。第一种是 SWA Bounded Replay:注意力窗口缺失的状态只靠重放该窗口最后几个 token 来恢复,因此不必把它们长期写入 SSD,KV 的持久痕迹降到改动前的约八分之一。
第二种是 Comprossed Sparse Attention 2(CSA2)。它给每个注意力层分配三种模式之一:Full、Reindex 或 Reuse。各层共享主 KV 和索引器键,稀疏注意力的索引被重复利用。在解码器中,分层稀疏索引器把更深层的索引限制在候选池内,这个候选池由第一层 Full 模式构建。索引成本不再随上下文长度增长。
第三种是把主 KV 以 FP4 格式存储:数值采用 E2M1 表示,每 16 个通道配一个 E4M3 缩放因子。这三项合起来,才得到每 token 890 字节。
实际改变了什么
KV 占用更小,意味着同一台服务器能容纳更多并行会话和更长上下文,在内存与磁盘之间搬运的数据也更少。发行方的说明里直接承诺降低服务成本并把节省让给用户,同时配有高峰与非高峰时段的定价机制。DeepSeek 把这称为 “pushing the limits of KV cache compression”,比的不是谁参数更多,而是谁维持长上下文内存更便宜。
中文门户 IT之家 指出,在部署方面,V4.1-Flash 已进入国内超算网络。在那里,压低 HBM 和 SSD 需求是同时服务大量用户的前提。
资料来源
4- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
- 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。