跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

KV cache 每 token 890 字节:DeepSeek 如何压缩注意力内存

模型卡给出的数字是每个 token 890 字节缓存,约为 V4-Flash 的四分之一;HBM 需求也降到上一代的四分之一。

人工智能与模型解释王雅琴发布: 2026年9月26日5 分钟阅读资料来源 4
KV cache 每 token 890 字节:DeepSeek 如何压缩注意力内存

DeepSeek-V4.1-Flash 规格里最值得看的数字不是参数量,而是内存。模型卡写明,全局 KV cache 每个 token 占 890 字节,约为 DeepSeek-V4-Flash 的四分之一。发行方的说明从基础设施角度讲了同一件事:HBM 内存需求降到四分之一,SSD 需求降到上一代的八分之一。

在智能体任务中,模型会反复读取长上下文。缓存命中占了账单的很大一部分,而 KV cache 又必须有地方实际存放。上下文达到几十万 token 时,缓存不再只是实现细节,而成为服务器吞吐量和成本的主要瓶颈。

三套机制,而不是一个技巧

压缩靠几种彼此独立的方法实现。第一种是 SWA Bounded Replay:注意力窗口缺失的状态只靠重放该窗口最后几个 token 来恢复,因此不必把它们长期写入 SSD,KV 的持久痕迹降到改动前的约八分之一。

第二种是 Comprossed Sparse Attention 2(CSA2)。它给每个注意力层分配三种模式之一:Full、Reindex 或 Reuse。各层共享主 KV 和索引器键,稀疏注意力的索引被重复利用。在解码器中,分层稀疏索引器把更深层的索引限制在候选池内,这个候选池由第一层 Full 模式构建。索引成本不再随上下文长度增长。

第三种是把主 KV 以 FP4 格式存储:数值采用 E2M1 表示,每 16 个通道配一个 E4M3 缩放因子。这三项合起来,才得到每 token 890 字节。

实际改变了什么

KV 占用更小,意味着同一台服务器能容纳更多并行会话和更长上下文,在内存与磁盘之间搬运的数据也更少。发行方的说明里直接承诺降低服务成本并把节省让给用户,同时配有高峰与非高峰时段的定价机制。DeepSeek 把这称为 “pushing the limits of KV cache compression”,比的不是谁参数更多,而是谁维持长上下文内存更便宜。

中文门户 IT之家 指出,在部署方面,V4.1-Flash 已进入国内超算网络。在那里,压低 HBM 和 SSD 需求是同时服务大量用户的前提。

评论 0

资料来源

4
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
  4. 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。