
DeepSeek-V4.1 Flash发布初期,其近420 Tokens/s的推理速度及DeepSeek-V4 Pro模型的下线决策,曾引发业界对版本迭代性质的猜测。随着《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》技术报告的完整披露,该模型被证实为DeepSeek-V5 Flash的前奏,其核心突破在于将KV Cache压缩推向极致。
核心突破:极致KV Cache压缩
长周期智能体工作流导致上下文激增,工具调用带来巨大预填充压力,HBM与SSD中的KV Cache存储成为扩展瓶颈。DeepSeek-V4.1 Flash通过架构优化,在保持高质量任务完成度的前提下,将KV Cache进一步压缩4倍。
该模型参数量达552B,原生支持多模态输入及高达100万Token的上下文。采用因果编码器-解码器(CED)架构,解码器的全局KV Cache由编码器最终隐藏状态投影获得。这一设计使得预填充阶段每Token仅激活8B参数,解码阶段激活16B参数,显著降低以输入为主的智能体场景成本。
相比DeepSeek-V4-Flash,V4.1 Flash在相同序列长度下,运行时KV Cache存储仅为前者的1/4,持久化KV Cache存储仅为1/8,且整体性能更优。压缩优化主要源于三个维度:
- 通道维度:使用512维潜在向量共享每个注意力头的键值表示;
- 序列维度:编码器将2个相邻位置合并为1个缓存条目,解码器保留逐位置条目;
- 层维度:多层共享全局KV,全网仅保留3份编码器缓存和1份解码器缓存。
结合FP4量化,全局主KV和索引器的存储增长约为每Token 890字节。
架构解析:CED与CSA2
模型共40层,分为前20层编码器与后20层解码器。核心在于CED架构减少长上下文预填充计算,以及CSA2机制降低注意力与KV缓存开销。
因果编码器-解码器(CED):借鉴YoCo理念,将Transformer下半部分视为因果编码器,上半部分为解码器。解码器全局KV直接源自第20层隐藏状态投影,而非各自层状态。预填充阶段,长提示的大部分位置只需经过前20层编码器,后续解码器仅通过有界重放(Bounded Replay)处理最后128个位置的滑动窗口注意力(SWA),将预填充复杂度从O(N²)降至O(N),计算量减半。
CSA2跨层压缩:在DeepSeek-V4 CSA基础上,CSA2引入层维度数据重用。注意力块分为三种模式:
- Full模式:计算主KV、Indexer K及Top-K索引;
- Reindex模式:重用主KV与Indexer K,重新计算Indexer Q生成新Top-K索引;
- Reuse模式:重用主KV及已有Top-K索引,不进行索引计算。
编码器采用“1层Full + 5层Reuse”的宏块结构,解码器则采用“1层Full + 4层Reindex”结构,并结合分层稀疏索引器(HSI)限制搜索域,进一步降低解码期索引计算成本。
多模态与辅助优化
视觉分支:采用32层ViT,补丁大小14,下采样比率3。图像特征经空间重排与两层MLP投影后插入文本序列,单张图片最多生成1024个视觉Token,支持约1344×1344像素输入分辨率。
mHC残差连接:维持4条残差流,通过Sinkhorn迭代约束混合矩阵,利用前一子层输入混合系数释放依赖,促进内核融合。
DSpark投机解码:引入3层SWA-128草稿块,采用小规模MoE,并行计算草稿位置并验证,提升推理速度。
Engram条件记忆:在第1层和第14层注入Engram,通过哈希表查找N-gram模式,增强对重复短语与局部组合规律的记忆能力。
综上,DeepSeek-V4.1 Flash通过CED、CSA2、HSI等多重技术栈,在长上下文场景下实现了计算效率与存储成本的双重突破,为智能体应用的规模化部署提供了底层支撑。