AI 前沿·阅读约 3 分钟·
DeepSeek V4.1 Flash 发布:KV cache 降到 890 字节/token,长上下文成本只剩四分之一

DeepSeek V4.1 Flash 发布:KV cache 降到 890 字节/token,长上下文成本只剩四分之一

新 Causal Encoder-Decoder 架构加上 CSA2 稀疏注意力,让 DeepSeek 把 1M 上下文的 KV cache 压到上一代的四分之一,同时在 Terminal-Bench 上反超自家 V4-Pro。权重 MIT 开源,API 已上线并降价。

原文来源:MarkTechPost — DeepSeek 发布新架构家族里最小的模型 V4.1 Flash,把每个 token 的 KV cache 压到 890 字节、上一代的四分之一,还顺手超过了自家的 V4-Pro。

Agent 跑长任务最贵的地方往往不是模型本身,而是缓存。多轮工具调用要反复 prefill,上下文又是几十万甚至上百万 token,KV cache 把 HBM、SSD 容量和带宽一起吃满,命中缓存的费用在账单里占掉一大块。DeepSeek 这次的 V4.1 Flash 就是冲着这个瓶颈来的:它把全局 KV cache 压到每个 token 890 字节,大约是上一代 V4 Flash 的四分之一,比最早的 V1 小了约 437 倍。持久化到 SSD 的那部分,则降到了 V4 Flash 的八分之一。

模型本身是个多模态 MoE:552B 主干参数,外加 196B 的 Engram 参数,上下文窗口 1M token。但真正干活的很少——prefill 阶段每个 token 只激活 8B 参数,decode 阶段 16B。权重用 MIT 协议开源,Hugging Face 上有 vLLM、SGLang 和 Transformers 三条路径。

把 prefill 砍掉一半:Causal Encoder-Decoder

V4.1 Flash 的 40 层主干被拆成两半:20 层 causal encoder,加 20 层 decoder。这个设计受了 YOCO 的启发,核心是把 decoder 的全局 KV 省掉——它不再自己算,而是拿 encoder 最后一层的 hidden state,用逐层投影权重推出来。于是 prompt token 到 encoder 就停了,prefill 计算量几乎减半。

每一层里仍然跑着 128 token 窗口的滑动窗口注意力(SWA)。decoder 的 SWA 状态不需要完整保留,只要重放最后 128 个 prompt token 就能重建,团队管这个叫 Decoder SWA Bounded Replay。窗口小、重放短,代价被压得很低。

—— 广告 ——

CSA2:在层的维度上共享缓存

V4 那一代用的是 CSA 和 Heavily Compressed Attention 混搭,V4.1 Flash 换成了纯 CSA2,主攻方向是"层与层之间别重复算",思路挺直接——KV 不一定要每层都自己生成。

每个 CSA2 层会被静态分配三种模式之一:

  • Full:自己算主 KV,从里面投影出 indexer K,选出新的 Top-512 索引。
  • Reindex:主 KV 和 indexer K 都沿用上一个 Full 层,但用自己的 indexer Q 重新打分。
  • Reuse:主 KV 和最新的 Top-K 索引全都复用,连 indexer 都跳过。

每层自己的主 Q 和 SWA KV 还是保留的。18 个 CSA2 encoder 层按 6 层一组分成 3 组,压缩比 2,每组里 1 个 Full、5 个 Reuse;20 个 decoder 层压缩比 1,分成 5 组、每组 4 层,第一组是 Full 加 3 个 Reuse,其余组是 Reindex 加 3 个 Reuse。decoder 里还塞了个分层稀疏索引器,让 Full 层先把候选池限制在最多 16,384 个位置(2048 个块、每块 8 个),后面的 Reindex 层只在这个有界集合里打分,不用扫全上下文。

FP4 KV 与部署层的几个改动

主 KV cache 用 E2M1 量化,每 16 个通道配一个 E4M3 scale,参照 NVFP4 的做法但去掉了全局 scale。这项改动靠后训练阶段的量化感知训练(QAT)落地,存储相对 V4 的 FP8 cache 又几乎减半。

部署层面还有个细节值得注意:SWA KV 不再往 SSD 上写了,它放在从主机 DRAM 里划出来的分布式池子里(占 DRAM 的 10%),TTL 只有几分钟;全局 KV 则保证 72 小时生命周期。一旦 miss,Encoder SWA Bounded Replay 只重算 128 个 token,而不是"层数 × 窗口大小"那么大一笔。

其他改动包括 Single-Pass mHC——把输入混合系数整体挪一个 block,好让融合后的 Mega-mHC kernel 把激活值的内存流量减半;Engram 条件记忆模块挂在第 1 层和第 14 层;DSpark 投机解码在预训练之后单独训练,主干权重冻结;注意力头维度上用 Muon 优化器。效果是:上下文从 4K 涨到 1M,单 token 的 decode FLOPs 只增加四分之一。

训练与结果

预训练用了 45T 多模态 token,文本与多模态比例 7:1。稀疏注意力从零开始训,序列长度 64K,没做 dense warmup;到 34T token 时把上下文扩到 1M。按官方说法,基座模型在世界知识和编码上追平 V4-Pro-Base,而总参数只用了三分之一、激活参数四分之一。

后训练没引入新算法,涨点来自三件事:大规模合成可验证的 agent 任务、在异构脚手架(Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness)上做 RL、以及从 40 多个教师模型做 on-policy 蒸馏。几项最高强度的结果:

基准V4.1-FlashV4-FlashOpus-5GPT-5.6 Sol
Terminal-Bench 2.190.682.789.188.8
DeepSWE v1.174.254.474.073.0
Terminal-Bench 4.031.27.051.839.9
Automation-Bench54.837.750.345.8
GPQA Diamond90.989.993.494.1
Codeforces(rating)34713289

看这张表得留个心眼。Terminal-Bench 2.1 和 DeepSWE 上它确实压过了 Opus-5 和 GPT-5.6 Sol,但 Terminal-Bench 4.0 上 31.2 对 Opus-5 的 51.8 还有明显差距——难度越高,差距越大。GPQA 这类纯知识题也没领先。所以更准确的说法是:它在"长链路、多工具"这类 agent 场景里进步很大,在通用知识推理上还是追赶者。

价格和 API

DeepSeek API 上现在把 model 设成 deepseek-flash 就能用,原生支持多模态。V4 Flash 和 V4 Flash Vision Exp 已经退役,为了兼容,deepseek-v4-flashdeepseek-v4-flash-vision-exp 这两个旧名字会临时路由到 V4.1 Flash。

价格随之下调。官方提到的一点挺值得注意:2026 年 9 月 14 日 04:00 UTC 之后,所有打到 deepseek-v4-pro 的请求会路由到 V4.1 Flash、按 V4.1 Flash 的价格计费,一直到 V4.1-Pro 发布为止。配合"V4.1 Flash 在性能、成本、速度、总运行时间上均超过 V4-Pro"的说法,等于官方在把自己的 Pro 产线逐步并掉。WorkBuddy(含 CodeBuddy)和 OpenCode 已宣布支持。

这套架构的代价

漂亮数字背后有取舍,值得一并说清。

CSA2 的三种模式是静态分配的——哪一层当 Full、哪一层当 Reindex、哪一层当 Reuse,在编译时就定死了。这换来了极简的调度和确定的显存占用,但也意味着模型没法根据输入内容动态决定"这一层该不该重算"。换句话说,它赌的是"平均情况下这套分配最优",而不是"每一段文本都用最优分配"。对固定负载的推理服务,这个赌注很划算;对长尾分布差异极大的场景,就有优化空间留给下一代。

第二个门槛是自托管的成本结构。890 字节/token 的 KV 确实小,但主干 552B 参数加 196B Engram 参数摆在那里,权重的显存占用不是消费级硬件能碰的量级。这个模型真正友好的对象是"有 GPU 集群、且上下文很长"的团队——他们把 KV 从几百 GB 压到 GB 级,收益立竿见影;而对只有一张卡的人,Flash 这个名字容易产生误解:它省的是缓存,不是权重。

最后,表里的数字都来自官方或官方引用的评测,第三方独立复现还需要时间。agent 类基准对脚手架很敏感,换一套 harness 结果可能就变了,所以这些分数更适合横向看趋势,而不是当作绝对能力刻度。

值得留意的几点

对自托管的人来说,890 字节/token 这个数字比基准分更有实际意义。1M 上下文、FP8 的老方案,光 KV 就是几百 GB;换成 V4.1 Flash 这套,同样长度下 KV 大致落在 1GB 上下(890 字节 × 1M ≈ 0.83GB,不含 SWA 和索引开销)。这意味着 1M 上下文从"必须多机 + 大 SSD"变成单机可及的量级,长文档分析、整库代码理解这类以前不划算的用法,成本模型被改写了。

对只用 API 的人来说,变化更直接:同样的活更便宜,缓存命中费用占比越高的场景省得越多。真正需要跟踪的是 V4.1-Pro 什么时候来——如果 Pro 也沿用这套架构,那 V4.1 Flash 只是前菜;如果 Pro 迟迟不发、请求一直路由到 Flash,那这次发布其实是一次产线收编。

Hugging Face 上权重和技术报告都已放出,官方发布说明里有完整的对比图和基准表。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/deepseek-v4-1-flash