
DeepSeek V4.1 Flash 发布:KV cache 降到 890 字节/token,长上下文成本只剩四分之一
新 Causal Encoder-Decoder 架构加上 CSA2 稀疏注意力,让 DeepSeek 把 1M 上下文的 KV cache 压到上一代的四分之一,同时在 Terminal-Bench 上反超自家 V4-Pro。权重 MIT 开源,API 已上线并降价。
原文来源:MarkTechPost — DeepSeek 发布新架构家族里最小的模型 V4.1 Flash,把每个 token 的 KV cache 压到 890 字节、上一代的四分之一,还顺手超过了自家的 V4-Pro。
Agent 跑长任务最贵的地方往往不是模型本身,而是缓存。多轮工具调用要反复 prefill,上下文又是几十万甚至上百万 token,KV cache 把 HBM、SSD 容量和带宽一起吃满,命中缓存的费用在账单里占掉一大块。DeepSeek 这次的 V4.1 Flash 就是冲着这个瓶颈来的:它把全局 KV cache 压到每个 token 890 字节,大约是上一代 V4 Flash 的四分之一,比最早的 V1 小了约 437 倍。持久化到 SSD 的那部分,则降到了 V4 Flash 的八分之一。
模型本身是个多模态 MoE:552B 主干参数,外加 196B 的 Engram 参数,上下文窗口 1M token。但真正干活的很少——prefill 阶段每个 token 只激活 8B 参数,decode 阶段 16B。权重用 MIT 协议开源,Hugging Face 上有 vLLM、SGLang 和 Transformers 三条路径。
把 prefill 砍掉一半:Causal Encoder-Decoder
V4.1 Flash 的 40 层主干被拆成两半:20 层 causal encoder,加 20 层 decoder。这个设计受了 YOCO 的启发,核心是把 decoder 的全局 KV 省掉——它不再自己算,而是拿 encoder 最后一层的 hidden state,用逐层投影权重推出来。于是 prompt token 到 encoder 就停了,prefill 计算量几乎减半。
每一层里仍然跑着 128 token 窗口的滑动窗口注意力(SWA)。decoder 的 SWA 状态不需要完整保留,只要重放最后 128 个 prompt token 就能重建,团队管这个叫 Decoder SWA Bounded Replay。窗口小、重放短,代价被压得很低。
—— 广告 ——
CSA2:在层的维度上共享缓存
V4 那一代用的是 CSA 和 Heavily Compressed Attention 混搭,V4.1 Flash 换成了纯 CSA2,主攻方向是"层与层之间别重复算",思路挺直接——KV 不一定要每层都自己生成。
每个 CSA2 层会被静态分配三种模式之一:
- Full:自己算主 KV,从里面投影出 indexer K,选出新的 Top-512 索引。
- Reindex:主 KV 和 indexer K 都沿用上一个 Full 层,但用自己的 indexer Q 重新打分。
- Reuse:主 KV 和最新的 Top-K 索引全都复用,连 indexer 都跳过。
每层自己的主 Q 和 SWA KV 还是保留的。18 个 CSA2 encoder 层按 6 层一组分成 3 组,压缩比 2,每组里 1 个 Full、5 个 Reuse;20 个 decoder 层压缩比 1,分成 5 组、每组 4 层,第一组是 Full 加 3 个 Reuse,其余组是 Reindex 加 3 个 Reuse。decoder 里还塞了个分层稀疏索引器,让 Full 层先把候选池限制在最多 16,384 个位置(2048 个块、每块 8 个),后面的 Reindex 层只在这个有界集合里打分,不用扫全上下文。
FP4 KV 与部署层的几个改动
主 KV cache 用 E2M1 量化,每 16 个通道配一个 E4M3 scale,参照 NVFP4 的做法但去掉了全局 scale。这项改动靠后训练阶段的量化感知训练(QAT)落地,存储相对 V4 的 FP8 cache 又几乎减半。
部署层面还有个细节值得注意:SWA KV 不再往 SSD 上写了,它放在从主机 DRAM 里划出来的分布式池子里(占 DRAM 的 10%),TTL 只有几分钟;全局 KV 则保证 72 小时生命周期。一旦 miss,Encoder SWA Bounded Replay 只重算 128 个 token,而不是"层数 × 窗口大小"那么大一笔。
其他改动包括 Single-Pass mHC——把输入混合系数整体挪一个 block,好让融合后的 Mega-mHC kernel 把激活值的内存流量减半;Engram 条件记忆模块挂在第 1 层和第 14 层;DSpark 投机解码在预训练之后单独训练,主干权重冻结;注意力头维度上用 Muon 优化器。效果是:上下文从 4K 涨到 1M,单 token 的 decode FLOPs 只增加四分之一。
训练与结果
预训练用了 45T 多模态 token,文本与多模态比例 7:1。稀疏注意力从零开始训,序列长度 64K,没做 dense warmup;到 34T token 时把上下文扩到 1M。按官方说法,基座模型在世界知识和编码上追平 V4-Pro-Base,而总参数只用了三分之一、激活参数四分之一。
后训练没引入新算法,涨点来自三件事:大规模合成可验证的 agent 任务、在异构脚手架(Claude Code、Codex、OpenCode、Pi、mini-SWE、DeepSeek Harness)上做 RL、以及从 40 多个教师模型做 on-policy 蒸馏。几项最高强度的结果:
| 基准 | V4.1-Flash | V4-Flash | Opus-5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 82.7 | 89.1 | 88.8 |
| DeepSWE v1.1 | 74.2 | 54.4 | 74.0 | 73.0 |
| Terminal-Bench 4.0 | 31.2 | 7.0 | 51.8 | 39.9 |
| Automation-Bench | 54.8 | 37.7 | 50.3 | 45.8 |
| GPQA Diamond | 90.9 | 89.9 | 93.4 | 94.1 |
| Codeforces(rating) | 3471 | 3289 | — | — |
看这张表得留个心眼。Terminal-Bench 2.1 和 DeepSWE 上它确实压过了 Opus-5 和 GPT-5.6 Sol,但 Terminal-Bench 4.0 上 31.2 对 Opus-5 的 51.8 还有明显差距——难度越高,差距越大。GPQA 这类纯知识题也没领先。所以更准确的说法是:它在"长链路、多工具"这类 agent 场景里进步很大,在通用知识推理上还是追赶者。
价格和 API
DeepSeek API 上现在把 model 设成 deepseek-flash 就能用,原生支持多模态。V4 Flash 和 V4 Flash Vision Exp 已经退役,为了兼容,deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 这两个旧名字会临时路由到 V4.1 Flash。
价格随之下调。官方提到的一点挺值得注意:2026 年 9 月 14 日 04:00 UTC 之后,所有打到 deepseek-v4-pro 的请求会路由到 V4.1 Flash、按 V4.1 Flash 的价格计费,一直到 V4.1-Pro 发布为止。配合"V4.1 Flash 在性能、成本、速度、总运行时间上均超过 V4-Pro"的说法,等于官方在把自己的 Pro 产线逐步并掉。WorkBuddy(含 CodeBuddy)和 OpenCode 已宣布支持。
这套架构的代价
漂亮数字背后有取舍,值得一并说清。
CSA2 的三种模式是静态分配的——哪一层当 Full、哪一层当 Reindex、哪一层当 Reuse,在编译时就定死了。这换来了极简的调度和确定的显存占用,但也意味着模型没法根据输入内容动态决定"这一层该不该重算"。换句话说,它赌的是"平均情况下这套分配最优",而不是"每一段文本都用最优分配"。对固定负载的推理服务,这个赌注很划算;对长尾分布差异极大的场景,就有优化空间留给下一代。
第二个门槛是自托管的成本结构。890 字节/token 的 KV 确实小,但主干 552B 参数加 196B Engram 参数摆在那里,权重的显存占用不是消费级硬件能碰的量级。这个模型真正友好的对象是"有 GPU 集群、且上下文很长"的团队——他们把 KV 从几百 GB 压到 GB 级,收益立竿见影;而对只有一张卡的人,Flash 这个名字容易产生误解:它省的是缓存,不是权重。
最后,表里的数字都来自官方或官方引用的评测,第三方独立复现还需要时间。agent 类基准对脚手架很敏感,换一套 harness 结果可能就变了,所以这些分数更适合横向看趋势,而不是当作绝对能力刻度。
值得留意的几点
对自托管的人来说,890 字节/token 这个数字比基准分更有实际意义。1M 上下文、FP8 的老方案,光 KV 就是几百 GB;换成 V4.1 Flash 这套,同样长度下 KV 大致落在 1GB 上下(890 字节 × 1M ≈ 0.83GB,不含 SWA 和索引开销)。这意味着 1M 上下文从"必须多机 + 大 SSD"变成单机可及的量级,长文档分析、整库代码理解这类以前不划算的用法,成本模型被改写了。
对只用 API 的人来说,变化更直接:同样的活更便宜,缓存命中费用占比越高的场景省得越多。真正需要跟踪的是 V4.1-Pro 什么时候来——如果 Pro 也沿用这套架构,那 V4.1 Flash 只是前菜;如果 Pro 迟迟不发、请求一直路由到 Flash,那这次发布其实是一次产线收编。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/deepseek-v4-1-flash
相关文章
DeepSeek V4 Pro 0813 正式版上线:1M 上下文、384K 输出,价格却涨了
8月12日,DeepSeek V4 Pro 正式版(0813)通过 API 悄然上线:1M 上下文、384K 最大输出、原生支持 Responses API 与 Anthropic 格式,但官方同时预告近期将大幅涨价。
K2 Horizon:一口气开源 6 个模型,从 0.9B 到 375B 全尺寸覆盖,训练配方也全部公开
IFM 发布 K2 Horizon 开源模型家族:6 个尺寸从 0.9B 到 375B-A23B,小模型在同尺寸中刷新 SOTA,0.9B 在 AIME 2026 拿 48+ 分。Apache 2.0 开源,中间 checkpoint、训练数据配方、代码日志全部公开,还自带对 reward hacking 的审计。
DeepSeek V4 预览版全面解读:1M 上下文、1.6T MoE、开源逼近闭源前沿
DeepSeek 于 2026 年 4 月 24 日正式发布 V4 预览版,包含 Pro 和 Flash 两个版本,以 1.6T 总参数、1M 上下文窗口、极低 API 定价冲击 AI 格局。本文基于官方技术报告与 HuggingFace 开源模型信息,全面解读其架构创新、性能表现与行业影响。