DeepSeek V4.1 Flash发布,性能反超V4 Pro

2026-09-11 09:50:02
18861
新一代模型在缓存效率上的突破更为关键。

9月10日,DeepSeek正式发布DeepSeek V4.1 Flash模型。这是公司全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力,在性能全面超越旗舰V4 Pro的同时,大幅压缩了KVCache缓存规模——对HBM的需求减少到上一代的1/4,对SSD的需求减少到1/8。

V4.1 Flash采用全新的Causal-Encoder-Decoder架构,核心特征是输入与输出不对称:输入激活参数仅8B,输出激活为16B,模型总参数552B,为MoE架构。这一设计使其成本显著低于已知的同尺寸模型。

“小成本”并未牺牲“大智能”。在新预训练方式和更大规模强化学习后训练的加持下,V4.1Flash在多项基准测试中超越了DeepSeek V4 Pro、GLM-5.3、Kimi-K3等前沿旗舰模型。其中Terminal-Bench2.1得分90.6,高于V4 Pro的87.9;DeepSW Ev 1.1得分74.2,超过Kimi-K3的67.5;Automation-Bench得分54.8,领先GLM-5.3的48.8。

新一代模型在缓存效率上的突破更为关键。DeepSeek官方数据显示,V4.1 Flash的KV Cache规模仅为初代模型的1/437。这一压缩由架构、缓存精度与部署策略三方协同完成:架构上采用CSA2压缩稀疏注意力机制,将全局KV缓存与Top-K索引跨层复用;缓存精度上从训练阶段即以FP4格式存储全局KV缓存;部署上新增SWA有界重放机制,使SWA缓存无需写入SSD。

这些设计叠加后,上下文从4K拉长到1M时,单token解码FLOPs仅增加约四分之一,解码成本几乎不随上下文长度增长。在Agent使用场景中,缓存命中费用往往占比较高,KVCache的压缩大幅降低了Agent类任务的使用成本。

经多方测试,V4.1Flash在性能、费用、速度、总用时等指标上全面超越V4Pro。DeepSeek因此计划有序下线V4Pro:9月14日12:00之后至V4.1Pro上线前,所有访问deepseek-v4-pro的请求将全部路由至V4.1Flash,并按V4.1Flash单价计费。V4.1Flash已同步上线DeepSeek API,模型名更改为deepseek-flash即可调用。腾讯WorkBuddy、CodeBuddy及OpenCode作为官方合作伙伴已全量接入。

定价方面,得益于架构创新带来的成本下降,DeepSeek同步下调V4.1Flash价格,最高降幅60%。闲时输入缓存命中0.02元、未命中1.0元、输出4.0元;高峰时段翻倍。峰谷定价机制保留,新价格已于9月10日12:00生效。

免责声明:本文观点来自原作者,不代表天天在线的观点和立场。文章内容仅供参考、交流、学习,不构成投资建议
责任编辑:蓝羽_XN054
猜你感兴趣