415.tech
来自硅谷前线的 AI 与科技资讯
DeepSeek V4.1-Flash 击败自家旗舰 V4-Pro,KV cache 缩小 4 倍

DeepSeek V4.1-Flash 击败自家旗舰 V4-Pro,KV cache 缩小 4 倍

DeepSeek 发布了 V4.1-Flash,这是一款采用 MIT 协议的 552B 参数 MoE 模型,输入和生成时分别激活 8B 和 16B 参数,在 DeepSWE v1.1 测试中得分为 74.2(V4-Flash 为 54.4)。真正的信号在于经济性、其 KV cache 比 V4-Flash 缩小 4 倍,比 V1 缩小 437 倍,将 HBM 占用降至四分之一、且 DeepSeek 将于 9 月 14 日退役 V4-Pro,将流量路由至成本更低的 Flash 模型。在 SimpleQA-Verified 等知识基准测试中,它仍以 42.3 分落后于 V4-Pro 的 55.2 分,因此本质上是用深度召回能力换取了成本与速度。

来源: deepseek.com

分享到 X邮件
本期其他报道