DeepSeek V4.1 Flash发布,性能更强、速度更快、使用更普惠

健康方式 8℃

9月10日,DeepSeek 宣布 V4.1 Flash 模型正式上线。该模型是全新模型结构系列中参数规模最小的版本,具备原生多模态视觉理解能力。新结构的设计目标包括:更高的能力上限、更快的推理速度、更大的吞吐量,以及可扩展至更大参数规模。

文章主题示意图
主题配图,非事件现场。摄影:Rahul Pandit。 /。 Pexels。

非对称模型结构,小成本大智能。

DeepSeek V4.1 Flash 是一个 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构,输入与输出不对称——输入激活仅为 8B,输出激活为 16B,成本明显低于已知的同尺寸模型。

此外,V4.1 Flash 还引入了新的预训练方式,并经过更大力度的强化学习后训练,在基准测试中成功超越了包括 DeepSeek V4 Pro 在内的多款旗舰模型的智能水平。

更少缓存,更省成本。

新模型大幅压缩了 KV Cache 缓存体积,相比上一代模型,对 HBM 的需求降至 1/4,对 SSD 的需求降至 1/8。在 Agent 使用场景中,缓存命中费用通常占比较高,KV Cache 的压缩显著降低了 Agent 类任务的使用成本。

API 支持。

DeepSeek V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,将模型名称改为 deepseek-flash 即可调用最新的 V4.1 Flash 模型。

旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线。出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 将被暂时路由至 V4.1 Flash。

同时,经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此 DeepSeek 计划有序下线 V4 Pro 模型。

北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。

腾讯(WorkBuddy、CodeBuddy)和 OpenCode 作为官方合作伙伴,现已全量接入 DeepSeek V4.1 Flash,欢迎使用!

API 定价调整。

得益于模型架构的创新,DeepSeek V4.1 Flash 能够以更低的成本服务更多用户,因此 DeepSeek 相应下调了 V4.1 Flash 的定价。

同时,为更合理地调配资源,DeepSeek 仍采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格于 2026 年 9 月 10 日 12:00 开始生效。

模型开源。

DeepSeek 将全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署范围。