DeepSeek V4.1 Flash 发布:一个叫 Flash 的模型,开始接替 Pro

DeepSeek 这次更新,最值得关注的消息藏在模型迁移安排里。

2026 年 9 月 10 日,DeepSeek 正式发布 DeepSeek-V4.1-Flash。随后,官方宣布:北京时间 9 月 14 日 12:00 之后,直到未来 V4.1 Pro 上线前,原本发给 V4 Pro 的 API 请求,将全部转向 V4.1 Flash。

新一代 Flash,开始承接上一代 Pro 的工作。

官方给出的理由是:经过多方测试,V4.1 Flash 在性能、费用、速度和总用时等指标上已全面超越 V4 Pro。这里需要明确,这是 DeepSeek 的官方判断,并不等于所有实际任务都已得到独立验证。

来源:DeepSeek 官方 API 说明

这次更新提出了一个很实际的问题:我们过去习惯交给高价模型的工作,现在能否用更低成本完成?

先看成绩:它的实力,具体体现在哪里?

DeepSeek 将 V4.1 Flash 定位为全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力。

官方公布的部分成绩如下:

评测项目V4.1 Flash 成绩
GPQA Diamond90.9
Codeforces(Rating)3471
Terminal-Bench 2.190.6
Terminal-Bench 3.030.0
DeepSWE v1.174.2
CyberGym88.1
Automation-Bench54.8
Agents’ Last Exam31.8

来源:DeepSeek 官方更新日志,2026 年 9 月 10 日条目

在这里插入图片描述

这些数据覆盖了多种能力,但不能把不同测试的分数相加,得出一个所谓的“综合智商”。

尤其需要注意测试版本:Terminal-Bench 2.1 和 3.0 是不同版本,不能拿前者的高分去解释后者的表现。

对用户而言,榜单最有用的作用,是帮助决定下一步测试什么。

如果你关心编程,就拿真实项目里的问题试;如果你关心办公自动化,就拿需要连续执行的工作流程试。观察模型能否完成任务,以及你要介入多少次。

看完整张表,才能避免被单个高分带偏

一张精简柱状图适合快速理解亮点,完整评测表则更适合检查边界。
在这里插入图片描述

例如,官方列出的 V4.1 Flash HLE 成绩为 36.8,另列的 39.1* 对应纯文本子集;使用工具的 HLE 成绩则为 63.9

它们有不同的测试条件,不能混写成同一个成绩,也不能省略条件后直接横向比较。

来源:DeepSeek 官方更新日志

阅读榜单时,值得追问的是:测试条件是否一致?任务类型是否接近自己的工作?高分能否转化为更少的错误和返工?

带着这些问题看表,得到的判断通常比一句“全面碾压”更有价值。

长上下文背后,还有一笔资源账

官方 API 文档列出,V4.1 Flash 支持 1M tokens 上下文,最大输出长度为 384K tokens,同时支持思考与非思考模式。

来源:DeepSeek 官方模型与价格页

长上下文为处理大量材料提供了空间。例如,在一次任务中提供更多项目代码、背景资料或多轮讨论记录。

不过,容量与准确性需要分别验证。资料能放进去,不代表每个细节都能被准确检索和使用。

这也让推理过程中的资源效率变得值得关注。

在这里插入图片描述

KV Cache 可以理解为模型生成过程中复用的一部分注意力计算信息。它只是推理资源开销的一部分。

因此,即便确认某项 KV Cache 指标下降,也不能直接推出“整机显存同比例下降”“推理速度同比例提升”,更不能据此判断普通电脑能否运行整个模型。

真正的部署成本,还需要结合模型权重、运行配置和实际负载来评估。

价格公布了:最低两分钱,但要看清条件

相比抽象的性能描述,价格更容易让人形成直观感受。

在这里插入图片描述

官方定义的高峰时段为北京时间周一至周五 9:00—12:00、14:00—18:00,其余为空闲时段。

来源:DeepSeek 官方模型与价格页

这里最容易被传播的,是“百万 tokens 只要两分钱”。

但这个数字对应的是:空闲时段、输入、缓存命中。

完整任务还会产生其他输入和输出费用。评估成本时,需要按实际用量分别计算。

对于反复执行的业务流程,我更建议记录“完成一件事的总成本”:调用费、重试次数,以及人工检查和修改的时间。

便宜且能稳定完成工作,才会真正改变使用习惯。

会看图,能让哪些工作更直接?

V4.1 Flash 支持图像输入。官方文档列出的用途包括描述图片、识别截图文字和分析图表。

来源:DeepSeek 官方图像理解指南

这意味着,用户可以尝试把页面截图和修改要求一起交给模型,或让它结合图表检查文字结论。

对开发者来说,也可以把报错截图、复现步骤和相关代码共同提供,减少来回解释背景的成本。

这些是值得验证的应用方向,本文没有将它们包装成已经完成的实测。

已经在用 DeepSeek 的人,需要注意什么?

官方当前推荐的 API 模型名是:

deepseek-flash

旧模型名 deepseek-v4-flashdeepseek-v4-flash-vision-exp 仍可调用,但相应旧模型已下线,请求由 V4.1 Flash 承接。

来源:DeepSeek 官方 API 说明

这意味着,接口调用成功,并不代表底层模型保持原样。

已经接入的应用,值得重新检查输出格式、工具调用和关键任务的结果。对依赖固定提示词的流程而言,一次小范围回归验证尤其有用。

至于新模型的总参数量和激活参数量,本文核验到的官方更新日志与 API 页面没有列出,因此不沿用上一代数字,也不引用未经核实的转述。

下一场考试,在你的真实任务里

V4.1 Flash 给出的新信号,是更低成本的模型开始承担更重要的工作。

它是否适合你,最终可以落到三个问题:

  • 任务是否完成?
  • 过程中需要多少人工介入?
  • 完成全过程花了多少时间和费用?

把过去最容易失败、最需要返工的任务再跑一遍,往往比多看几张榜单更有帮助。

如果同一件事能更快完成、花费更少、返工更少,模型名字里的 Flash 或 Pro,就不再是选择的决定因素。


资料核验日期:2026 年 9 月 10 日。正文模型数据来自 DeepSeek 官方文档,评测结果为官方公布成绩。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

阿萨德528号

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值