DeepSeek 这次更新,最值得关注的消息藏在模型迁移安排里。
2026 年 9 月 10 日,DeepSeek 正式发布 DeepSeek-V4.1-Flash。随后,官方宣布:北京时间 9 月 14 日 12:00 之后,直到未来 V4.1 Pro 上线前,原本发给 V4 Pro 的 API 请求,将全部转向 V4.1 Flash。
新一代 Flash,开始承接上一代 Pro 的工作。
官方给出的理由是:经过多方测试,V4.1 Flash 在性能、费用、速度和总用时等指标上已全面超越 V4 Pro。这里需要明确,这是 DeepSeek 的官方判断,并不等于所有实际任务都已得到独立验证。
这次更新提出了一个很实际的问题:我们过去习惯交给高价模型的工作,现在能否用更低成本完成?
先看成绩:它的实力,具体体现在哪里?
DeepSeek 将 V4.1 Flash 定位为全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力。
官方公布的部分成绩如下:
| 评测项目 | V4.1 Flash 成绩 |
|---|---|
| GPQA Diamond | 90.9 |
| Codeforces(Rating) | 3471 |
| Terminal-Bench 2.1 | 90.6 |
| Terminal-Bench 3.0 | 30.0 |
| DeepSWE v1.1 | 74.2 |
| CyberGym | 88.1 |
| Automation-Bench | 54.8 |
| Agents’ Last Exam | 31.8 |
来源:DeepSeek 官方更新日志,2026 年 9 月 10 日条目

这些数据覆盖了多种能力,但不能把不同测试的分数相加,得出一个所谓的“综合智商”。
尤其需要注意测试版本:Terminal-Bench 2.1 和 3.0 是不同版本,不能拿前者的高分去解释后者的表现。
对用户而言,榜单最有用的作用,是帮助决定下一步测试什么。
如果你关心编程,就拿真实项目里的问题试;如果你关心办公自动化,就拿需要连续执行的工作流程试。观察模型能否完成任务,以及你要介入多少次。
看完整张表,才能避免被单个高分带偏
一张精简柱状图适合快速理解亮点,完整评测表则更适合检查边界。

例如,官方列出的 V4.1 Flash HLE 成绩为 36.8,另列的 39.1* 对应纯文本子集;使用工具的 HLE 成绩则为 63.9。
它们有不同的测试条件,不能混写成同一个成绩,也不能省略条件后直接横向比较。
阅读榜单时,值得追问的是:测试条件是否一致?任务类型是否接近自己的工作?高分能否转化为更少的错误和返工?
带着这些问题看表,得到的判断通常比一句“全面碾压”更有价值。
长上下文背后,还有一笔资源账
官方 API 文档列出,V4.1 Flash 支持 1M tokens 上下文,最大输出长度为 384K tokens,同时支持思考与非思考模式。
长上下文为处理大量材料提供了空间。例如,在一次任务中提供更多项目代码、背景资料或多轮讨论记录。
不过,容量与准确性需要分别验证。资料能放进去,不代表每个细节都能被准确检索和使用。
这也让推理过程中的资源效率变得值得关注。

KV Cache 可以理解为模型生成过程中复用的一部分注意力计算信息。它只是推理资源开销的一部分。
因此,即便确认某项 KV Cache 指标下降,也不能直接推出“整机显存同比例下降”“推理速度同比例提升”,更不能据此判断普通电脑能否运行整个模型。
真正的部署成本,还需要结合模型权重、运行配置和实际负载来评估。
价格公布了:最低两分钱,但要看清条件
相比抽象的性能描述,价格更容易让人形成直观感受。

官方定义的高峰时段为北京时间周一至周五 9:00—12:00、14:00—18:00,其余为空闲时段。
这里最容易被传播的,是“百万 tokens 只要两分钱”。
但这个数字对应的是:空闲时段、输入、缓存命中。
完整任务还会产生其他输入和输出费用。评估成本时,需要按实际用量分别计算。
对于反复执行的业务流程,我更建议记录“完成一件事的总成本”:调用费、重试次数,以及人工检查和修改的时间。
便宜且能稳定完成工作,才会真正改变使用习惯。
会看图,能让哪些工作更直接?
V4.1 Flash 支持图像输入。官方文档列出的用途包括描述图片、识别截图文字和分析图表。
这意味着,用户可以尝试把页面截图和修改要求一起交给模型,或让它结合图表检查文字结论。
对开发者来说,也可以把报错截图、复现步骤和相关代码共同提供,减少来回解释背景的成本。
这些是值得验证的应用方向,本文没有将它们包装成已经完成的实测。
已经在用 DeepSeek 的人,需要注意什么?
官方当前推荐的 API 模型名是:
deepseek-flash
旧模型名 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 仍可调用,但相应旧模型已下线,请求由 V4.1 Flash 承接。
这意味着,接口调用成功,并不代表底层模型保持原样。
已经接入的应用,值得重新检查输出格式、工具调用和关键任务的结果。对依赖固定提示词的流程而言,一次小范围回归验证尤其有用。
至于新模型的总参数量和激活参数量,本文核验到的官方更新日志与 API 页面没有列出,因此不沿用上一代数字,也不引用未经核实的转述。
下一场考试,在你的真实任务里
V4.1 Flash 给出的新信号,是更低成本的模型开始承担更重要的工作。
它是否适合你,最终可以落到三个问题:
- 任务是否完成?
- 过程中需要多少人工介入?
- 完成全过程花了多少时间和费用?
把过去最容易失败、最需要返工的任务再跑一遍,往往比多看几张榜单更有帮助。
如果同一件事能更快完成、花费更少、返工更少,模型名字里的 Flash 或 Pro,就不再是选择的决定因素。
资料核验日期:2026 年 9 月 10 日。正文模型数据来自 DeepSeek 官方文档,评测结果为官方公布成绩。

594

被折叠的 条评论
为什么被折叠?



