DeepSeek V4 Flash 0731
深度解读
开放权重模型第一梯队,全球模型第二梯队上沿。代码 Agent 能力接近顶级,API 成本近乎统治级。但它的真实能力边界在哪里?哪些场景值得用,哪些场景最好换一个?
最后更新:2026-08-04
能力定位:它站在哪里
据 Artificial Analysis 独立综合指数,V4 Flash 0731 得分 50,处于全球模型第二梯队上沿:
| 对比对象 | 综合指数差距 | 定位说明 |
|---|---|---|
| Gemini 3.6 Flash | 基本同档 | 同属"准前沿"快模型 |
| GLM-5.2 Max、GPT-5.6 Luna Max | 低约 1 分 | 差距极小,互有胜负 |
| Kimi K3 Max(开放权重头部) | 低约 7 分 | 开放权重内部仍有距离 |
| GPT-5.6、Claude 5 系列旗舰 | 约 9 分以上 | 极难问题、长链路自主任务仍有明显差距 |
它不是"便宜但凑合"的小模型,而是专门把 推理、编程、工具调用和超长上下文 做得非常激进的 MoE 模型。API 中的 deepseek-v4-flash 目前已经指向 0731 版本。
最强项:代码 Agent
0731 版本提升最大的方向是让模型在终端操作、仓库修改、工具调用和多步执行中更像一个真正的 Agent,而不仅仅是写几段代码。DeepSeek 官方公布的核心基准成绩如下:
| 基准测试 | V4 Flash 0731 | 对比参考 |
|---|---|---|
| TerminalBench 2.1 | 82.7 | Claude Opus 4.8 为 85.0;GLM-5.2 为 81.0 |
| DeepSWE | 54.4 | — |
| Toolathlon-Verified | 70.3 | — |
| Cybergym | 76.7 | — |
| NL2Repo | 54.2 | 明显落后于 Opus(复杂仓库级任务) |
其中 TerminalBench 接近 Opus 4.8 水平,但 NL2Repo 等复杂仓库级任务仍有明显差距。这说明它确实具备顶级代码 Agent 的部分能力,但不能据此宣布"全面达到 Opus 水平"。
DeepSeek 已直接为 Codex 提供 Responses API 接入,支持 low / high / max 推理强度和约 104 万 token 上下文。它明显不是只为聊天准备的模型,而是把"作为编程执行器"当成了核心场景。
架构与部署
V4 Flash 0731 的架构设计在效率和规模之间做了激进取舍:
| 参数 | 数值 |
|---|---|
| 总参数量 | 284B |
| 每 token 激活参数 | 约 13B |
| 架构类型 | MoE(混合专家) |
| 上下文窗口 | 100 万 token |
| 最大输出 | 384K token |
| 特色技术 | 压缩稀疏注意力 |
性价比分析
官方 API 定价是目前市场上最具竞争力的方案之一:
| 计费项 | 价格(美元/百万 token) |
|---|---|
| 输入(缓存命中) | 0.0028 |
| 输入(缓存未命中) | 0.14 |
| 输出 | 0.28 |
独立测试机构的对比数据同样突出:
- Artificial Analysis 测得输出速度约 123 token/s,首 token 延迟约 1.32 秒
- 路透援引独立测试称,完成单项基准测试的平均成本约 0.03 美元,明显低于 Kimi K3、GPT-5.6 和 Claude 5 系列
- 与综合能力接近的 GLM-5.2 相比,混合使用成本大约只有后者的一个零头
low / high / max 推理强度。
真实短板
事实知识与幻觉控制不是旗舰水平
在 Artificial Analysis 的 Omniscience 测试中,它的知识准确率没有随 Agent 能力同步大幅提高,特定测试口径下仍表现出较高的错误断言倾向。这并非意味着"日常回答大多数都在胡说",但足以说明:它更擅长推导和执行,不等于它天然掌握更多正确事实。
涉及当前新闻、投资数据、医学、法律、API 最新文档等内容,应强制调用搜索、数据库或权威资料,而不是只凭模型记忆。
"100 万上下文"不等于 100 万内容都能可靠利用
1M 是真实的接口和架构规格,但上下文窗口大小、长文本召回能力和跨数十万 token 推理能力是三回事。0731 的公开亮点主要集中在 Agent 基准,目前还缺少足够全面的独立 1M 长上下文压力测试。
可以放心用它装整个中型仓库或大量文档,但仍应通过检索、目录摘要和分层上下文减少噪声,不能简单把一百万 token 全塞进去然后期待它毫无遗漏。
当前公开版本主要为文本模型
公开 API 和评测资料将其列为 text-only。图片、视频和复杂多模态工作流不能把它当 Gemini、GPT 或 Claude 的视觉旗舰直接替代。更合理的架构是由视觉模型负责识图,V4 Flash 负责编排、代码和后续推理。
三个最容易被营销带偏的说法
错。它是 284B MoE,只是每个 token 激活 13B,内存需求仍是百 GB 级。
需要加日期。它超过的是此前的 V4 Pro Preview 在若干 Agent 基准上的成绩,不代表超过尚未正式发布的下一版 V4 Pro。
部分终端任务确实非常接近,但在复杂仓库重建、知识准确性和最困难的自主任务上仍有明显差距,且官方使用了专门的测试 Harness。
适合场景
- 默认的低成本代码 Agent
- 批量重构、排错、写测试和仓库阅读
- 大量并行子 Agent(成本优势明显)
- 先完成 80% 工作,最难部分升级到旗舰模型
- 最难的跨仓库工程任务
- 失败代价很高的全自动操作
- 依赖大量冷门事实的问题
- 需要多模态/视觉理解的任务
最合理的架构不是只押一个模型,而是让 V4 Flash 承担绝大多数廉价执行,再根据验证结果自动升级到 Kimi K3、Claude 5、GPT-5.6 等更强模型。
决策评分
| 场景 | 评分 |
|---|---|
| 日常 Coding Agent | 9 / 10 |
| 批量、低成本 API 调用 | 9.5 / 10 |
| 开放权重综合模型 | 8.5 / 10 |
| 无搜索的事实研究 | 6.5 / 10 |
| 普通个人本地部署 | 4 / 10 |
参考来源
本文数据综合自以下来源,截至 2026-08-04:
- DeepSeek API Docs — 官方定价、模型规格与 Codex 集成文档
- Artificial Analysis — DeepSeek V4 Flash 0731 — 独立综合指数、基准评测与性价比分析
- Artificial Analysis — DeepSeek V4 Flash 0731 综合指数分析
- DeepInfra — DeepSeek-V4-Flash-0731 — 官方基准成绩与 Harness 说明
- LM Studio — DeepSeek V4 Flash — 本地部署资源需求
- Reuters — 独立测试成本对比
- AP News — 相关报道