← 返回首页
模型深度解读

DeepSeek V4 Flash 0731
深度解读

开放权重模型第一梯队,全球模型第二梯队上沿。代码 Agent 能力接近顶级,API 成本近乎统治级。但它的真实能力边界在哪里?哪些场景值得用,哪些场景最好换一个?

最后更新:2026-08-04

一句话总结:DeepSeek V4 Flash 0731 是一个 284B 总参数 / 13B 激活 的 MoE 模型,在代码 Agent 任务上接近全球顶级水平,API 价格却只有旗舰模型的零头。它不是"世界最强模型",但把"接近前沿的代码 Agent 能力"压到了极低成本 —— 对于软件开发、自动化生产和批量 Agent 场景,是目前最值得优先试用的模型之一。

能力定位:它站在哪里

据 Artificial Analysis 独立综合指数,V4 Flash 0731 得分 50,处于全球模型第二梯队上沿:

对比对象综合指数差距定位说明
Gemini 3.6 Flash基本同档同属"准前沿"快模型
GLM-5.2 Max、GPT-5.6 Luna Max低约 1 分差距极小,互有胜负
Kimi K3 Max(开放权重头部)低约 7 分开放权重内部仍有距离
GPT-5.6、Claude 5 系列旗舰约 9 分以上极难问题、长链路自主任务仍有明显差距

它不是"便宜但凑合"的小模型,而是专门把 推理、编程、工具调用和超长上下文 做得非常激进的 MoE 模型。API 中的 deepseek-v4-flash 目前已经指向 0731 版本。

最强项:代码 Agent

0731 版本提升最大的方向是让模型在终端操作、仓库修改、工具调用和多步执行中更像一个真正的 Agent,而不仅仅是写几段代码。DeepSeek 官方公布的核心基准成绩如下:

基准测试V4 Flash 0731对比参考
TerminalBench 2.182.7Claude Opus 4.8 为 85.0;GLM-5.2 为 81.0
DeepSWE54.4
Toolathlon-Verified70.3
Cybergym76.7
NL2Repo54.2明显落后于 Opus(复杂仓库级任务)

其中 TerminalBench 接近 Opus 4.8 水平,但 NL2Repo 等复杂仓库级任务仍有明显差距。这说明它确实具备顶级代码 Agent 的部分能力,但不能据此宣布"全面达到 Opus 水平"。

重要限制:官方编程成绩使用了尚未公开的最小化 Agent Harness、最大推理强度和特定采样设置。换成 Codex、Claude Code、OpenCode 或第三方 API 服务商,成绩可能差很多。官方分数更接近"能力上限",而不是开箱即用的必然效果。

DeepSeek 已直接为 Codex 提供 Responses API 接入,支持 low / high / max 推理强度和约 104 万 token 上下文。它明显不是只为聊天准备的模型,而是把"作为编程执行器"当成了核心场景。

架构与部署

V4 Flash 0731 的架构设计在效率和规模之间做了激进取舍:

参数数值
总参数量284B
每 token 激活参数约 13B
架构类型MoE(混合专家)
上下文窗口100 万 token
最大输出384K token
特色技术压缩稀疏注意力
⚠ 关于"13B 激活"的常见误解:"13B 激活"只代表每次计算调用的专家数量较少,不代表只需加载 13B 参数。所有专家权重仍需存放在内存或显存中:较完整的本地 GGUF 版本约需 156GB 内存;激进的 3-bit 量化也在 103GB 左右。它不是一张 24GB 显卡就能舒服运行的模型。

性价比分析

官方 API 定价是目前市场上最具竞争力的方案之一:

计费项价格(美元/百万 token)
输入(缓存命中)0.0028
输入(缓存未命中)0.14
输出0.28

独立测试机构的对比数据同样突出:

  • Artificial Analysis 测得输出速度约 123 token/s,首 token 延迟约 1.32 秒
  • 路透援引独立测试称,完成单项基准测试的平均成本约 0.03 美元,明显低于 Kimi K3、GPT-5.6 和 Claude 5 系列
  • 与综合能力接近的 GLM-5.2 相比,混合使用成本大约只有后者的一个零头
注意:它"比较能写",独立测试中的输出 token 消耗明显高于开放权重模型中位数。单 token 巨便宜,不等于每个任务都能省到理论比例。建议在系统提示词中要求先规划、避免重复解释,并按任务选择 low / high / max 推理强度。

真实短板

事实知识与幻觉控制不是旗舰水平

在 Artificial Analysis 的 Omniscience 测试中,它的知识准确率没有随 Agent 能力同步大幅提高,特定测试口径下仍表现出较高的错误断言倾向。这并非意味着"日常回答大多数都在胡说",但足以说明:它更擅长推导和执行,不等于它天然掌握更多正确事实。

涉及当前新闻、投资数据、医学、法律、API 最新文档等内容,应强制调用搜索、数据库或权威资料,而不是只凭模型记忆。

"100 万上下文"不等于 100 万内容都能可靠利用

1M 是真实的接口和架构规格,但上下文窗口大小、长文本召回能力和跨数十万 token 推理能力是三回事。0731 的公开亮点主要集中在 Agent 基准,目前还缺少足够全面的独立 1M 长上下文压力测试。

可以放心用它装整个中型仓库或大量文档,但仍应通过检索、目录摘要和分层上下文减少噪声,不能简单把一百万 token 全塞进去然后期待它毫无遗漏。

当前公开版本主要为文本模型

公开 API 和评测资料将其列为 text-only。图片、视频和复杂多模态工作流不能把它当 Gemini、GPT 或 Claude 的视觉旗舰直接替代。更合理的架构是由视觉模型负责识图,V4 Flash 负责编排、代码和后续推理。

三个最容易被营销带偏的说法

"只有 13B,所以本地很好跑"

错。它是 284B MoE,只是每个 token 激活 13B,内存需求仍是百 GB 级。

"已经超过 V4 Pro"

需要加日期。它超过的是此前的 V4 Pro Preview 在若干 Agent 基准上的成绩,不代表超过尚未正式发布的下一版 V4 Pro。

"TerminalBench 接近 Opus,整体等于 Opus"

部分终端任务确实非常接近,但在复杂仓库重建、知识准确性和最困难的自主任务上仍有明显差距,且官方使用了专门的测试 Harness。

适合场景

✅ 非常适合
  • 默认的低成本代码 Agent
  • 批量重构、排错、写测试和仓库阅读
  • 大量并行子 Agent(成本优势明显)
  • 先完成 80% 工作,最难部分升级到旗舰模型
⚠ 建议谨慎
  • 最难的跨仓库工程任务
  • 失败代价很高的全自动操作
  • 依赖大量冷门事实的问题
  • 需要多模态/视觉理解的任务

最合理的架构不是只押一个模型,而是让 V4 Flash 承担绝大多数廉价执行,再根据验证结果自动升级到 Kimi K3、Claude 5、GPT-5.6 等更强模型。

决策评分

场景评分
日常 Coding Agent9 / 10
批量、低成本 API 调用9.5 / 10
开放权重综合模型8.5 / 10
无搜索的事实研究6.5 / 10
普通个人本地部署4 / 10

参考来源

本文数据综合自以下来源,截至 2026-08-04: