Model Release Note · 2026.07.31

DeepSeek-V4-Flash0731
公开 Beta 发布说明

V4-Flash 从预览走向正式公开 Beta。架构与规模不变(284B 总参 / 13B 激活,MoE,1M 上下文), 本轮只做了重新后训练,把 agent、写码与工具调用能力整体拉高, 并原生支持 Responses API、针对 Codex 做了适配。 调用方式不变,模型名仍用 deepseek-v4-flash

Public Beta · 2026-07-31 上线 · 全量可用
查看接入方式 看基准数据
284B 总参
MoE · 每 token 激活 13B
1M tokens
上下文 · 1,048,576
384K tokens
最大输出
$0.14 /1M
输入价 · 输出 $0.28
What Changed

这次不是新架构,是新能力

官方 Change Log 原话是「保持架构与规模不变,仅重新后训练」。变化集中在 agent、代码与工具调用,以及接口层。

0731 版本的发布口径很明确:不是换模型,是把同一个模型练得更会用工具。 额外的后训练让它在终端操作、仓库级编码、多步工具调用上的表现显著提升—— 官方给出的 9 项 agent 基准「全面超过 V4-Pro-Preview」。

接口层新增两件事:Responses API 原生支持,以及针对 Codex 的专门适配。OpenAI 兼容的 ChatCompletions 与 Anthropic 接口继续保留,老客户端不用迁移。

注意一个边界:这次只升级了 V4-Flash 的 API。 V4-Pro 与 DeepSeek 官方 App / Web 上的模型没有变动,V4-Pro 的正式发布「随后」到来。

  • 重新后训练,规模不变DeepSeek-V4-Flash-0731 与预览版同架构同大小
  • Agent 能力显著增强官方 9 项基准全部超过 V4-Pro-Preview
  • 原生支持 Responses API当前仅 Flash 支持,Pro 预计 8 月初补上
  • 为 Codex 做了专门适配配合官方配置即可直连
  • 仅升级 Flash APIV4-Pro 与 App / Web 模型保持不变
Model Specs

模型规格

与预览版一致,来自 DeepSeek 官方文档 Models & Pricing 页。

模型版本DeepSeek-V4-Flash-0731调用名不变:deepseek-v4-flash
总参数量284B
激活参数 / token13BMoE 稀疏结构,低激活保证吞吐与成本
上下文长度1,048,576(约 1M)
最大输出384K
输入模态纯文本不支持原生图像输入
思考模式默认开启thinking / non-thinking 双模式
接口OpenAI ChatCompletions · Anthropic · Responses APIResponses API 目前仅 Flash 支持
能力Tool Calls · JSON Output · Chat Prefix · FIMFIM 仅非思考模式可用
并发上限2500V4-Pro 为 500
Benchmarks

官方 agent 基准

以下为 DeepSeek 官方 Change Log(2026-07-31)公布的数据,官方口径为「全面超过 V4-Pro-Preview」。

DeepSeek-V4-Flash-0731 · 官方评测

得分越高越好
Terminal-Bench 2.1
82.7
Cybergym
76.7
Toolathlon verified
70.3
DSBench-FullStack 内部
68.7
DSBench-Hard 内部
59.6
DeepSWE
54.4
NL2Repo
54.2
Agent Last Exam
25.2
Automation Bench Public
25.1
测试条件:DeepSeek Harness minimal 模式,max effort,topp=0.95,temperature=1.0。 DSBench-FullStack 与 DSBench-Hard 为内部测试集。以上为厂商数据,跑在官方自己的框架上,数值偏乐观属正常,投产前建议用自己的任务复测。

第三方评测(预览版)

Artificial Analysis · AA Coding56.2
Artificial Analysis · AA Intelligence40.3
Artificial Analysis · AA Math50.0

评估于 2026-06-25,基于预览构建。官方后训练目标正是 agent / 编码这一轴,新构建在这类任务上应更强。

服务实测

p50 首 token 延迟(TTFT)≈ 394 ms
输出吞吐≈ 184 tok/s
上下文1,048,576

OrcaRouter 网关实测数据,供参考。

Pricing

官方价格(2026-07-31)

单位:美元 / 每 1M tokens。升级没有涨价,Flash 的 0731 构建与预览版同价。

模型输入 · 缓存命中输入 · 未命中输出并发上限
deepseek-v4-flash
DeepSeek-V4-Flash-0731
$0.0028 $0.14 $0.28 2500
deepseek-v4-pro
V4-Pro 正式版未发布,价格为当前 API
$0.003625 $0.435 $0.87 500

峰谷定价预告:官方即将实行峰 / 谷时段定价,高峰时段(北京时间 9:00–12:00、14:00–18:00) 所有计费项按 2 倍计费,具体生效日期以官方公告为准。 旧模型名停用:deepseek-chatdeepseek-reasoner 已在 2026-07-24 停用,过渡期内分别指向 V4-Flash 的非思考 / 思考模式。

Quick Start

接入方式没变

base_url 与鉴权保持不变,把 model 写成 deepseek-v4-flash 即可拿到 0731。

要点

  1. 01
    base_url 不变https://api.deepseek.com(OpenAI 格式)
    https://api.deepseek.com/anthropic(Anthropic 格式)
  2. 02
    模型名deepseek-v4-flash 即自动使用最新版本 0731
  3. 03
    思考模式默认开启;传 thinking: {"type":"enabled"} + reasoning_effort 控制力度
  4. 04
    Agent / IDE 直连Claude Code、GitHub Copilot、OpenCode 等可直接以它为后端
  5. 05
    CodexResponses API + 专门适配,配置见官方 agent 集成文档
examples/quickstart.mjs
// 官方示例 · 思考模式 + Node SDK
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",  // 没变
  apiKey:  process.env.DEEPSEEK_API_KEY,
});

const res = await client.chat.completions.create({
  model: "deepseek-v4-flash",          // 0731 已包含
  messages: [
    { role: "system", content: "You are a helpful assistant." },
    { role: "user",    content: "Hello" },
  ],
  thinking: { type: "enabled" },      // 思考模式
  reasoning_effort: "high",
  stream: false,
});

console.log(res.choices[0].message.content);
Changelog

更新日志

两条主线:0731 的公开 Beta,以及 0424 的 V4 首发。

DeepSeek-V4-Flash 公开 Beta 07312026-07-31

V4-Flash API 正式进入公开 Beta。架构与规模不变,仅重新后训练;Agent 能力显著增强,官方 9 项基准全面超过 V4-Pro-Preview。

  • 官方基准(max effort):Terminal-Bench 2.1 82.7、Cybergym 76.7、Toolathlon verified 70.3、DeepSWE 54.4、NL2Repo 54.2
  • 原生支持 Responses API,针对 Codex 专门适配
  • 仅升级 V4-Flash API;V4-Pro 与 App / Web 模型不变,V4-Pro 正式版随后发布
  • 调用方式不变,模型名仍为 deepseek-v4-flash,价格不变
来源:DeepSeek API Docs · Change Log(2026-07-31)

DeepSeek-V4 发布 首发2026-04-24

V4-Pro 与 V4-Flash 同日上线,均原生 1M 上下文,权重以 MIT 协议开源在 Hugging Face。API 同时支持 OpenAI 与 Anthropic 两种格式。

  • V4-Pro:1.6T 总参 / 49B 激活;V4-Flash:284B 总参 / 13B 激活
  • base_url 不变,model 参数改为 deepseek-v4-pro / deepseek-v4-flash
  • 旧模型名 deepseek-chat / deepseek-reasoner 三个月后(2026-07-24)停用
来源:DeepSeek API Docs · News(2026-04-24)

deepseek-chat / deepseek-reasoner 停用 过渡期结束2026-07-24

两个旧模型名按计划停用。过渡期内它们分别指向 V4-Flash 的非思考 / 思考模式。