V4-Flash 从预览走向正式公开 Beta。架构与规模不变(284B 总参 / 13B 激活,MoE,1M 上下文),
本轮只做了重新后训练,把 agent、写码与工具调用能力整体拉高,
并原生支持 Responses API、针对 Codex 做了适配。
调用方式不变,模型名仍用 deepseek-v4-flash。
官方 Change Log 原话是「保持架构与规模不变,仅重新后训练」。变化集中在 agent、代码与工具调用,以及接口层。
0731 版本的发布口径很明确:不是换模型,是把同一个模型练得更会用工具。 额外的后训练让它在终端操作、仓库级编码、多步工具调用上的表现显著提升—— 官方给出的 9 项 agent 基准「全面超过 V4-Pro-Preview」。
接口层新增两件事:Responses API 原生支持,以及针对
Codex 的专门适配。OpenAI 兼容的 ChatCompletions 与
Anthropic 接口继续保留,老客户端不用迁移。
注意一个边界:这次只升级了 V4-Flash 的 API。 V4-Pro 与 DeepSeek 官方 App / Web 上的模型没有变动,V4-Pro 的正式发布「随后」到来。
与预览版一致,来自 DeepSeek 官方文档 Models & Pricing 页。
| 模型版本 | DeepSeek-V4-Flash-0731调用名不变:deepseek-v4-flash |
| 总参数量 | 284B |
| 激活参数 / token | 13BMoE 稀疏结构,低激活保证吞吐与成本 |
| 上下文长度 | 1,048,576(约 1M) |
| 最大输出 | 384K |
| 输入模态 | 纯文本不支持原生图像输入 |
| 思考模式默认开启 | thinking / non-thinking 双模式 |
| 接口 | OpenAI ChatCompletions · Anthropic · Responses APIResponses API 目前仅 Flash 支持 |
| 能力 | Tool Calls · JSON Output · Chat Prefix · FIMFIM 仅非思考模式可用 |
| 并发上限 | 2500V4-Pro 为 500 |
以下为 DeepSeek 官方 Change Log(2026-07-31)公布的数据,官方口径为「全面超过 V4-Pro-Preview」。
评估于 2026-06-25,基于预览构建。官方后训练目标正是 agent / 编码这一轴,新构建在这类任务上应更强。
OrcaRouter 网关实测数据,供参考。
单位:美元 / 每 1M tokens。升级没有涨价,Flash 的 0731 构建与预览版同价。
| 模型 | 输入 · 缓存命中 | 输入 · 未命中 | 输出 | 并发上限 |
|---|---|---|---|---|
| deepseek-v4-flash DeepSeek-V4-Flash-0731 |
$0.0028 | $0.14 | $0.28 | 2500 |
| deepseek-v4-pro V4-Pro 正式版未发布,价格为当前 API |
$0.003625 | $0.435 | $0.87 | 500 |
峰谷定价预告:官方即将实行峰 / 谷时段定价,高峰时段(北京时间 9:00–12:00、14:00–18:00) 所有计费项按 2 倍计费,具体生效日期以官方公告为准。 旧模型名停用:deepseek-chat 与 deepseek-reasoner 已在 2026-07-24 停用,过渡期内分别指向 V4-Flash 的非思考 / 思考模式。
base_url 与鉴权保持不变,把 model 写成 deepseek-v4-flash 即可拿到 0731。
https://api.deepseek.com(OpenAI 格式)https://api.deepseek.com/anthropic(Anthropic 格式)deepseek-v4-flash 即自动使用最新版本 0731thinking: {"type":"enabled"} + reasoning_effort 控制力度// 官方示例 · 思考模式 + Node SDK import OpenAI from "openai"; const client = new OpenAI({ baseURL: "https://api.deepseek.com", // 没变 apiKey: process.env.DEEPSEEK_API_KEY, }); const res = await client.chat.completions.create({ model: "deepseek-v4-flash", // 0731 已包含 messages: [ { role: "system", content: "You are a helpful assistant." }, { role: "user", content: "Hello" }, ], thinking: { type: "enabled" }, // 思考模式 reasoning_effort: "high", stream: false, }); console.log(res.choices[0].message.content);
两条主线:0731 的公开 Beta,以及 0424 的 V4 首发。
V4-Flash API 正式进入公开 Beta。架构与规模不变,仅重新后训练;Agent 能力显著增强,官方 9 项基准全面超过 V4-Pro-Preview。
Responses API,针对 Codex 专门适配deepseek-v4-flash,价格不变V4-Pro 与 V4-Flash 同日上线,均原生 1M 上下文,权重以 MIT 协议开源在 Hugging Face。API 同时支持 OpenAI 与 Anthropic 两种格式。
1.6T 总参 / 49B 激活;V4-Flash:284B 总参 / 13B 激活deepseek-v4-pro / deepseek-v4-flashdeepseek-chat / deepseek-reasoner 三个月后(2026-07-24)停用两个旧模型名按计划停用。过渡期内它们分别指向 V4-Flash 的非思考 / 思考模式。