我们很高兴地宣布:深度求索 DeepSeek-V4-Flash 正式版(模型版本号:DeepSeek-V4-Flash-0731)已正式接入唯元智创平台,即日起所有用户可通过统一 API 调用。
模型概览
DeepSeek-V4-Flash-0731 是深度求索于 2026 年 7 月 31 日发布的正式公测版本,在保持与 Preview 版完全一致的模型骨架基础上,通过重新后训练实现了 Agent 与代码能力的跨越式提升。
| 项目 | 规格 |
|---|---|
| 模型全称 | DeepSeek-V4-Flash-0731 |
| 总参数量 | 284B(2840 亿,MoE 混合专家) |
| 激活参数 | 13B(130 亿) |
| 上下文窗口 | 1,000,000 tokens |
| 最大输出长度 | 384K tokens |
| 推理模式 | 思考模式 / 非思考模式;支持 reasoning_effort |
| Responses API | ✅ 原生支持 |
| Codex 适配 | ✅ 原生适配,一键接入 |
核心亮点
1. 极致性价比,重新定义通用模型成本线
DeepSeek-V4-Flash 正式版延续了 V4 系列的低价策略,将主力模型的调用门槛推入「高频可负担」区间:
DeepSeek-V4-Flash
NEW由 深度求索 提供 · 1M 上下文窗口
按量计费,随用随付。缓存命中场景输入仅 ¥0.02 / 百万 tokens,对于知识库问答、固定模板生成等重复上下文场景,成本近乎可以忽略。企业用户可申请最高 1 亿 Token 免费试用额度。
2. 后训练驱动:同一骨架,Agent 能力全面越级
最值得关注的是:V4-Flash-0731 的模型结构、参数量与 4 月 Preview 版完全一致(284B 总参 / 13B 激活),仅通过重新后训练就实现了 Agent 与代码任务的质的飞跃——在多项基准中反超自家 V4-Pro Preview,并逼近 Claude Opus 4.8 等顶级闭源旗舰。
官方公布跨模型基准对比(Agent & 代码类)
以下为深度求索官方模型卡公布的 9 项基准完整对比表(DSBench 系列为 DeepSeek 内部测试集)。V4-Flash 0731 在 所有已公布分数的项目中,全面超越 GLM-5.2,并在 5 项上接近 Opus 4.8:
| 基准测试 | 考察方向 | V4-Flash Preview | V4-Flash 0731 正式版 | V4-Pro Preview | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 终端命令执行与纠错 | 61.8 | 82.7 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 自然语言到仓库代码生成 | 39.4 | 54.2 | 38.5 | 48.9 | 69.7 |
| Cybergym | 网络安全攻防决策 | 38.7 | 76.7 | 52.7 | — | 83.1 |
| DeepSWE | 真实软件工程任务 | 7.3 | 54.4 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 工具调用准确率 | 49.7 | 70.3 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 端到端 Agent 综合考核 | 15.8 | 25.2 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 自动化工作流 | 10.8 | 25.1 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 全栈开发全流程(内部) | 37.0 | 68.7 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 高难度长程任务(内部) | 25.8 | 59.6 | 31.1 | 54.5 | 71.7 |
关键信号:轻量档位反超旗舰预览版
注意对比 V4-Flash 0731 与 V4-Pro Preview 的分数:V4-Flash(13B 激活)在全部 9 项基准中全面反超 V4-Pro Preview(49B 激活),最大差距出现在 Terminal Bench 2.1(82.7 vs 72.1,领先 10.6 分)和 DeepSWE(54.4 vs 12.8,领先 41.6 分)。这打破了「参数越大能力越强」的传统定价逻辑。
第三方验证数据(Artificial Analysis & Arena)
官方数据之外,独立第三方评测平台同步给出了验证结果:
| 第三方评测 | 指标 | V4-Flash 0731 | 对比参考 |
|---|---|---|---|
| Artificial Analysis 智能指数 | 综合能力总分 | 50 | ↑10 分 vs 4 月 Preview;仅落后 GPT-5.6 Luna(51)1 分;追平 Gemini 3.6 Flash(50);落后 Kimi K3(57)7 分 |
| GDPval-AA v2(Agent 真实任务 Elo) | Agent 落地能力 | 1559 | 较 Preview 版 1189 分提升 370 Elo;开源权重模型中暂列第 2(Kimi K3 1687 第 1,GLM-5.2 1510 第 3) |
| Frontend Code Arena Elo | 前端代码竞技 | 1586 | 开放类别排名第 3;较 Preview 版提升 154 分 |
| 单任务成本对比(含缓存) | 成本效率 | — | 即使 OpenAI 将 GPT-5.6 Luna 降价 80%,V4-Flash 0731 单任务成本仍低约 60% |
数据口径说明
官方基准测试条件:使用 DeepSeek Harness 极简模式,reasoning_effort = max,temperature = 1.0,top_p = 0.95。DSBench 为内部数据集,成绩以官方发布为准。第三方成绩来源:Artificial Analysis Intelligence Index v4.1、Arena.ai Frontend Code Arena。
跨厂商定价对比
结合上述性能数据,横向对比国内外主流模型的官方 API 定价,V4-Flash 0731 的性价比优势极为显著:
| 模型 | 输入(¥/百万 token) | 输出(¥/百万 token) | 输出价差倍数(vs V4F) |
|---|---|---|---|
| DeepSeek V4-Flash 0731 | 1(缓存命中 0.02) | 2 | 基准(1×) |
| GPT-5.6 Luna(降价 80% 后) | ~1.4 | ~8.6 | 4.3× |
| MiniMax M2.7 | 2.1 | 8.4 | 4.2× |
| 阿里 Qwen3-Max | 2.5 | 10 | 5× |
| 字节 Seed-2.0-Pro | 3.2 | 16 | 8× |
| 智谱 GLM-5.1 | 6 | 24 | 12× |
| 百度 ERNIE 5.0 | 6 | 24 | 12× |
| Gemini 3.1 Pro | — | ~86 | 43× |
| Claude Opus 4.8 | — | ~180 | 90× |
这一后训练驱动的提升路径具有很强的行业信号意义:同一架构下,后训练的优化空间可能远超过传统认知的「锦上添花」范畴——参数规模不再是能力的唯一决定因素,针对性的数据工程与对齐策略可以成为新的竞争杠杆。
3. 1M 超长上下文 + 384K 最大输出
在 130 亿激活参数的轻量化架构下,V4-Flash 正式版原生支持 100 万 token 上下文窗口,最大输出长度达 384K tokens。这意味着:
- 一次性处理整本长篇小说、完整代码仓库,无需分段切割
- 长对话场景保持上下文连贯,避免信息丢失
- 多文档合并分析、大型 RAG 系统的底层能力更扎实
4. 原生 Responses API + Codex 一键适配
V4-Flash-0731 是目前 DeepSeek V4 系列中唯一原生支持 Responses API 格式的模型。过去需要 Codex 用户通过降级模式或代理协议转换才能接入 DeepSeek 的痛点被彻底解决:
- Codex CLI / ChatGPT 桌面端 / VS Code Codex 插件可直接对接
- 全部 Agent 功能(子智能体、工具调用、代码审查)完整可用
- 官方提供一键安装脚本,配置流程缩短至一条命令
适用场景
根据 V4-Flash 正式版的能力边界与定价特点,推荐用于以下场景:
- 高频次日常任务:文档摘要、文本分类、常规问答、内容重写
- 代码开发辅助:IDE 代码补全、函数生成、单元测试编写、简单 Bug 修复
- 轻量级 Agent:工具调用型智能体、自动化工作流、数据处理流水线
- 长文档处理:合同审查、报告生成、知识库问答、RAG 检索增强
- 批量离线推理:大规模数据标注、语料清洗、内容生产流水线
与 V4-Pro 的选型建议
V4-Flash 正式版足以覆盖 80% 的日常业务场景。如果你的任务涉及高难度多步推理、竞赛级代码、复杂系统架构设计、深度法律/金融文档分析,建议等待 V4-Pro 正式版发布后评估切换。唯元智创平台将第一时间接入 V4-Pro 正式版,同一 API Key 即可无缝切换。
快速开始
通过唯元智创的 OpenAI 兼容协议,一行代码即可调用:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.weimeta.cn/v1"
)
# 普通模式:快速直出,成本最低
response = client.chat.completions.create(
model="deepSeek-v4-flash-0731",
messages=[
{"role": "system", "content": "你是专业助手,回答简洁准确"},
{"role": "user", "content": "总结这份技术文档的核心要点"}
],
temperature=0.7,
max_tokens=8192
)
print(response.choices[0].message.content)
开启思考模式,适合 Agent 与复杂代码任务:
# 思考模式:深度推理,复杂任务首选
response = client.chat.completions.create(
model="deepSeek-v4-flash-0731",
messages=[
{"role": "system", "content": "专业编程与智能体助手"},
{"role": "user", "content": "分析这个项目的架构并设计重构方案"}
],
max_tokens=32768,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high"
}
)
print(response.choices[0].message.content)
DeepSeek-V4-Flash 现已加入唯元智创统一模型网关,与 Kimi-K3、GLM-5.2、Qwen3.7-Max 等 30+ 模型共享同一个 API Key,可随时根据任务复杂度无缝切换模型,无需分别对接厂商。
峰谷定价提示
DeepSeek 官方即将对 V4 系列引入峰谷定价策略:
- 高峰时段(北京时间每日 9:00–12:00、14:00–18:00):价格为平时的 2 倍
- 平峰时段(其余约 71% 时间):保持本文所列原价
建议非紧急批量任务(数据处理、离线推理、批量生成)安排在平峰时段运行,以进一步控制成本。
下一步
我们将持续接入更多顶尖模型,为开发者提供最全面的大模型能力。DeepSeek-V4-Pro 正式版预计 8 月初发布,唯元智创平台将第一时间同步接入。
如有任何问题或模型接入需求,欢迎通过官网 weimeta.cn 联系我们的技术团队。