唯元智创上线 DeepSeek-V4-Flash 正式版:13B 激活参数 + 1M 上下文,输入 ¥1/M 起

作者:唯元智创 平台公告

我们很高兴地宣布:深度求索 DeepSeek-V4-Flash 正式版(模型版本号:DeepSeek-V4-Flash-0731)已正式接入唯元智创平台,即日起所有用户可通过统一 API 调用。

模型概览

DeepSeek-V4-Flash-0731 是深度求索于 2026 年 7 月 31 日发布的正式公测版本,在保持与 Preview 版完全一致的模型骨架基础上,通过重新后训练实现了 Agent 与代码能力的跨越式提升。

项目规格
模型全称DeepSeek-V4-Flash-0731
总参数量284B(2840 亿,MoE 混合专家)
激活参数13B(130 亿)
上下文窗口1,000,000 tokens
最大输出长度384K tokens
推理模式思考模式 / 非思考模式;支持 reasoning_effort
Responses API✅ 原生支持
Codex 适配✅ 原生适配,一键接入

核心亮点

1. 极致性价比,重新定义通用模型成本线

DeepSeek-V4-Flash 正式版延续了 V4 系列的低价策略,将主力模型的调用门槛推入「高频可负担」区间:

DeepSeek-V4-Flash

NEW

由 深度求索 提供 · 1M 上下文窗口

输入价格
¥1 / M tokens(缓存命中 ¥0.02)
输出价格
¥2 / M tokens

按量计费,随用随付。缓存命中场景输入仅 ¥0.02 / 百万 tokens,对于知识库问答、固定模板生成等重复上下文场景,成本近乎可以忽略。企业用户可申请最高 1 亿 Token 免费试用额度。

2. 后训练驱动:同一骨架,Agent 能力全面越级

最值得关注的是:V4-Flash-0731 的模型结构、参数量与 4 月 Preview 版完全一致(284B 总参 / 13B 激活),仅通过重新后训练就实现了 Agent 与代码任务的质的飞跃——在多项基准中反超自家 V4-Pro Preview,并逼近 Claude Opus 4.8 等顶级闭源旗舰

官方公布跨模型基准对比(Agent & 代码类)

以下为深度求索官方模型卡公布的 9 项基准完整对比表(DSBench 系列为 DeepSeek 内部测试集)。V4-Flash 0731 在 所有已公布分数的项目中,全面超越 GLM-5.2,并在 5 项上接近 Opus 4.8:

基准测试考察方向V4-Flash PreviewV4-Flash 0731 正式版V4-Pro PreviewGLM-5.2Claude Opus 4.8
Terminal Bench 2.1终端命令执行与纠错61.882.772.181.085.0
NL2Repo自然语言到仓库代码生成39.454.238.548.969.7
Cybergym网络安全攻防决策38.776.752.783.1
DeepSWE真实软件工程任务7.354.412.846.258.0
Toolathlon-Verified工具调用准确率49.770.355.959.976.2
Agents’ Last Exam端到端 Agent 综合考核15.825.216.523.825.7
AutomationBench Public自动化工作流10.825.112.812.927.2
DSBench-FullStack †全栈开发全流程(内部)37.068.741.861.871.6
DSBench-Hard †高难度长程任务(内部)25.859.631.154.571.7
关键信号:轻量档位反超旗舰预览版

注意对比 V4-Flash 0731 与 V4-Pro Preview 的分数:V4-Flash(13B 激活)在全部 9 项基准中全面反超 V4-Pro Preview(49B 激活),最大差距出现在 Terminal Bench 2.1(82.7 vs 72.1,领先 10.6 分)和 DeepSWE(54.4 vs 12.8,领先 41.6 分)。这打破了「参数越大能力越强」的传统定价逻辑。

第三方验证数据(Artificial Analysis & Arena)

官方数据之外,独立第三方评测平台同步给出了验证结果:

第三方评测指标V4-Flash 0731对比参考
Artificial Analysis 智能指数综合能力总分50↑10 分 vs 4 月 Preview;仅落后 GPT-5.6 Luna(51)1 分;追平 Gemini 3.6 Flash(50);落后 Kimi K3(57)7 分
GDPval-AA v2(Agent 真实任务 Elo)Agent 落地能力1559较 Preview 版 1189 分提升 370 Elo;开源权重模型中暂列第 2(Kimi K3 1687 第 1,GLM-5.2 1510 第 3)
Frontend Code Arena Elo前端代码竞技1586开放类别排名第 3;较 Preview 版提升 154 分
单任务成本对比(含缓存)成本效率即使 OpenAI 将 GPT-5.6 Luna 降价 80%,V4-Flash 0731 单任务成本仍低约 60%
数据口径说明

官方基准测试条件:使用 DeepSeek Harness 极简模式,reasoning_effort = maxtemperature = 1.0top_p = 0.95。DSBench 为内部数据集,成绩以官方发布为准。第三方成绩来源:Artificial Analysis Intelligence Index v4.1、Arena.ai Frontend Code Arena。

跨厂商定价对比

结合上述性能数据,横向对比国内外主流模型的官方 API 定价,V4-Flash 0731 的性价比优势极为显著:

模型输入(¥/百万 token)输出(¥/百万 token)输出价差倍数(vs V4F)
DeepSeek V4-Flash 07311(缓存命中 0.02)2基准(1×)
GPT-5.6 Luna(降价 80% 后)~1.4~8.64.3×
MiniMax M2.72.18.44.2×
阿里 Qwen3-Max2.510
字节 Seed-2.0-Pro3.216
智谱 GLM-5.162412×
百度 ERNIE 5.062412×
Gemini 3.1 Pro~8643×
Claude Opus 4.8~18090×

这一后训练驱动的提升路径具有很强的行业信号意义:同一架构下,后训练的优化空间可能远超过传统认知的「锦上添花」范畴——参数规模不再是能力的唯一决定因素,针对性的数据工程与对齐策略可以成为新的竞争杠杆。

3. 1M 超长上下文 + 384K 最大输出

在 130 亿激活参数的轻量化架构下,V4-Flash 正式版原生支持 100 万 token 上下文窗口,最大输出长度达 384K tokens。这意味着:

  • 一次性处理整本长篇小说、完整代码仓库,无需分段切割
  • 长对话场景保持上下文连贯,避免信息丢失
  • 多文档合并分析、大型 RAG 系统的底层能力更扎实

4. 原生 Responses API + Codex 一键适配

V4-Flash-0731 是目前 DeepSeek V4 系列中唯一原生支持 Responses API 格式的模型。过去需要 Codex 用户通过降级模式或代理协议转换才能接入 DeepSeek 的痛点被彻底解决:

  • Codex CLI / ChatGPT 桌面端 / VS Code Codex 插件可直接对接
  • 全部 Agent 功能(子智能体、工具调用、代码审查)完整可用
  • 官方提供一键安装脚本,配置流程缩短至一条命令

适用场景

根据 V4-Flash 正式版的能力边界与定价特点,推荐用于以下场景:

  • 高频次日常任务:文档摘要、文本分类、常规问答、内容重写
  • 代码开发辅助:IDE 代码补全、函数生成、单元测试编写、简单 Bug 修复
  • 轻量级 Agent:工具调用型智能体、自动化工作流、数据处理流水线
  • 长文档处理:合同审查、报告生成、知识库问答、RAG 检索增强
  • 批量离线推理:大规模数据标注、语料清洗、内容生产流水线
与 V4-Pro 的选型建议

V4-Flash 正式版足以覆盖 80% 的日常业务场景。如果你的任务涉及高难度多步推理、竞赛级代码、复杂系统架构设计、深度法律/金融文档分析,建议等待 V4-Pro 正式版发布后评估切换。唯元智创平台将第一时间接入 V4-Pro 正式版,同一 API Key 即可无缝切换。

快速开始

通过唯元智创的 OpenAI 兼容协议,一行代码即可调用:

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.weimeta.cn/v1"
)

# 普通模式:快速直出,成本最低
response = client.chat.completions.create(
    model="deepSeek-v4-flash-0731",
    messages=[
        {"role": "system", "content": "你是专业助手,回答简洁准确"},
        {"role": "user", "content": "总结这份技术文档的核心要点"}
    ],
    temperature=0.7,
    max_tokens=8192
)
print(response.choices[0].message.content)

开启思考模式,适合 Agent 与复杂代码任务:

# 思考模式:深度推理,复杂任务首选
response = client.chat.completions.create(
    model="deepSeek-v4-flash-0731",
    messages=[
        {"role": "system", "content": "专业编程与智能体助手"},
        {"role": "user", "content": "分析这个项目的架构并设计重构方案"}
    ],
    max_tokens=32768,
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high"
    }
)
print(response.choices[0].message.content)

DeepSeek-V4-Flash 现已加入唯元智创统一模型网关,与 Kimi-K3、GLM-5.2、Qwen3.7-Max 等 30+ 模型共享同一个 API Key,可随时根据任务复杂度无缝切换模型,无需分别对接厂商。

峰谷定价提示

DeepSeek 官方即将对 V4 系列引入峰谷定价策略:

  • 高峰时段(北京时间每日 9:00–12:00、14:00–18:00):价格为平时的 2 倍
  • 平峰时段(其余约 71% 时间):保持本文所列原价

建议非紧急批量任务(数据处理、离线推理、批量生成)安排在平峰时段运行,以进一步控制成本。

下一步

我们将持续接入更多顶尖模型,为开发者提供最全面的大模型能力。DeepSeek-V4-Pro 正式版预计 8 月初发布,唯元智创平台将第一时间同步接入。

如有任何问题或模型接入需求,欢迎通过官网 weimeta.cn 联系我们的技术团队。