AI 大模型的竞争又迎来了新一轮升级。就在昨晚,DeepSeek 正式发布 DeepSeek V4 Flash 0731。相比此前的预览版本,这次不仅性能迎来大幅提升,还正式支持 Responses API,并全面兼容 Codex,对于开发者来说无疑是一大利好。

更重要的是,官方表示新版本的 Agent 能力也得到了明显增强,而社区的大量实测也证明,这次的升级并不是简单的小修小补,而是真正意义上的一次跃升。

官方发布:Agent 能力全面升级

根据 DeepSeek 官方公布的信息,最新版 DeepSeek-V4-Flash-0731 已正式开放使用。

此次更新主要包括:

  • Agent 能力大幅增强
  • 原生支持 Responses API
  • 完全兼容 Codex
  • 整体推理能力进一步提升
  • 多项 Benchmark 超越此前的 V4-Pro-Preview

前端代码能力暴涨,竞技场排名直接冲到全球第七

除了官方数据之外,AI Arena 最新公布的成绩也十分亮眼。

DeepSeek V4 Flash High 在 Frontend Coding Arena 中:

  • 全球排名第 7
  • 得分 1586
  • 开源模型排名第 3
  • 消费级产品排名第 4
  • Data & Analysis、Reference Design、Game 分类排名第 6
  • Brand & Marketing 排名第 7

相比此前的 Preview 版本,一次更新直接提升 154 分

这说明这次升级最大的变化之一,就是代码生成能力。

本地部署

喜欢本地运行的朋友,现在也可以下载量化版本。

GGUF 量化模型下载地址:

1、Huggingface 下载【点击前往

2、模型打包下载:【点击前往

目前已经提供适用于 llama.cpp、Unsloth 等框架的版本。

根据 官方介绍:

  • 168GB 内存可运行无损 4-bit
  • 110GB 内存可运行 3-bit
  • 后续还会继续推出更小尺寸量化模型

 

我们实际测试一下

Benchmark 再漂亮,最终还是要看真实使用效果。

首先,我们直接把它接入 Hermes Agent

Hermes 已经支持 OpenAI Responses API,而现在 DeepSeek V4 Flash 也已经原生兼容 Responses API,因此整个接入过程非常顺利。

随后直接开始测试。

测试一:生成商业级 HTML 跑酷游戏

提示词:

编写一款接近商业级的跑酷游戏(HTML 单文件)。

模型一次性生成完整代码。

整体完成度非常高,包括:

  • 游戏逻辑
  • UI 界面
  • 动画效果
  • 音效调用
  • 分数系统
  • 游戏结束逻辑

基本已经接近可以直接演示的程度。

测试二:制作 3D 超级马里奥

接下来继续提高难度。

提示词:

制作一个 3D 版超级马里奥。

生成结果再次令人惊喜。

整个 Three.js 场景搭建速度非常快,人物、地图以及交互逻辑都能够一次性完成,大幅减少后续修改工作。

可以明显感觉到,这一代 Flash 模型在前端代码生成方面已经进入了新的阶段。

社区开始疯狂测试

模型刚发布,海外社区已经出现大量实测案例。

下面挑几个比较有代表性的。

Gemini 3.6 Flash VS DeepSeek V4 Flash

有人使用完全相同的:

  • 提示词
  • 规划文档
  • 参考图片

让两个模型同时生成 Three.js 的 Raptor3 模型。

不少网友认为 DeepSeek 的整体生成质量已经非常接近 Gemini。

GPT-5.6 Luna 对比

还有开发者把 DeepSeek V4 Flash 与 GPT-5.6 Luna 放到同一价格区间进行测试。

测试内容包括:

  • 魔方动画
  • 烟花效果
  • 手写 Hello 动画

最终评价认为:

  • 魔方动画 DeepSeek 更稳定
  • 烟花效果双方接近
  • 手写动画 DeepSeek 更自然
  • 综合来看,同价位下 DeepSeek 胜出

汽车发动机建模

还有网友测试了生成汽车发动机。

整体完成质量已经达到 Kimi K3 的 70%~80%。

虽然细节仍然略逊一些,但考虑到价格,仅这一点就已经十分具有竞争力。

Three.js 钢铁厂

还有不少开发者直接拿它制作大型 Three.js 场景。

例如:

  • 钢铁厂
  • 机械工厂
  • 机器人跳舞
  • 工业流水线

这些过去需要不断修改 Prompt 才能完成的案例,现在很多都可以一次生成。

交互式 3D 生物细胞

还有开发者让它直接生成:

一个可交互的 3D 细胞探索器。

支持:

  • 放大缩小
  • 环绕旋转
  • 查看细胞器
  • 阅读真实生物学知识

整个页面只使用一句 Prompt 即可生成。

鹈鹕骑自行车测试

最近比较流行的 SVG 鹈鹕测试,同样有人进行了比较。

测试对象:

  • DeepSeek V4 Flash
  • GPT-5.6 Terra

Prompt:

创建一个 SVG 绘制的鹈鹕骑自行车动画。

成本低得有点离谱

真正让大家震惊的,其实不是能力。

而是价格。

有开发者公布了三个模型执行完全相同任务后的成本:

模型 成本
DeepSeek V4 Flash $0.0005
DeepSeek V4 Pro $0.0008
GLM 5.2 $0.048

也就是说,在相同任务下,GLM 5.2 的成本大约是 DeepSeek V4 Flash 的近百倍。

Hermes Agent 连续运行 32 分钟,仅花 7 美分

还有开发者分享了一次真实测试。

DeepSeek V4 Flash 在 Hermes Agent 中连续执行任务:

  • 总耗时:32 分钟
  • 总成本:0.07 美元

按照这个价格计算,很多 Agent 工作流一天只需要几美元即可持续运行。

缓存命中率高达 99.5%

另一位开发者分享了自己的测试结果。

一次完整任务:

  • 总花费约人民币 0.78 元
  • Cache 命中率达到 99.5%

对于大量重复调用 API 的 Agent 场景来说,这意味着整体成本还能继续下降。

免费公共 API 已上线

如果你暂时不想申请 API Key,也可以直接体验。

有开发者已经在 Hugging Face Inference Endpoints 上部署了免费的公共接口。

特点:

  • 免费使用
  • 不需要 Token
  • 完全兼容 OpenAI API
  • 社区共享实例

当然,因为是公共服务,所以会存在轻度限流。

免费接入Deepseek V4 Flash-0731 API :【点击前往

社区评价如何?

模型发布之后,海外社区几乎是一片好评。

有人表示:

Flash 居然已经全面超过 GLM 5.2,能力几乎达到 Claude Opus 4.8,而价格却只有十分之一左右。

还有不少开发者认为:

目前 DeepSeek V4 Flash 已经成为 Hermes Agent、OpenRouter 等平台中性价比最高的模型之一。

Hermes 社区统计数据显示,在过去 30 天中,DeepSeek V4 Flash 仍然是使用率最高的模型之一。

总结

从目前官方数据以及大量社区实测来看,DeepSeek V4 Flash 0731 可以说是近期最值得关注的开源模型之一。

它不仅在代码生成、Agent 调用、Three.js 场景构建和 HTML 游戏开发等任务中表现出色,还拥有极低的 API 成本,使其在实际生产环境中的竞争力进一步提升。

对于需要大量调用 AI 接口的开发者来说,这意味着可以用更低的预算完成更多工作;对于本地部署用户来说,GGUF 量化版本的发布也降低了体验门槛。

AI 大模型已经不再只是比拼参数规模,而是在性能、价格、Agent 能力和开发生态之间展开全面竞争。DeepSeek V4 Flash 0731 的出现,无疑让这场 AI 价格战和能力战进入了新的阶段。