AI 大模型的竞争又迎来了新一轮升级。7月31日晚,DeepSeek 正式发布 DeepSeek V4 Flash 0731。相比此前的预览版本,这次不仅性能迎来大幅提升,还正式支持 Responses API,并全面兼容 Codex,对于开发者来说无疑是一大利好。
更重要的是,官方表示新版本的 Agent 能力也得到了明显增强,而社区的大量实测也证明,这次的升级并不是简单的小修小补,而是真正意义上的一次跃升。

官方发布:Agent 能力全面升级
根据 DeepSeek 官方公布的信息,最新版 DeepSeek-V4-Flash-0731 已正式开放使用。
此次更新主要包括:
- Agent 能力大幅增强
- 原生支持 Responses API
- 完全兼容 Codex
- 整体推理能力进一步提升
- 多项 Benchmark 超越此前的 V4-Pro-Preview

前端代码能力暴涨,竞技场排名直接冲到全球第七
除了官方数据之外,AI Arena 最新公布的成绩也十分亮眼。
DeepSeek V4 Flash High 在 Frontend Coding Arena 中:
- 全球排名第 7
- 得分 1586
- 开源模型排名第 3
- 消费级产品排名第 4
- Data & Analysis、Reference Design、Game 分类排名第 6
- Brand & Marketing 排名第 7
相比此前的 Preview 版本,一次更新直接提升 154 分。
这说明这次升级最大的变化之一,就是代码生成能力。


目前已经提供适用于 llama.cpp、Unsloth 等框架的版本。
根据 官方介绍:
- 168GB 内存可运行无损 4-bit
- 110GB 内存可运行 3-bit
- 后续还会继续推出更小尺寸量化模型
我们实际测试一下
Benchmark 再漂亮,最终还是要看真实使用效果。
首先,我们直接把它接入 Hermes Agent。
Hermes 已经支持 OpenAI Responses API,而现在 DeepSeek V4 Flash 也已经原生兼容 Responses API,因此整个接入过程非常顺利。
随后直接开始测试。

测试一:生成商业级 HTML 跑酷游戏
提示词:
编写一款接近商业级的跑酷游戏(HTML 单文件)。
模型一次性生成完整代码。
整体完成度非常高,包括:
- 游戏逻辑
- UI 界面
- 动画效果
- 音效调用
- 分数系统
- 游戏结束逻辑
基本已经接近可以直接演示的程度。

测试二:制作 3D 超级马里奥
接下来继续提高难度。
提示词:
制作一个 3D 版超级马里奥。
生成结果再次令人惊喜。
整个 Three.js 场景搭建速度非常快,人物、地图以及交互逻辑都能够一次性完成,大幅减少后续修改工作。
可以明显感觉到,这一代 Flash 模型在前端代码生成方面已经进入了新的阶段。

社区开始疯狂测试
模型刚发布,海外社区已经出现大量实测案例。
下面挑几个比较有代表性的。
Gemini 3.6 Flash VS DeepSeek V4 Flash
有人使用完全相同的:
- 提示词
- 规划文档
- 参考图片
让两个模型同时生成 Three.js 的 Raptor3 模型。
不少网友认为 DeepSeek 的整体生成质量已经非常接近 Gemini。

GPT-5.6 Luna 对比
还有开发者把 DeepSeek V4 Flash 与 GPT-5.6 Luna 放到同一价格区间进行测试。
测试内容包括:
- 魔方动画
- 烟花效果
- 手写 Hello 动画
最终评价认为:
- 魔方动画 DeepSeek 更稳定
- 烟花效果双方接近
- 手写动画 DeepSeek 更自然
- 综合来看,同价位下 DeepSeek 胜出

汽车发动机建模
还有网友测试了生成汽车发动机。
整体完成质量已经达到 Kimi K3 的 70%~80%。
虽然细节仍然略逊一些,但考虑到价格,仅这一点就已经十分具有竞争力。
Three.js 钢铁厂
还有不少开发者直接拿它制作大型 Three.js 场景。
例如:
- 钢铁厂
- 机械工厂
- 机器人跳舞
- 工业流水线
这些过去需要不断修改 Prompt 才能完成的案例,现在很多都可以一次生成。

交互式 3D 生物细胞
还有开发者让它直接生成:
一个可交互的 3D 细胞探索器。
支持:
- 放大缩小
- 环绕旋转
- 查看细胞器
- 阅读真实生物学知识
整个页面只使用一句 Prompt 即可生成。

鹈鹕骑自行车测试
最近比较流行的 SVG 鹈鹕测试,同样有人进行了比较。
测试对象:
- DeepSeek V4 Flash
- GPT-5.6 Terra
Prompt:
创建一个 SVG 绘制的鹈鹕骑自行车动画。

成本低得有点离谱
真正让大家震惊的,其实不是能力。
而是价格。
有开发者公布了三个模型执行完全相同任务后的成本:
| 模型 | 成本 |
|---|---|
| DeepSeek V4 Flash | $0.0005 |
| DeepSeek V4 Pro | $0.0008 |
| GLM 5.2 | $0.048 |
也就是说,在相同任务下,GLM 5.2 的成本大约是 DeepSeek V4 Flash 的近百倍。
Hermes Agent 连续运行 32 分钟,仅花 7 美分
还有开发者分享了一次真实测试。
DeepSeek V4 Flash 在 Hermes Agent 中连续执行任务:
- 总耗时:32 分钟
- 总成本:0.07 美元
按照这个价格计算,很多 Agent 工作流一天只需要几美元即可持续运行。
缓存命中率高达 99.5%
另一位开发者分享了自己的测试结果。
一次完整任务:
- 总花费约人民币 0.78 元
- Cache 命中率达到 99.5%
对于大量重复调用 API 的 Agent 场景来说,这意味着整体成本还能继续下降。
免费公共 API 已上线
如果你暂时不想申请 API Key,也可以直接体验。
有开发者已经在 Hugging Face Inference Endpoints 上部署了免费的公共接口。
特点:
- 免费使用
- 不需要 Token
- 完全兼容 OpenAI API
- 社区共享实例
当然,因为是公共服务,所以会存在轻度限流。
免费接入Deepseek V4 Flash-0731 API :【点击前往】

还有不少开发者认为:
目前 DeepSeek V4 Flash 已经成为 Hermes Agent、OpenRouter 等平台中性价比最高的模型之一。
Hermes 社区统计数据显示,在过去 30 天中,DeepSeek V4 Flash 仍然是使用率最高的模型之一。

总结
从目前官方数据以及大量社区实测来看,DeepSeek V4 Flash 0731 可以说是近期最值得关注的开源模型之一。
它不仅在代码生成、Agent 调用、Three.js 场景构建和 HTML 游戏开发等任务中表现出色,还拥有极低的 API 成本,使其在实际生产环境中的竞争力进一步提升。
对于需要大量调用 AI 接口的开发者来说,这意味着可以用更低的预算完成更多工作;对于本地部署用户来说,GGUF 量化版本的发布也降低了体验门槛。
AI 大模型已经不再只是比拼参数规模,而是在性能、价格、Agent 能力和开发生态之间展开全面竞争。DeepSeek V4 Flash 0731 的出现,无疑让这场 AI 价格战和能力战进入了新的阶段。
原创文章,作者:极客智库
,如若转载,请注明出处:https://www.jikezhiku.com/1188.html