DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

AI 大模型的竞争又迎来了新一轮升级。7月31日晚,DeepSeek 正式发布 DeepSeek V4 Flash 0731。相比此前的预览版本,这次不仅性能迎来大幅提升,还正式支持 Responses API,并全面兼容 Codex,对于开发者来说无疑是一大利好。

更重要的是,官方表示新版本的 Agent 能力也得到了明显增强,而社区的大量实测也证明,这次的升级并不是简单的小修小补,而是真正意义上的一次跃升。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

官方发布:Agent 能力全面升级

根据 DeepSeek 官方公布的信息,最新版 DeepSeek-V4-Flash-0731 已正式开放使用。

此次更新主要包括:

  • Agent 能力大幅增强
  • 原生支持 Responses API
  • 完全兼容 Codex
  • 整体推理能力进一步提升
  • 多项 Benchmark 超越此前的 V4-Pro-Preview

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

前端代码能力暴涨,竞技场排名直接冲到全球第七

除了官方数据之外,AI Arena 最新公布的成绩也十分亮眼。

DeepSeek V4 Flash High 在 Frontend Coding Arena 中:

  • 全球排名第 7
  • 得分 1586
  • 开源模型排名第 3
  • 消费级产品排名第 4
  • Data & Analysis、Reference Design、Game 分类排名第 6
  • Brand & Marketing 排名第 7

相比此前的 Preview 版本,一次更新直接提升 154 分

这说明这次升级最大的变化之一,就是代码生成能力。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

本地部署

喜欢本地运行的朋友,现在也可以下载量化版本。

GGUF 量化模型下载地址:

1、Huggingface 下载【点击前往

2、模型打包下载:【点击前往
DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

目前已经提供适用于 llama.cpp、Unsloth 等框架的版本。

根据 官方介绍:

  • 168GB 内存可运行无损 4-bit
  • 110GB 内存可运行 3-bit
  • 后续还会继续推出更小尺寸量化模型

我们实际测试一下

Benchmark 再漂亮,最终还是要看真实使用效果。

首先,我们直接把它接入 Hermes Agent

Hermes 已经支持 OpenAI Responses API,而现在 DeepSeek V4 Flash 也已经原生兼容 Responses API,因此整个接入过程非常顺利。

随后直接开始测试。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

测试一:生成商业级 HTML 跑酷游戏

提示词:

编写一款接近商业级的跑酷游戏(HTML 单文件)。

模型一次性生成完整代码。

整体完成度非常高,包括:

  • 游戏逻辑
  • UI 界面
  • 动画效果
  • 音效调用
  • 分数系统
  • 游戏结束逻辑

基本已经接近可以直接演示的程度。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

测试二:制作 3D 超级马里奥

接下来继续提高难度。

提示词:

制作一个 3D 版超级马里奥。

生成结果再次令人惊喜。

整个 Three.js 场景搭建速度非常快,人物、地图以及交互逻辑都能够一次性完成,大幅减少后续修改工作。

可以明显感觉到,这一代 Flash 模型在前端代码生成方面已经进入了新的阶段。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

社区开始疯狂测试

模型刚发布,海外社区已经出现大量实测案例。

下面挑几个比较有代表性的。

Gemini 3.6 Flash VS DeepSeek V4 Flash

有人使用完全相同的:

  • 提示词
  • 规划文档
  • 参考图片

让两个模型同时生成 Three.js 的 Raptor3 模型。

不少网友认为 DeepSeek 的整体生成质量已经非常接近 Gemini。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

GPT-5.6 Luna 对比

还有开发者把 DeepSeek V4 Flash 与 GPT-5.6 Luna 放到同一价格区间进行测试。

测试内容包括:

  • 魔方动画
  • 烟花效果
  • 手写 Hello 动画

最终评价认为:

  • 魔方动画 DeepSeek 更稳定
  • 烟花效果双方接近
  • 手写动画 DeepSeek 更自然
  • 综合来看,同价位下 DeepSeek 胜出

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

汽车发动机建模

还有网友测试了生成汽车发动机。

整体完成质量已经达到 Kimi K3 的 70%~80%。

虽然细节仍然略逊一些,但考虑到价格,仅这一点就已经十分具有竞争力。

Three.js 钢铁厂

还有不少开发者直接拿它制作大型 Three.js 场景。

例如:

  • 钢铁厂
  • 机械工厂
  • 机器人跳舞
  • 工业流水线

这些过去需要不断修改 Prompt 才能完成的案例,现在很多都可以一次生成。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

交互式 3D 生物细胞

还有开发者让它直接生成:

一个可交互的 3D 细胞探索器。

支持:

  • 放大缩小
  • 环绕旋转
  • 查看细胞器
  • 阅读真实生物学知识

整个页面只使用一句 Prompt 即可生成。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

鹈鹕骑自行车测试

最近比较流行的 SVG 鹈鹕测试,同样有人进行了比较。

测试对象:

  • DeepSeek V4 Flash
  • GPT-5.6 Terra

Prompt:

创建一个 SVG 绘制的鹈鹕骑自行车动画。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

成本低得有点离谱

真正让大家震惊的,其实不是能力。

而是价格。

有开发者公布了三个模型执行完全相同任务后的成本:

模型 成本
DeepSeek V4 Flash $0.0005
DeepSeek V4 Pro $0.0008
GLM 5.2 $0.048

也就是说,在相同任务下,GLM 5.2 的成本大约是 DeepSeek V4 Flash 的近百倍。

Hermes Agent 连续运行 32 分钟,仅花 7 美分

还有开发者分享了一次真实测试。

DeepSeek V4 Flash 在 Hermes Agent 中连续执行任务:

  • 总耗时:32 分钟
  • 总成本:0.07 美元

按照这个价格计算,很多 Agent 工作流一天只需要几美元即可持续运行。

缓存命中率高达 99.5%

另一位开发者分享了自己的测试结果。

一次完整任务:

  • 总花费约人民币 0.78 元
  • Cache 命中率达到 99.5%

对于大量重复调用 API 的 Agent 场景来说,这意味着整体成本还能继续下降。

免费公共 API 已上线

如果你暂时不想申请 API Key,也可以直接体验。

有开发者已经在 Hugging Face Inference Endpoints 上部署了免费的公共接口。

特点:

  • 免费使用
  • 不需要 Token
  • 完全兼容 OpenAI API
  • 社区共享实例

当然,因为是公共服务,所以会存在轻度限流。

免费接入Deepseek V4 Flash-0731 API :【点击前往

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

社区评价如何?

模型发布之后,海外社区几乎是一片好评。

有人表示:

Flash 居然已经全面超过 GLM 5.2,能力几乎达到 Claude Opus 4.8,而价格却只有十分之一左右。

还有不少开发者认为:

目前 DeepSeek V4 Flash 已经成为 Hermes Agent、OpenRouter 等平台中性价比最高的模型之一。

Hermes 社区统计数据显示,在过去 30 天中,DeepSeek V4 Flash 仍然是使用率最高的模型之一。

DeepSeek V4 Flash正式开源!对比Claude Opus 4.8性能与本地部署指南

总结

从目前官方数据以及大量社区实测来看,DeepSeek V4 Flash 0731 可以说是近期最值得关注的开源模型之一。

它不仅在代码生成、Agent 调用、Three.js 场景构建和 HTML 游戏开发等任务中表现出色,还拥有极低的 API 成本,使其在实际生产环境中的竞争力进一步提升。

对于需要大量调用 AI 接口的开发者来说,这意味着可以用更低的预算完成更多工作;对于本地部署用户来说,GGUF 量化版本的发布也降低了体验门槛。

AI 大模型已经不再只是比拼参数规模,而是在性能、价格、Agent 能力和开发生态之间展开全面竞争。DeepSeek V4 Flash 0731 的出现,无疑让这场 AI 价格战和能力战进入了新的阶段。

原创文章,作者:极客智库终身会员,如若转载,请注明出处:https://www.jikezhiku.com/1188.html

上一篇 2026年7月29日 下午1:36
下一篇 2026年8月4日 上午11:31

相关推荐