Google 最近再次加速 AI 大模型的竞争。就在近日,Google 一口气发布了三款全新的 Gemini 模型,目标非常明确,就是让 AI Agent 更快、更聪明,同时进一步降低使用成本。

本次发布的模型包括:
其中最受关注的,无疑是 Gemini 3.6 Flash。
经过实际体验之后,它带来的提升比预想中更大,无论是代码生成、多模态理解还是 Agent 能力,都有着明显进步。

Gemini 3.6 Flash 性能有哪些提升?
根据 Google 官方公布的数据,Gemini 3.6 Flash 在 Agent、代码生成等多个基准测试中,都已经全面超过上一代 Gemini Flash 系列。
尤其是在生产级代码生成方面,新模型拥有几个比较明显的特点:
首先,生成速度更快。
其次,更不容易进入循环修改或者死循环。
另外,对于图表分析、文档理解、报告生成等多模态任务,也相比 Gemini 3.1 Pro 和 Gemini 3.5 Flash 有了明显提升。
更加值得关注的是,在 DeepSWE 测试中,Gemini 3.6 Flash 已经取得约 49% 的成绩,已经接近 Claude Opus 推理模型的水平。
更重要的是,它目前可以免费体验。

Token 使用效率明显提升
除了模型能力提升之外,这次最大的惊喜其实来自 Token 效率。
不少开发者实测发现,在完成同样任务时,Gemini 3.6 Flash 输出的 Token 数量明显减少。
官方数据显示,相比其它模型,在相同任务下输出 Token 数量最高可减少约 65%,整体使用成本下降接近一半。

这意味着:
性能更强。
响应更快。
调用成本更低。
对于开发者来说,这一点甚至比跑分更加重要。
编程能力进一步增强
Google 这次重点强化了代码生成能力。

在实际测试中,我们让 Gemini 3.6 Flash 直接生成一个完整的《水果忍者》HTML 游戏。
整个项目一次生成完成。

下载之后直接运行,没有报错,音效正常,游戏逻辑完整,整体运行十分流畅。
随后我们继续提高难度。
让它生成一个具有真实物理效果的 3D 台球游戏。提示词如下:
AI 最终基于 Three.js 和 Cannon.js,一次生成完整项目。
打开之后不仅可以正常游玩,而且物理效果非常自然,击球、碰撞、反弹、滚动都符合真实物理逻辑。
对于一款 AI 一次生成的 HTML 游戏来说,这样的效果已经相当不错。

多模态能力实测
很多人喜欢测试 AI 数筷子。不过为了降低难度,这次我们换成了牙签和麻辣烫签子。首先测试牙签识别。AI 将图片划分为多个区域分别统计,最终给出的结果约为 70 根左右。

而真实数量其实是 71 根。
由于图片中存在多根牙签重叠,因此最终误差只有 1 根左右。
随后继续测试麻辣烫签子。
Gemini 3.6 Flash 最终准确识别出了 17 根,与真实数量完全一致。
能够准确识别如此细小且大量重叠的物体,说明它的视觉理解能力已经达到较高水平。

Agent 能力测试
除了聊天和代码之外,Google 这次重点强化的还有 Agent 能力。我们在 Antigravity 开发平台中选择 Gemini 3.6 Flash,如果你没安装 Google 开发的 Agent 调用管理平台 (Antigravity ),那么你可以通过下方的链接进行下载安装:
Antigravity(反重力)下载:
【点击前往】 或 【打包下载】内含Windows 、mac 、Linux 多版本!

并要求它:打开 GitHub
寻找 Star 数最高的 AI Agent 项目
分析项目代码结构
总结框架设计
整个过程几乎自动完成。
AI 首先通过 Python 工具访问 GitHub,然后快速完成搜索、分析以及总结。
最终不仅准确找到了对应项目,而且对于项目架构、目录结构以及核心代码进行了完整分析。
整个执行速度非常快。

百份 PDF 文档处理能力
随后我们继续测试长文档处理能力。一次上传超过 100 个 PDF 文件。要求 AI 找出所有 API 更新内容,并最终整理为 Markdown 文档。

Gemini 3.6 Flash 首先调用 Python 对全部 PDF 进行分析,然后最终输出完整 Markdown,总体完成效果非常理想。
对于需要处理大量技术文档的开发者来说,这项能力具有非常高的实用价值。

AI 自动生成工程级 3D 动画
最后还有一个让我印象比较深刻的案例。
在 Antigravity 中,通过一句提示词,Gemini 3.6 Flash 配合 Three.js 自动生成了完整的风力发电机安装动画。
整个过程包括:
重型卡车运输叶片
沿盘山公路运输
大型起重机吊装
精准安装至风机顶部
整个施工流程、运输路线以及空间关系全部由 AI 自动完成。
提示词:

真正厉害的地方并不是画面有多炫,而是 AI 已经能够理解整个工程施工流程以及各个设备之间的空间逻辑。
过去制作这种工程演示,往往需要建模师花费几天甚至几周时间。
而现在,仅需一句提示词,几分钟即可生成完整演示雏形。
这也是生成式 AI 正在改变工程设计、工业演示和数字孪生的重要体现。

API 成本同样具有竞争力
除了模型能力之外,Gemini 3.6 Flash 在 API 成本方面同样表现亮眼。
在相同提示词下进行测试,相比 GPT、Claude 以及 Kimi K3,Gemini 3.6 Flash 的整体调用成本最低,仅需约 0.1 美元左右。
对于需要高频调用 API 的企业和开发团队而言,这种成本优势十分明显。

过去很多人对 Gemini Flash 系列的印象都是“速度快,但能力一般”。
但这一次,Gemini 3.6 Flash 确实让人眼前一亮。

它不仅提升了代码生成质量,多模态理解能力和 Agent 执行效率也都有明显增强,同时还进一步降低了 Token 消耗和 API 成本。
当然,各类排行榜和基准测试只能作为参考,真正决定一款模型是否优秀的,仍然是实际应用体验。

从本次多个真实任务测试来看,Gemini 3.6 Flash 已经展现出了非常强的综合实力。如果 Google 后续继续保持免费策略,并持续优化模型能力,那么它很有可能成为目前最值得体验的免费 AI 大模型之一。
原创文章,作者:极客智库
,如若转载,请注明出处:https://www.jikezhiku.com/1103.html