AI 大模型界这几天真的变天了。就在刚刚,Google 秘密推出了全新的主力模型 Gemini 3.6 Flash,并且官方还同步带来了一整套 Flash 全家桶。
本次发布的模型包括:
- Gemini 3.6 Flash
- Gemini 3.5 Flash Lite
- Gemini 3.5 Flash Cyber
其中最值得关注的,无疑是 Gemini 3.6 Flash。根据 Google 官方最新的测试数据,这颗「小钢炮」在 Agent 任务和代码生成上,直接把上一代按在地上摩擦。经过实际体验之后,它带来的提升比预想中更大,无论是代码生成、多模态理解还是 Agent 能力,都有着明显进步。
Gemini 3.6 Flash 性能有哪些提升?
根据 Google 官方公布的数据,Gemini 3.6 Flash 在 Agent、代码生成等多个基准测试中,都已经全面超过上一代 Gemini Flash 系列。
尤其是在生产级代码生成方面,新模型拥有几个比较明显的特点:
- 首先,生成速度更快,快的飞起。
- 其次,彻底解决了之前动不动就卡死循环的硬伤。
- 另外,在图表分析、复杂文档理解等多模态任务上,相比 Gemini 3.5 Flash 甚至 Gemini 3.5 Pro 优势都非常明显。
更绝的是,它在 DeepSWE 榜单上直接干到了 49% 的跑分,这水平基本已经摸到了闭源强模型 Claude Opus 4.8 的门槛。重点是它完全免费,性价比直接拉满了。

Token 使用效率明显提升
除了综合能力提升之外,这次最让人眼前一亮的亮点,绝对要数它的 Token 消耗了。
不少第一批实测过的开发者都反馈,Gemini 3.6 Flash 在搞定同等复杂度的任务时,Token 消耗出现了非常显著的下降。特别是跟同级别的其他模型做横向对比,它在完成相同任务时,Token 输出量居然直接大幅缩减了 65%,整体使用成本直接被砍掉了一半左右。
说白了,它不仅整体性能拉满,而且用起来还要省钱得多。

著名开发社区的权威评分也充分证实了这一点:Gemini 3.6 Flash 直接拿到了 1,537 分,相比上一代 Gemini 3.5 Flash,排名直接从第 21 名一路猛冲,跳升到了第 12 名。甚至在内容创作、品牌营销、游戏以及设计分析这几个热门赛道里,也都相当稳地杀进了前十和前 20 名。

另外,咱们还惊喜地发现,Gemini 3.6 Flash 在 Deepseek 上表现甚至已经一举超过了 GLM 5.2。这确实让我觉得挺意外的,毕竟在绝大多数人的传统印象里,Gemini Flash 系列一直都是速度虽然很快、但综合能力相对一般的轻量模型。但这一次,它还真的有点不一样了。
当然,榜单评分终究只是个参考,到底好不好用,咱们肯定还得靠真实的实战任务来检验。
多模态能力实测:数牙签
目前 Gemini 3.6 Flash 已经在网页端、手机端以及在反重力 PC 客户端全面上线了,大家全都可以免费使用。今天我们就用这盒牙签来硬核测试一下它的多模态能力,这次借助反重力客户端 Antigravity 来测试,顺便也帮大家检验一下谷歌 Gemini 的 API 调用到底稳不稳定、速度够不够快。
如果你还没安装 Google 开发的 Agent 调用管理平台 Antigravity(反重力),可以通过下方链接免费下载安装(内含 Windows、macOS、Linux 多版本):
Antigravity(反重力)下载:【 点击前往 】
打开 Antigravity(账号普通免费版即可),选择 Gemini 3.6 Flash 模型,上传实拍的牙签照片,输入指令:数一下图片里的牙签一共有多少根。

经过仔细数点,图片中的牙签一共是 18 根,按区域梳理如下:
- 上方斜放组 7 根:从最上方顺次往下斜向排列的 7 根牙签。
- 中间平放组 6 根:位于中间层大致水平放置的 6 根牙签,其中右侧有两根尖端延伸较长。
- 下方平放组 5 根:位于最下层、呈水平平铺排列的 5 根牙签。
总计 7 + 6 + 5 = 18 根。
面对极度重叠交叉、错综的细小物体,传统 AI 往往极易失误,而 Gemini 3.6 Flash 展现出了令人惊叹的空间推理与超精细视觉识别能力。它是怎么破局的?
- 第一步,看右上角的扇形区域:AI 没有乱数,而是先抓取了最上方呈斜向散开的 7 根牙签。
- 第二步,看中间最密集的交错层:这里是重叠最严重的区域,Gemini 3.6 Flash 抓出了横向放置的 6 根牙签,甚至还特意标记出了右侧有两根尖端延伸较长的细节,完全没有被相互遮挡的线条误导。
- 第三步,看最底下的平铺层:最后把最下层平铺的 5 根底座牙签单独归类,轻松搞定。
从宏观区域划分到微观尖端特征捕捉,Gemini 3.6 Flash 不仅数得对,还能把逻辑清清楚楚地讲出来,这硬核的视觉识别算法确实厉害。

编程能力进一步增强
接下来测试它的代码能力。首先让它编写一个 HTML 版水果忍者游戏:
- 整个项目一次生成完成,下载后直接运行,没有报错。
- 点击开始即可游玩,音效正常,操作流畅,碰到炸弹也能正常结束。

随后我们继续提高难度,让它生成一个具有真实物理效果的 3D 台球游戏,要求包括:
- 符合实际台球规则
- 精细 3D 拟真画面
- 碰撞元素与真实物理模拟
AI 最终基于 Three.js 等库一次生成完整项目,最终实现了精细 3D 拟真画面、美式台球与交互操作。打开之后鼠标瞄准方向、左键蓄力、松开击球,物理效果是真实计算出来的:虚线会预测碰撞点,球与球之间的碰撞都很自然,声音也能跟上节奏。整个游戏就是一个 HTML 文件,浏览器打开就能玩。

Agent 能力测试
接下来测试它的 Agent 能力,这次使用 opencode 接入谷歌 API 来进行测试。选择 Gemini 3.6 Flash High 模型,输入要求:让它找到 GitHub 上面评分最好的 AI 项目,分析代码结构,再汇总给我。

整个过程几乎自动完成,最终输出 GitHub 顶级 AI 项目排行榜:
- 第一名:AutoGPT,拥有 185K 星星,分类领域是自主智能体,核心功能是自动化 AI 任务执行与 Agent 智能体框架。
- 第二名:Ollama,拥有 178K 星星。
我们打开 GitHub 验证,果然是 185K 星星,说明它不是瞎说的。接下来它对每个项目进行详细介绍,以及核心代码和目录结构分析,下面是框架拆解、设计以及总结,完全按我们的要求进行,执行速度非常快。
百页 PDF 文档处理能力
随后我们继续测试文档处理能力。这里有 100 多页的 PDF 文件,重点是看它能不能一次性吞下这个 25 兆的 PDF 文件。上传之后给出要求:找出 PDF 中所有 API 更新,并生成 Markdown 文件。
可以看到它先调用 Python 进行处理,稍等一会,最终以 Markdown 格式输出,能力非常不错了。对于需要处理大量技术文档的开发者来说,这项能力具有非常高的实用价值。

3D 场景对比
当然,它的能力远不止这些。同时它还支持在浏览器、桌面和移动端跨平台使用 computer use 工具,也可以在不同的 Agent 开发工具中通过 API 的形式导入并调用 Gemini 3.6 Flash,非常方便。
网上有人说 3.6 Flash 不如 3.5 Pro 更好用,那大家可以看一下这里两个模型的生成对比:一个是由 Gemini 3.5 Pro 生成的蒸汽机车 3D 模型,另一个是由 Gemini 3.6 Flash 生成的火星好奇号漫游者摇臂转向悬挂系统在火星上漫游,你觉得哪个更好呢?

赛车测试:AI 对物理世界的理解
最后这段赛车测试,可以说把 Gemini 的时空控制力展现得淋漓尽致。扎实的空间建模、毫秒级的时间连续性,再加上光影和物理细节——这不仅仅是一张赛车的动态画面,更意味着 AI 对真实物理世界的理解达到了一个全新节点。未来的视频创作,可能真的要被改写了。

总结
过去很多人对 Gemini Flash 系列的印象都是「速度快,但能力一般」。但这一次,Gemini 3.6 Flash 确实让人眼前一亮:它不仅提升了代码生成质量,多模态理解能力和 Agent 执行效率也都有明显增强,同时还进一步降低了 Token 消耗和使用成本。
当然,各类排行榜和基准测试只能作为参考,真正决定一款模型是否优秀的,仍然是实际应用体验。从本次多个真实任务测试来看,Gemini 3.6 Flash 已经展现出了非常强的综合实力。如果 Google 后续继续保持免费策略,并持续优化模型能力,那么它很有可能成为目前最值得体验的免费 AI 大模型之一。

欢迎大家留言,写下您的观点。