文章摘要
本文记录 Google 发布 Gemini 3.7 Flash 后的实测过程。我们用 Antigravity CLI 覆盖文档生成、海报、演示文稿、网页、架构图、白板、视频、视觉 OCR、代码工程、3D 建模、游戏与自主工场共 45 项任务。结论是:推理速度确实快,多数任务能交差,但交付质量、Agent 协作与指令理解仍偏弱,需要更精确的命令输入。适合关注 Gemini 与 Coding Agent 落地的开发者阅读。|
此内容根据文章生成,并经过人工审核,仅用于文章内容的解释与总结

今天凌晨,Google 发布了 Gemini 3.7 Flash。我们立刻用 Antigravity CLI 跑了一轮多模态实测,覆盖文档、海报、PPT、网页、架构图、白板、视频、OCR、代码、3D、游戏和 Agent 工场,共 45 项任务

先说结论:快是真快,质量还有待提高。不论怎么说,它确实在补 Coding 短板。总体来看任务基本能完成;Agent 任务和智商理解仍欠佳,模型需要更准确的命令输入才能理解。


评测范围一览

领域编号任务数
文档生成 DocumentT01 – T033
海报设计 PosterT04 – T063
演示文稿 PresentationT07 – T093
网页工程 WebT10 – T123
架构拓扑 DiagramT13 – T175
数字白板 WhiteboardT18 – T203
视频动画 VideoT21 – T244
视觉多模态 VisionT25 – T295
代码工程 CodingT30 – T345
空间建模 3DT35 – T384
游戏工程 GameT39 – T413
自主工场 AgentT42 – T454

领域一:文档生成(T01 – T03)

T01:企业级技术白皮书 PDF

  • 难度:困难
  • 任务目标:根据前沿多模态大模型技术架构规范,生成 30 页结构完整、排版专业的高管与架构师级技术白皮书。
  • 输入数据:模型技术规范文本、架构设计草案、基准评测数据表。
  • 验收规范
    1. 包含完整封面、自动化层级目录、执行摘要与版本修订记录。
    2. 内置高保真矢量网络架构图、主流模型性能对比矩阵与技术引用文献。
    3. 严格遵循双栏 / 单栏栅格排版,具备页眉、页脚、动态页码与版权声明。
    4. 支持导出可打印、无错位的生产级 PDF。

T02:Markdown 转企业运营报告

  • 难度:中等
  • 任务目标:将未经排版的原始 Markdown 业务笔记与 CSV 财务数据,转化为经审计级别的高管运营效益与 ROI 分析报告。
  • 输入数据:季度业务运营原始 Markdown 文本、成本与收益流水 CSV 数据集。
  • 验收规范
    1. 提取并展示 4 大核心 KPI 看板(总算力消耗、Token 成本下降率、调用量与净 ROI)。
    2. 保持输入数据语义严格一致,无数字截断或逻辑幻觉。
    3. 采用标准化财务表格样式(斑马条纹、千分位对齐与增长率趋势标记)。
    4. 具备清晰的商业洞察总结与下季度战略执行建议。

T03:学术论文 PDF 转演讲 PPT

  • 难度:困难
  • 任务目标:将深度学习学术论文(高维搜索空间异步推理机制)解析并重构为 20 页学术演讲幻灯片。
  • 输入数据:学术论文文本、数学推导公式、实验对比数据。
  • 验收规范
    1. 完整覆盖:研究背景、问题形式化、核心算法机制、数学公式推导、消融实验与结论。
    2. 每一页均包含详细演讲人备注(Speaker Notes)。
    3. 重点突出算法伪代码与模型注意力权重分布图示。
    4. 具备章节切换导航与键盘左右键翻页交互。

领域二:海报设计(T04 – T06)

T04:重大新闻转 4 款风格视觉海报

  • 难度:中等
  • 任务目标:依据前沿大模型发布新闻,同一主题下设计 4 款完全不同设计语言与品牌调性的高清视觉海报。
  • 输入数据:模型版本发布官方新闻通稿、核心技术参数。
  • 验收规范
    1. Apple 极简风:极简留白、大字号粗无衬线排版、高对比度黑白灰。
    2. Google Material 3 灵动风:多色圆润渐变、卡片式构图、流体微质感。
    3. 极客暗黑风:深灰底色、高饱和度代码高亮绿 / 蓝点缀、等宽终端字体。
    4. 赛博朋克风:霓虹紫粉高光、故障艺术(Glitch)质感、几何发光边框。
    5. 采用原生矢量 SVG / 高分辨率输出,文字与图形矢量对齐。

T05:GitHub 开源项目架构海报

  • 难度:中等
  • 任务目标:解析开源代码仓库的架构与核心能力,生成一张信息密度高、流向清晰的技术架构海报。
  • 输入数据:开源项目功能清单、目录结构、Star 历史里程碑数据。
  • 验收规范
    1. 视觉化展示数据流向:数据输入层、中枢编排层、执行沙盒到多端交付物。
    2. 包含 Star 增长趋势折线图、技术栈徽标网格与核心特性矩阵。
    3. 配色专业克制,高分辨率打印与屏幕缩放下文字均清晰锐利。

T06:大模型官方正式发布海报

  • 难度:中等
  • 任务目标:制作符合科技巨头官方规范的大模型版本正式发布宣发海报。
  • 输入数据:模型名称、评测综合得分、推理速度参数、开放接口地址。
  • 验收规范
    1. 突出核心视觉中心(模型版本徽标与核心能力标语)。
    2. 提炼三大核心卖点卡片(极速响应、深度混合推理、全模态覆盖)。
    3. 底部包含官方行动号召(CTA:「立即体验」徽章及体验链接)。

领域三:演示文稿(T07 – T09)

T07:PDF 转原生矢量可编辑 PPT

  • 难度:困难
  • 任务目标:将静态 PDF 报告逆向解析为可二次编辑的矢量幻灯片画布。
  • 输入数据:多页静态文档排版数据与图文素材。
  • 验收规范
    1. 画面中所有文本块、矩形容器、卡片徽章与图标均为独立 DOM 节点或矢量图形。
    2. 用户可在画布上直接点击选中文本,进行即时修改与样式调整。
    3. 支持幻灯片增删、拖拽排序与标准格式导出。

T08:技术博客转 20 页深度讲座 PPT

  • 难度:困难
  • 任务目标:将万字技术深度长文重构为适用于高校或工业界技术分享的 20 页深度架构讲座幻灯片。
  • 输入数据:长篇系统架构与性能调优技术博客。
  • 验收规范
    1. 逻辑分明,分为问题痛点、架构重构、并发模型、缓存一致性、容灾实战与总结 6 个模块。
    2. 每页提炼核心要点(不超过 5 行),杜绝长段落堆砌。
    3. 配备完整全屏演讲模式、进度指示条与键盘控制快捷键。

T09:学术论文转 A 轮商业路演 Deck

  • 难度:困难
  • 任务目标:将硬核技术论文重构为面向 VC 机构的 12 页 A 轮商业计划路演幻灯片。
  • 输入数据:核心技术专利说明、市场调研数据、商业模式假设。
  • 验收规范
    1. 完整包含投资人标准关注项:行业痛点、解决方案、产品架构、市场规模(TAM / SAM / SOM)、竞品对比护城河、商业模式、财务预测与团队介绍。
    2. 每页附带配套演讲说辞(Pitch Script),指导路演节奏。

领域四:网页工程(T10 – T12)

T10:模型卡片转产品官网 Landing Page

  • 难度:中等
  • 任务目标:基于模型技术卡片,构建现代化的商业级产品官网首页。
  • 输入数据:模型名称、特性列表、API 规格说明。
  • 验收规范
    1. 包含 Hero 宣传区、核心优势 Bento 网格、定价方案选择器与 FAQ 手风琴折叠栏。
    2. 内置交互式实时体验沙盒,用户输入提示词后可模拟流式打字机输出。
    3. 完全响应式设计,适配移动端、平板与桌面端视口。

T11:Markdown 转开发者文档中心

  • 难度:中等
  • 任务目标:将多篇 Markdown 技术规范生成具备现代化体验的开发者文档门户。
  • 输入数据:多模块 API 接口文档、代码示例与安装指南。
  • 验收规范
    1. 具备左侧多级可折叠树状导航、右侧当前页面目录锚点高亮(TOC)。
    2. 内置全文档实时关键字高亮搜索与快速筛选。
    3. 支持一键复制代码块、暗黑 / 明亮主题平滑切换。

T12:Apple 极简高级产品展示页

  • 难度:困难
  • 任务目标:打造具有 Apple 官网质感的高端硬件 / 模型展示页面。
  • 输入数据:产品工业设计参数、核心芯片性能指标。
  • 验收规范
    1. 暗黑磨砂质感、超大字号排版与精细字距跟踪。
    2. 实现基于滚动的渐入视差动画(Scroll-driven Animation)。
    3. 嵌入 3D 旋转展示组件,支持 360 度交互拖拽观察产品细节。

领域五:架构拓扑(T13 – T17)

T13:Transformer 完整网络架构图

  • 难度:中等
  • 任务目标:高保真绘制 Transformer 深度学习网络模型完整架构矢量拓扑。
  • 输入数据:Transformer 经典论文结构参数与组件连接关系。
  • 验收规范
    1. 准确呈现 Input Embedding、Positional Encoding、Multi-Head Attention、Add & Norm、Feed Forward 完整数据流。
    2. 清晰表达编码器与解码器之间的 Cross-Attention 交叉连线。
    3. 组件支持鼠标 Hover 高亮对应数学公式与数据张量维度。

T14:Multi-Agent 自主协作与自愈流程

  • 难度:中等
  • 任务目标:绘制多智能体自主分工、工具调度与错误自愈流程图。
  • 输入数据:ReAct 范式、任务规划器、执行器与自省反思循环逻辑。
  • 验收规范
    1. 完整涵盖:Prompt 输入 → 任务拆解 → 工具调用 → 沙盒执行 → AST 校验 → 异常捕获 → 自愈修正 → 最终输出。
    2. 采用标准流程图规范(起始框、决策菱形、操作矩形、状态反馈环)。

T15:SQL DDL 转实体关系图(ERD)

  • 难度:中等
  • 任务目标:解析复杂的电商多表 SQL DDL 语句,自动生成关系型数据库 ERD 拓扑图。
  • 输入数据:包含用户表、订单表、商品表、支付表与库存表的 SQL 建表脚本。
  • 验收规范
    1. 完整展示所有字段名、主键(PK)、外键(FK)及数据类型约束。
    2. 正确绘制 1:1、1:N、N:M 的关联连线与基数符号(Crow's Foot 标记)。

T16:Kubernetes 生产集群网络拓扑

  • 难度:中等
  • 任务目标:构建生产级 Kubernetes 集群的云原生架构与网络通信拓扑。
  • 输入数据:K8s 控制平面与工作节点配置规格。
  • 验收规范
    1. 控制面:API Server、Controller Manager、Scheduler 与 etcd 高可用集群。
    2. 工作节点:Ingress Controller、ClusterIP Service、NodePort、Pod 副本与 PVC 存储挂载。
    3. 连线清晰标明外部流量路由路径与内部集群 DNS 解析机制。

T17:企业级微服务与 Kafka 事件流架构

  • 难度:中等
  • 任务目标:设计高并发微服务架构与 Kafka 分布式事件总线拓扑图。
  • 输入数据:用户中心、交易中心、履约中心、通知系统与事件消息规范。
  • 验收规范
    1. 包含 API Gateway、OAuth2 / JWT 鉴权服务、多域微服务集群。
    2. 详细呈现 Kafka Topic、Partition、Consumer Group 异步事件解耦流向与 Dead-Letter Queue(DLQ)容灾链路。

领域六:数字白板(T18 – T20)

T18:会议决策数字化便签白板

  • 难度:中等
  • 任务目标:将混乱的头脑风暴会议纪要提炼为结构化便签看板。
  • 输入数据:会议录音转写文本、各参会方讨论焦点。
  • 验收规范
    1. 按四象限分类:核心决策(绿)、待办任务(黄)、风险预警(红)、待定议题(蓝)。
    2. 每张便签注明负责人、截止时间与优先级标记。
    3. 支持鼠标拖拽便签、按类别筛选与导出结构化 Markdown 纪要。

T19:30 秒 TVC 商业广告分镜脚本

  • 难度:中等
  • 任务目标:为科技新产品 30 秒商业宣传片编写专业分镜头脚本。
  • 输入数据:产品定位口号、目标客群、30 秒时间限制。
  • 验收规范
    1. 包含 7 个标准分镜,精准分配时间(秒数时序)。
    2. 每一分镜严格细化:景别(全景 / 特写 / 中景)、运镜轨迹、画面描述、旁白文案与音效(SFX)指南。

T20:AI 课程大纲知识概念脑图

  • 难度:中等
  • 任务目标:生成面向「AI 全栈工程师」的多层级学习路线与知识概念思维导图。
  • 输入数据:大模型、前端、后端、嵌入式与算法理论教学目标。
  • 验收规范
    1. 涵盖:数学基础 → 机器学习 → Transformer 架构 → 智能体开发 → 工程落地 5 大主干分支。
    2. 每个主干下细化 3~4 级子概念节点,支持节点折叠展开与缩放平移。

领域七:视频动画(T21 – T24)

T21:「画蛇添足」成语交互动画播放器

  • 难度:中等
  • 任务目标:用 Web 代码构建寓教于乐的 5 幕成语故事交互动画播放器。
  • 输入数据:「画蛇添足」典故原文与白话文分幕剧情。
  • 验收规范
    1. 包含分幕:楚国赐酒 → 比赛画蛇 → 先成得意 → 节外生枝 → 痛失美酒。
    2. 具备角色矢量动效、场景切换淡入淡出与逐句字幕高亮。
    3. 提供时间轴进度条、暂停 / 播放与幕次跳转控制。

T22:科技产品 15 秒动态宣发视频

  • 难度:中等
  • 任务目标:编写纯前端实现的 15 秒高冲击力产品动态宣发视频组件。
  • 输入数据:产品核心数据亮点与发布口号。
  • 验收规范
    1. 包含粒子爆发、发光文字动态缩放与快节奏分段转场动效。
    2. 精确控制 15 秒每一帧的字幕同步与节奏卡点。
    3. 集成 Web Audio API 实现节奏感背景音效合成。

T23:GitHub 仓库提交历程视频

  • 难度:中等
  • 任务目标:将 Git Commit 提交记录可视化回放为代码仓库演进视频。
  • 输入数据:Git 日志历史、文件增删改行数统计。
  • 验收规范
    1. 动态展示分支图谱生长、Commit 气泡弹出与作者头像动画。
    2. 右侧联动展示对应 Commit 的代码 Diff 高亮片段。
    3. 支持时间轴拖拽与播放速度倍速调节(1x / 2x / 4x)。

T24:大模型版本正式发布宣传片

  • 难度:中等
  • 任务目标:制作电影质感的大模型版本发布动态视频体验。
  • 输入数据:版本代号、评测雷达图、极速响应参数。
  • 验收规范
    1. 包含深邃星空背景、发光神经元网络连线动效与版本徽标汇聚动画。
    2. 逐一展示多模态各项能力的动态评测雷达扫描图。

领域八:视觉多模态(T25 – T29)

T25:跨国发票 OCR 结构化提取器

  • 难度:中等
  • 任务目标:对中英双语多币种发票进行高精度 OCR 识别与字段结构化解析。
  • 输入数据:增值税专用发票与国际商业 Invoice 图像 / 排版数据。
  • 验收规范
    1. 精准提取字段并输出标准 JSON:发票代码、发票号码、开票日期、购买方名称及税号、销售方信息、明细清单(品名 / 数量 / 单价 / 金额 / 税率 / 税额)、价税合计。
    2. 金额字段做浮点数与大写金额校验,确保计算准确率达到 99.9% 以上。

T26:日文餐饮小票 OCR 与精准中文翻译

  • 难度:中等
  • 任务目标:识别日文小票菜品明细,进行语境级日译中翻译并核算消费税。
  • 输入数据:包含日文假名、汉字与特殊缩写的餐饮结账单。
  • 验收规范
    1. 准确识别每项菜品日文原名,输出符合中文餐饮习惯的对应译名。
    2. 提取 8%(食品外带)与 10%(店内用餐)不同税率的消费税明细,计算总账核对。

T27:UI 界面目标检测与 IoU 验证

  • 难度:中等
  • 任务目标:检测 UI 界面截图中的所有交互组件,输出精确边界框并评估准确度。
  • 输入数据:复杂 Web / App 界面截图。
  • 验收规范
    1. 输出每个组件类别标签(buttoninputnavcardiconimage)及边界框 [x1, y1, x2, y2]
    2. 界面标注图上准确绘制高亮半透明检测框,综合 mIoU ≥ 0.90。

T28:UI 截图设计规范逆向解析器

  • 难度:中等
  • 任务目标:反向解析 UI 截图的设计系统规范(Design Tokens)。
  • 输入数据:高保真产品界面截图。
  • 验收规范
    1. 自动提取核心色板(Primary、Secondary、Background、Border 对应 HEX / RGBA 值)。
    2. 解析排版字体层级(H1 / H2 / Body 字号、字重、行高与间距)。
    3. 识别卡片圆角半径(border-radius)与阴影参数(box-shadow)。

T29:UI 截图像素级还原 HTML 及视觉比对

  • 难度:困难
  • 任务目标:将 UI 截图重构为纯净 HTML / CSS,并通过布局相似度引擎进行像素级比对。
  • 输入数据:原始设计稿截图。
  • 验收规范
    1. 产出语义化 HTML5 结构与现代 Flexbox / CSS Grid 样式,不依赖庞大第三方库。
    2. 双栏联动展示原始图与代码渲染图,支持滑块左右卷帘(Before / After)对比。
    3. 视觉结构相似度(SSIM / Layout Match)≥ 98%。

领域九:代码工程(T30 – T34)

T30:React 现代化数据分析监控控制台

  • 难度:困难
  • 任务目标:构建生产级、响应式 React 数据分析与服务监控控制台。
  • 输入数据:业务监控指标 API 规格、用户权限列表。
  • 验收规范
    1. 包含核心 KPI 卡片、动态折线图 / 柱状图、多维度可排序可筛选的数据表格。
    2. 包含全局关键字搜索、状态徽章、明暗主题切换与全响应式布局。
    3. 代码结构严谨,具备健全的组件解耦与状态管理。

T31:Next.js 15 全栈应用与 SSR 路由骨架

  • 难度:困难
  • 任务目标:搭建 Next.js 15 App Router 规范全栈工程架构与路由骨架。
  • 输入数据:产品路由规划、SEO 规范与动态数据接口定义。
  • 验收规范
    1. 完整实现 app/layout.tsxapp/page.tsxapp/dashboard/loading.tsxapp/api/ 路由结构。
    2. 演示服务端组件(RSC)与客户端组件("use client")的正确拆分与数据注水机制。
    3. 配置 OpenGraph 元数据、动态 Sitemap 与 SEO 友好标签。

T32:Electron 跨平台桌面客户端仿真环境

  • 难度:困难
  • 任务目标:开发具备原生桌面体验的跨平台客户端仿真工作台。
  • 输入数据:桌面端窗口控制规范、本地文件系统操作需求。
  • 验收规范
    1. 具备自定义无边框窗口设计(最小化、最大化、关闭按钮与窗口拖拽区)。
    2. 模拟 Main 进程与 Renderer 进程间安全的 IPC 双向通信。
    3. 内置本地文件目录树浏览、多标签页代码编辑器与状态栏。

T33:Chrome 扩展 Manifest V3 开发

  • 难度:中等
  • 任务目标:开发符合 Google Chrome Manifest V3 规范的浏览器扩展程序。
  • 输入数据:网页 DOM 检查与无障碍审查需求。
  • 验收规范
    1. 规范编写 manifest.json(配置 permissionsservice_workercontent_scriptsaction)。
    2. 实现 Popup 弹出控制面板与页面 Content Script 的消息通道通信。
    3. 提供一键检查当前页面所有图片 alt 属性及链接可用性的审计工具。

T34:VSCode 大模型智能开发插件扩展包

  • 难度:困难
  • 任务目标:编写符合 VSCode Extension API 规范的智能代码助手插件包。
  • 输入数据:VSCode 扩展清单与命令调用规范。
  • 验收规范
    1. package.json 中声明自定义命令、快捷键绑定、配置项与侧边栏视图。
    2. 注册左侧 Activity Bar 树状视图(TreeDataProvider)与嵌入式 Webview 交互面板。
    3. 支持选中文本一键触发智能重构与单元测试生成。

领域十:空间建模(T35 – T38)

T35:机械零件图转 OpenSCAD 参数化代码

  • 难度:中等
  • 任务目标:根据带法兰机械轴承座二维工程图纸,编写精确的 OpenSCAD CSG 参数化建模代码。
  • 输入数据:机械零件标注图纸(包含内孔直径、法兰厚度、螺栓孔距与倒角参数)。
  • 验收规范
    1. 编写规范的 .scad 脚本,将所有关键尺寸定义为顶部可配置变量。
    2. 使用 cylindercubedifference()union() 进行精确构造实体几何(CSG)建模。
    3. 提供 Three.js 3D 旋转实物渲染,支持零件线框与实心视图切换。

T36:Three.js 交互式现代扶手椅 3D 展示室

  • 难度:中等
  • 任务目标:使用 Three.js 纯代码构建具备专业光影的现代人体工学扶手椅 3D 空间。
  • 输入数据:家具三维结构形态与材质规格(真皮座面、胡桃木扶手、拉丝金属底座)。
  • 验收规范
    1. 采用 MeshStandardMaterial / MeshPhysicalMaterial 配置 PBR 物理材质与真实法线粗糙度。
    2. 设置主光源、补光、地表阴影投影与平滑的 OrbitControls 轨道控制器。
    3. 提供颜色材质实时切换面板(黑白棕皮革与木质纹理切换)。

T37:Three.js 程序化赛博都市 3D 场景

  • 难度:困难
  • 任务目标:通过程序化几何体算法生成拥有 200 座夜景发光摩天大楼的 3D 赛博都市。
  • 输入数据:都市网格规划参数、高度随机分布函数。
  • 验收规范
    1. 程序化生成高低错落的大楼,赋予窗格发光纹理与楼顶天线辉光。
    2. 地面道路配备动态流动的车流光轨(光带粒子动画)。
    3. 支持全景相机俯瞰漫游与视锥剪裁优化,以保证 60 FPS 流畅渲染。

T38:CAD 3D 网格校验与 GLB 导出引擎

  • 难度:中等
  • 任务目标:实现 3D CAD 网格几何分析引擎并支持 GLB 二进制模型文件序列化。
  • 输入数据:三维网格顶点数组、面索引与法线向量。
  • 验收规范
    1. 实时计算并展示几何特征:顶点总数、三角面数、表面积、体积与包围盒尺寸。
    2. 检测非流形边与法线翻转异常。
    3. 实现一键打包导出标准 .glb 文件并触发本地下载。

领域十一:游戏工程(T39 – T41)

T39:HTML5 赛博跑酷无尽街机游戏(可直接游玩)

  • 难度:中等
  • 任务目标:纯前端开发一款完整可运行、极具代入感的 HTML5 Canvas 赛博跑酷横版游戏。
  • 输入数据:游戏物理规则、角色动作帧与障碍物分布逻辑。
  • 验收规范
    1. 包含重力模拟、二段跳跃物理判定与精确的 AABB 障碍物碰撞检测。
    2. 具备动态计分、金币收集、生命值扣除与 Game Over 重新开始结算逻辑。
    3. 画面采用霓虹色彩背景视差滚动,完全支持键盘(空格 / 上键)与触屏操作。

T40:Three.js 3D 足球点球大战游戏(可直接游玩)

  • 难度:困难
  • 任务目标:基于 Three.js 开发可直接游玩的 3D 足球点球大战游戏。
  • 输入数据:球门尺寸、足球物理力学方程、守门员 AI 逻辑。
  • 验收规范
    1. 用户通过鼠标滑动或点击确定射门角度、力量与抛物线弧度。
    2. 守门员具备动态扑救 AI 反应机制,精准判定扑出、击中门框或进球得分。
    3. 包含得分计分牌、点球轮次统计与进球慢动作回放特效。

T41:2D 像素复古瓦片地图 RPG 冒险(可直接游玩)

  • 难度:困难
  • 任务目标:开发一款具备经典 16-bit 风格的 2D 瓦片地图 RPG 冒险游戏。
  • 输入数据:瓦片地图网格(草地 / 水域 / 障碍墙)、NPC 对话剧情脚本。
  • 验收规范
    1. 支持主角通过 WASD / 方向键在网格地图中平滑移动与阻挡碰撞检测。
    2. 靠近 NPC 时按下空格键触发对话气泡与分支选择。
    3. 具备任务状态栏与简单道具背包收集系统。

领域十二:自主工场(T42 – T45)

T42:新闻全格式多模态宣发工场(0 人工干预)

  • 难度:困难
  • 任务目标:智能体接收单条行业重大新闻输入后,0 人工干预全自动生成全套宣发物料。
  • 输入数据:一篇 500 字前沿科技发布新闻。
  • 验收规范
    1. 自动生成:1 份核心事实速览 Markdown。
    2. 自动生成:4 款不同风格设计海报(SVG)。
    3. 自动生成:10 页配套宣讲 PPT(HTML 交互版)。
    4. 自动生成:1 个产品发布 Landing Page 官网。
    5. 自动生成:1 份带时序镜头划分的分镜视频脚本。

T43:GitHub 仓库全自动解析与宣发工场

  • 难度:困难
  • 任务目标:智能体自主阅读开源项目代码库,全自动生成项目开源推广与文档套件。
  • 输入数据:GitHub 仓库目录树、核心代码文件与提交历史。
  • 验收规范
    1. 自动生成:中英文双语高保真 README.md(带架构徽章与代码示例)。
    2. 自动生成:交互式开发者文档门户网站。
    3. 自动生成:面向技术大会的 12 页演讲路演 Deck。
    4. 自动生成:架构信息图海报与 Git 提交演进视频播放器。

T44:学术论文全媒体知识转化套件

  • 难度:困难
  • 任务目标:将硬核学术论文一站式转化为大众与专业人士皆可消费的全媒体知识资产。
  • 输入数据:一篇高难度前沿大模型论文全文。
  • 验收规范
    1. 自动生成:面向大众的通俗版精炼解读长图文。
    2. 自动生成:面向同行的 15 页学术演讲幻灯片。
    3. 自动生成:包含男女双人互动的科技播客对话脚本,并集成 Web Audio 语音合成实时朗读试听。
    4. 自动生成:核心公式与概念知识闪卡(Flashcards)。

T45:音视频内容知识图谱与知识卡片工场

  • 难度:困难
  • 任务目标:从长音频 / 视频文本中提取知识脉络,全自动生成交互式知识图谱与速览卡片。
  • 输入数据:1 小时前沿科技公开课 / 发布会转写文本(包含时间戳)。
  • 验收规范
    1. 自动抽取实体关系三元组,渲染可拖拽、力导向交互式知识图谱。
    2. 自动提炼 6 张主题知识速记闪卡,支持正反翻转记忆。
    3. 自动生成带时间戳跳转的大纲目录与 5 分钟极速阅读简报。

实测过程与产物

基于上述 45 项任务,我们使用 Antigravity CLI 全部跑完。下面是过程与交付物截图。

IDE 任务截图

Gemini 3.7 Flash 在 Antigravity IDE 中的任务截图Gemini 3.7 Flash 在 Antigravity IDE 中的任务截图

任务完成情况

Gemini 3.7 Flash 45 项任务完成情况Gemini 3.7 Flash 45 项任务完成情况

45 项标准化任务交付产物库

Gemini 3.7 Flash 45 项标准化任务交付产物库Gemini 3.7 Flash 45 项标准化任务交付产物库

OCR 识别

Gemini 3.7 Flash OCR 识别结果 1Gemini 3.7 Flash OCR 识别结果 1

Gemini 3.7 Flash OCR 识别结果 2Gemini 3.7 Flash OCR 识别结果 2

广告分镜

Gemini 3.7 Flash 广告分镜产出Gemini 3.7 Flash 广告分镜产出

Markdown 文档处理

Gemini 3.7 Flash Markdown 文档处理结果Gemini 3.7 Flash Markdown 文档处理结果

代码能力

Gemini 3.7 Flash 代码能力实测Gemini 3.7 Flash 代码能力实测

建模

Gemini 3.7 Flash 3D 建模实测Gemini 3.7 Flash 3D 建模实测

游戏开发

Gemini 3.7 Flash 游戏开发实测Gemini 3.7 Flash 游戏开发实测

学术媒体处理

Gemini 3.7 Flash 学术媒体处理实测Gemini 3.7 Flash 学术媒体处理实测


总结

这轮实测用 Antigravity CLI 把 12 个领域、45 项任务全部跑完。总体判断很明确:能交差,但还谈不上精致;快是真快,质量仍要靠人盯。

速度是这代 Flash 最直观的体感。从开任务到出产物,等待成本明显低于我们以往测过的偏「思考型」模型。文档、海报、PPT、网页骨架、架构图、OCR、代码工程、3D 和游戏这类「目标清楚、验收条目写死」的任务,基本都能给出可打开、可演示的交付物。截图里的产物库也说明一点:它不是只会聊天,而是能把多模态任务落到文件。

质量是另一回事。多数产物停留在「结构对、能看懂、能往下改」,离白皮书级排版、像素级还原、生产级代码还有距离。OCR 能抽出字段,分镜能拆出镜头,Markdown 能转成更像样的文档,建模和游戏也能跑起来——但数字校验、视觉对齐、交互细节、代码解耦,往往还要二次打磨。Flash 更像高速草稿机,不是终稿机。

Coding 是这次最值得单独说的一块。Google 一直被吐槽写代码不如竞品稳,3.7 Flash 至少把这条短板补进了可实测的区间:React 控制台、Next.js 骨架、Electron、Chrome 扩展、VSCode 插件都能交卷。它弥补的是「敢写、能写、写得够快」,还不是「写完就能上线」。复杂工程里的状态管理、边界条件和架构品味,仍然需要更精确的指令,以及人来收口。

真正拉开差距的是 Agent。T42 到 T45 这类「一条新闻 / 一个仓库 / 一篇论文进,全套物料出」的自主工场,对规划、拆解、跨文件一致性和自我纠错要求更高。实测里这部分最弱:智商理解偏飘,容易漏步骤、串目标、或在长链路里丢掉约束。命令写得越含糊,跑偏越快;验收写得越细,完成度越高。 它更适合当执行层,不适合当完全放手的项目经理。

如果要用一句话给选型建议:日常要吞吐量、要多模态草稿、要 Coding Agent 加速,3.7 Flash 值得上;要一次成型的设计质感、要少干预的长程 Agent,先别把预期拉满。提示词和任务书尽量写成「目标 + 输入 + 硬验收」,比形容词堆砌更有效。这轮 45 项的意义也在这里——不是刷榜,而是把 Flash 在真实交付链路上能走多远、会在哪一层掉链子,摊开给你看。

欢迎浏览和收藏🔖我们的主站

Start: 沃尔码API 🙏支持
对于商业化合作请留言。💼
如果本文对您有帮助,可以下方赞赏我们💪💪Good luck!
赞赏博主