top of page

Google Antigravity 技术评测:首个真正的 "Agentic" IDE,由 Gemini 3 Pro 驱动

已更新:6月17日

Google Antigravity Technical Review: The First True "Agentic" IDE Powered by Gemini 3 Pro

执行摘要:Antigravity 与向 Level 3 代理自主权的转变

2025年11月17日,Google 发布了 Antigravity,从根本上改变了开发工具领域的格局,标志着从提供键入建议的 "Copilots" 向具备端到端自主执行能力的真正 "Agents" 的转变。这代表了 Google 内部定义的 Level 3 自主权——即 AI 系统能够规划、执行并验证完整的软件功能,而无需在中间步骤进行人工干预。

与通过插件系统将 AI 功能强加于现有架构的 VS Code 衍生版本不同,Antigravity 作为一个专为 Gemini 3 Pro 打造的原生容器运行。该平台核心的技术优势在于其 100 万 token 的原生上下文窗口,这使得直接将整个 monorepos 加载到内存中成为可能,而无需依赖检索增强生成 (RAG) 或基于嵌入的搜索。对于约 40 万行代码以下的仓库,这消除了竞争平台所使用的分块策略中固有的信息丢失和延迟问题。

性能指标验证了这一架构方案。Antigravity 在 SWE-bench Verified 上达到了 76.2%,为编程代理树立了新的行业标杆。该基准测试专门衡量 AI 在不同代码库中解决真实 GitHub issue 的能力,这不仅要求代码生成,还需要对现有系统的理解、测试验证以及 Bug 修复。执行速度显示出 比同类平台提升了 38%,典型的全栈功能开发仅需 42 秒,而竞争对手则需要 68 秒。该平台目前作为免费公开预览版提供,支持 macOS、Windows 和 Linux。

AI 推理栈:Gemini 3 Pro、Computer Use 与异构架构

The AI Inference Stack: Gemini 3 Pro, Computer Use, and Heterogeneous Architecture

Antigravity 并非以单一单体模型运行,而是作为一个由专业模型组成的协调系统,每个模型都针对开发工作流的特定方面进行了优化。

推理引擎:Gemini 3 Pro 与 100 万 Token 上下文窗口

Gemini 3 Pro 作为核心推理引擎,负责处理高层规划、代码架构决策和复杂问题分解。该模型包含一个 Deep Think 模式,在架构规划任务中采用显式的思维链推理。启用后,Deep Think 会在生成最终输出前产生中间推理步骤,将复杂任务的性能从 37.5% 提升至 41.0% 在 Humanity's Last Exam 基准测试中,以及从 91.9% 提升至 93.8% 在 GPQA Diamond 上。

技术突破在于 100 万 token 上下文窗口的实现。处理大型代码库的传统方法涉及将代码片段嵌入向量数据库,然后根据与当前任务的语义相似性检索相关块。这引入了两种失败模式:相关代码可能与查询术语在语义上不相似(检索失败),以及检索到的块丢失了周围的上下文(碎片化错误)。Gemini 3 Pro 的架构直接将整个代码仓库加载到 TPU 内存中,从而保持完整的结构关系,并允许模型遍历依赖项、理解调用层级,以及推断代码更改对整个系统的影响。

基准测试定量地证明了这一优势。在 LMArena 排行榜上,Gemini 3 Pro 获得了 1501 Elo 评分,代表了突破性的性能水平。在数学推理方面,它达到了 23.4% 在 MathArena Apex 上,确立了新的 state-of-the-art 结果。多模态能力在视觉推理的 MMMU-Pro 上达到 81%,在 87.6% 在 Video-MMMU 上 用于视频理解。

Action Engine:用于终端和 Git 自主操作的 Gemini 2.5 Computer Use

当 Gemini 3 Pro 处理推理任务时,Gemini 2.5 Computer Use 模型则在计算环境中执行操作。这一专用模型能够自主管理 CLI 命令、编排 git 操作、处理包管理器交互(npm、pip、cargo)以及控制文件系统操作。该模型在 Terminal-Bench 2.0 上获得了 54.2% 的评分,该基准测试旨在评估 AI 完成需要执行终端命令的任务的能力。

这种集成使智能体能够以真正的自主性运行。在实现新功能时,智能体不仅是生成代码,它还会创建必要的目录、初始化 git 分支、安装依赖项、运行测试,并使用适当的信息提交更改。这消除了基于插件的助手的局限性,即人类必须手动复制生成的代码、手动运行命令并处理环境配置。

Vision Engine:用于 UI/UX 和前端生成的 Nano Banana 模型

Nano Banana 代表了一种轻量级的专用模型,专门针对开发环境中的 UI/UX 生成和图像编辑进行了训练。与通用图像模型不同,Nano Banana理解视觉设计与实现代码之间的关系,使其能够生成生产就绪的 CSS,创建优化的图像资产,并根据屏幕截图或设计模型等视觉输入修改前端代码。

该模型的技术功能是双向运行的。给定模型图或屏幕截图,它会生成相应的 HTML 结构和 CSS 样式,包括响应式断点和无障碍属性。反之,给定现有代码,它可以生成可视化效果,展示修改后的渲染外观,从而实现快速设计迭代,无需手动预览。这种空间推理能力还扩展到通过鼠标移动和屏幕注释来理解界面意图,允许开发人员直接在屏幕上绘制 UI 流程,并由 Nano Banana 生成实现代码。

IDE 架构分析:“三平面”智能体设计

IDE Architecture Analysis: The "Three-Surface" Agentic Design

Antigravity 的架构将功能分布在三个集成平面上,每个平面在智能体优先的开发工作流中承担不同的职责。

1. Agent Manager:多智能体编排层

Agent Manager 作为编排层,提供了一个专用仪表板,用于管理 Google 所称的“群集 (swarm)”操作——即多个智能体在项目的不同方面并行工作。与 AI 辅助仅作为编辑器次要功能的传统 IDE 不同,Agent Manager 将自主智能体定位为主要参与者。界面实时显示每个活跃智能体的状态,显示当前任务、实施计划的进度、资源利用情况以及任何需要人工干预的阻塞问题。

技术实现允许智能体动态生成子智能体。在处理复杂功能时,主智能体可能会部署专门的子智能体,分别负责数据库模式设计、API 端点实现、前端组件创建和集成测试——所有这些都在保持共享内存和上下文的同时并发运行。Agent Manager 提供了暂停代理、调整优先级以及在项目需求中途变更时手动重定向焦点的控制功能。

2. 编辑器:VS Code 兼容性与人工监督

编辑器保持了与 VS Code 兼容的界面,为人工监督和直接代码操作保留了熟悉的工作流。这一设计决策承认了尽管自主性有所进步,开发人员仍需要检查生成的代码、进行手动调整并了解系统状态的能力。编辑器与代理层无缝集成——开发人员可以突出显示代码段并请求代理驱动的重构,或者手动编辑代码,并确信代理会将这些更改纳入其持续的上下文中。

兼容性扩展到了现有的 VS Code extensions,允许开发人员保留他们已经掌握的 productivity tools、语言服务器和调试接口。与需要重新学习基础工作流的全新界面相比,这减少了采用阻力。

3. Canvas:原生 Chrome 集成与深度浏览器运行时

Canvas 代表了 Antigravity 最具特色的技术创新——原生 Chrome 集成允许智能体执行直接的 DOM 操作、自动截图验证以及基于视觉确认的自我修复。传统开发需要手动进行浏览器测试:编写代码、保存、刷新浏览器、检查结果、返回编辑器,如此循环。Canvas 通过允许智能体直接控制浏览器,消除了这一循环。

技术实现涉及一个 Chrome 扩展程序,它向智能体系统开放浏览器 API。智能体可以导航页面、与元素交互、捕获不同视口大小的截图以进行响应式测试、检查网络请求,并验证渲染输出是否符合规范。当出现差异时——例如按钮位置错误或 API 返回异常数据——智能体通过视觉对比或控制台错误监控来检测故障,随后自主实施修复并重新验证。

这创建了一个完全由智能体运行的真实测试驱动开发(TDD)工作流。平台可以生成单元测试、集成测试和端到端浏览器测试,在 Canvas 运行时中执行它们,分析失败原因,修改代码以解决问题,并不断迭代直到测试通过——全程无需开发者参与。

高级 Agent 能力:Swarms、Artifacts 与自动 Mocking

Advanced Agentic Capabilities: Swarms, Artifacts, and Auto-Mocking

多 Agent Swarm 架构与角色专业化

Antigravity 的 swarm 架构部署了多个专业化 Agent,它们在共享相同内存空间和代码库上下文的同时独立运行。与一个 Agent 完成工作后另一个才开始的顺序 Agent 系统不同,swarm Agent 并行工作,通过共享状态和显式通信协议进行协作。

角色专业化允许每个 Agent 专注于特定领域的事务。安全 Agent 持续扫描代码中的 SQL 注入漏洞、XSS 攻击向量和身份验证绕过风险。重构 Agent 监控代码重复、超过阈值的复杂度指标以及提取可重用组件的机会。QA Agent 生成测试用例,验证边缘情况处理,并确保新代码维持现有功能。这些 Agent 并发运行——当一个 Agent 编写新的 API 端点时,安全 Agent 会分析其漏洞,而 QA Agent 则生成测试用例,所有这些都在代码提交之前完成。

协调机制通过乐观锁和自动合并解析来防止冲突。当多个 Agent 修改相关代码时,系统会检测重叠的更改,并编排自动合并(当更改不冲突时)或将 Agent 排队进行顺序应用(当需要手动协调时)。

“Artifact”系统:自动化状态管理与文档化

Antigravity 通过其 artifact 系统维护全面的状态,在 Agent 工作时自动生成结构化的 Markdown 文档。这些 artifact 具有多种功能:它们提供了 Agent 推理的透明度,在 Agent 做出错误决策时为调试创建审计轨迹,并作为随代码库演进的动态文档。

Artifacts 包括 动态任务列表 将高级功能分解为细粒度的子任务,并随着 agent 完成工作或遇到阻碍而自动更新。实施方案 详细说明每项任务的技术方案,包括架构决策、依赖项考量和测试策略。进度报告 提供实时更新,显示哪个 agent 正在处理什么任务、当前的瓶颈以及预计完成时间。复盘演练 在功能完成后生成,记录构建内容、系统运行机制、所做的设计决策以及已知的局限性或引入的技术债。

这种交付物体系将 AI 生成代码通常具有的不透明性转变为透明的过程,使开发者不仅能了解构建了什么,还能理解选择特定方案的原因以及组件之间如何交互。

Zero-Config API 测试、Mock 与 OpenAPI 推断

Antigravity 包含先进的 API 测试功能,无需手动配置。当开发人员在代码中突出显示 API 端点时,平台会自动生成请求示例,推断预期的响应架构(Schemas),并根据这些架构验证实际响应。此推断过程会分析路由处理程序、参数验证逻辑、数据库查询和响应转换代码,以动态构建 OpenAPI 规范。

对于前端开发,系统可以启动带有自动 Mock 网络请求的临时后端。在构建调用尚未实现的 API 的 UI 组件时,智能体会生成返回符合预期架构的真实测试数据的 Mock 服务器。随着真实后端的开发,智能体会逐步用实际实现替换 Mock,并持续运行集成测试以捕获破坏性变更。平台会在代码提交前发现 API 契约冲突,从而避免前端和后端团队仅在集成测试期间才发现不兼容问题的常见情况。

Benchmark 报告:SWE-bench、Elo 评分与性能指标

Q定量分析:Gemini 3 Pro 对比 Claude 3.5 Sonnet

SWE-bench Verified:Antigravity 达到了 76.2%,显著优于基于 Claude 3.5 Sonnet 的系统(如 Cursor,其得分通常在 59% 左右)。SWE-bench Verified 使用真实的 GitHub issue,要求理解现有代码库、生成修复方案并确保解决方案不会破坏现有功能。这 17 个百分点的差距代表了约 29% 的相对提升,表明在生产级软件工程任务中具有更强的性能。

Terminal-Bench 2.054.2% 的得分证明了其相比竞争对手(平均约 41%)具有更卓越的命令行自主性。该基准测试评估智能体是否能完成需要终端操作的任务——包括搭建开发环境、管理进程、调试运行时问题以及编排构建系统。更高的得分意味着智能体可以更独立地运行,而无需开发者手动执行命令。

WebDev Arena Elo: Antigravity 的 1487 评分 大幅超过了 1350 左右的竞争对手平均水平,这意味着在面对面的 Web 开发挑战中,胜率高出约 10%。该基准测试让智能体根据规范构建 Web 应用程序,并由人类评估员判断哪种实现更好地满足需求。Elo 优势表明其对需求的理解更准确,生成的代码质量更高。

速度分析: 功能生成仅需 42 秒,而竞争对手需要 68 秒——速度优势达 38%。该测量涵盖了全周期:解析需求、规划实现、编写代码、安装依赖、运行测试以及验证功能。更快的迭代使开发者能够在相同的时间内探索更多设计方案,并减少从想法到实际运行之间的延迟。

数据对比:Antigravity 基准测试 vs Cursor & Windsurf

基准测试

Delta

SWE-bench Verified

76.2%

~59%

+17.2pp

Terminal-Bench 2.0

~41%

+13.2pp

WebDev Arena Elo

~1350

+137

特性生成速度

42s

68s

-38%

上下文窗口

~200k

5x

代码库导航

提速 40%

基准

+40%

重构准确率

94%

78%

+16pp

Bug 引入率

-50%

基准线

-50%

竞争对比:Google Antigravity vs Cursor vs Windsurf

Competitive Comparison: Google Antigravity vs Cursor vs Windsurf

上下文架构:原生 1M Token 窗口 vs RAG

将 Antigravity 与竞争对手区分开的根本架构差异在于上下文管理。Antigravity 采用原生加载,即整个代码库直接加载到 Gemini 3 Pro 的 100 万 token 上下文窗口中,并维护在 TPU 内存内。这保留了完整的结构关系——导入层次结构、继承链、依赖图和跨文件引用保持完整,且无需额外处理即可进行查询。

Cursor 和 Windsurf 依赖于 RAG 与嵌入,将代码库切分为较小的片段,为每个片段生成向量嵌入,并根据与当前查询的语义相似度检索相关部分。这种方法引入了故障模式:语义不相似但功能关键的代码可能无法被检索到(漏报);检索到的片段缺乏周围上下文,导致智能体误解意图(碎片化错误);且检索步骤增加了每项操作的延迟。

对于约 400,000 行代码以下(可容纳在 1M token 窗口内)的代码库,Antigravity 完全消除了这些限制。对于超过上下文窗口的大型单体仓库(monorepos),Antigravity 仍通过智能上下文窗口化保持优势,这种方式保留了层级关系,而不是将代码视为无结构文本。

浏览器集成:主动 Canvas 控制 vs 被动预览

Antigravity 通过其具有原生 Chrome 集成能力的 Canvas 系统提供 主动浏览器控制。智能体直接操作 DOM,捕获屏幕截图进行视觉验证,监控网络请求,并根据渲染输出的差异进行自我修正。这实现了真正的端到端测试,智能体可以验证功能在实际运行环境中是否正常工作,而不仅仅是代码能否编译。

Cursor 提供 被动浏览器集成,主要通过在浏览器预览窗格中查看生成的代码,智能体无法控制浏览器环境。Windsurf 提供的基本上是 无浏览器集成,将前端开发视为一种无需运行时验证的代码生成任务。由于缺乏主动的浏览器控制,这些平台无法自主验证响应式设计、测试用户交互或检测视觉回归——这些任务仍需要人类开发人员在浏览器中手动测试。

基础设施与生态系统:原生 TPU 集成优势

Antigravity 受益于 Google 基础设施内的 原生 TPU 集成,可直接访问针对 Gemini 模型优化的专用 AI 加速器。这种垂直整合带来了性能优势,并消除了影响第三方集成的 API 延迟。此外,Google 可以优化从模型架构到硬件再到 IDE 的整个技术栈,以实现凝聚性能,而不是将通用模型适配到开发任务中。

Cursor 和 Windsurf 依赖于 第三方 API 依赖,主要通过外部 API 使用 Claude 3.5 Sonnet 或 GPT-4。这在每次请求时都会引入网络延迟,产生对外部服务可用性的依赖,并在高使用率期间受到速率限制。这些平台无法针对特定的开发工作流优化底层模型,必须在通用 API 服务的限制内运行。

功能细分矩阵:上下文、定价与能力

能力

Antigravity

Cursor

上下文窗口

1M 原生

~200k RAG

~200k RAG

浏览器控制

被动预览

多智能体集群

原生

单智能体

单智能体

基础设施

第三方 API

第三方 API

API 测试

零配置

手动设置

手动设置

构建产物文档

自动

手动

手动

费用(当前)

订阅

订阅

定价、集成与公开预览访问

免费公开预览状态与平台可用性

Antigravity 目前以 免费公开预览 形式提供,覆盖 macOS、Windows 和 Linux 平台。此无成本访问包含全部功能——无限代理部署、完整访问 Gemini 3 Pro 推理能力,以及与全部三个界面(Agent Manager、Editor 和 Canvas)的集成。公开预览策略使 Google 能够收集使用数据、识别边缘案例,并根据真实开发工作流优化代理行为,然后再过渡到商业定价。

Gemini 3 API 定价模型(预览后)

公开预览期结束后,Google 将对底层 Gemini 3 Pro API 实施基于使用量的定价,对于最多 200,000 个 token 的提示,输入 token 为 每百万输入 token $2.00,输出 token 为 每百万输出 token $12.00。对于超过 200,000 个 token 的上下文,定价会相应调整以适应处理更大上下文的计算需求。此定价结构使 Antigravity 在生产使用中经济可行——一个典型的完整功能需要 50,000 个输入 token 并生成 15,000 个输出 token,费用约为 $0.28,比节省的开发时间低几个数量级。

定价模型包含 Gemini 3 Deep Think 模式,用于增强复杂架构问题的推理,该模式将在未来几周内向 Google AI Ultra 订阅者开放。需要专用容量的组织可以通过 Google Cloud 的企业产品访问 Gemini 3 Pro,价格基于量承诺定制。

第三方支持:JetBrains、Replit 和 Cursor 集成

除了独立的 Antigravity IDE,Gemini 3 Pro 还可作为现有开发环境中的集成提供,从而扩展其在开发者生态系统中的覆盖范围。JetBrains IDEs(IntelliJ IDEA、PyCharm、WebStorm)通过官方插件支持 Gemini 3 Pro,将代理功能带给数百万已标准化使用 JetBrains 工具的企业开发者。Replit将 Gemini 3 Pro 集成到其基于云的开发环境中,无需本地安装即可实现基于 Web 的代理辅助开发。Cursor本身通过 API integration 提供 Gemini 3 Pro 作为模型选项,允许 Cursor 用户在保持首选 IDE 界面的同时访问 Google 的推理能力。

这种多平台策略确保开发者无论现有工具链偏好如何,都能访问 Gemini 3 Pro 的功能,从而加速在更广泛的开发社区(而不仅仅是 Antigravity 用户)中的采用。GitHub 和 Manus 也提供 Gemini 3 integration,将代理辅助开发扩展到版本控制工作流和专业开发环境中。

常见问题 (FAQ)

Q1:什么是 Google Antigravity,它与带有 AI 插件的 VS Code 有何根本区别?

A:Google Antigravity 是一个 purpose-built agentic IDE,其中 AI 代理作为主要层运行,而非带有附加功能的传统编辑器。与将插件嵌入现有框架的 VS Code 分支不同,Antigravity 颠倒了架构,使代理能够端到端编排整个开发工作流——规划、编码、测试和验证——无需在中间步骤进行人工干预。这代表了真正的 3 级自主性,与在人工控制界面中提供建议的“Copilots”相比。

Q2:Antigravity 的 100 万 token 上下文窗口与 Cursor 和 Windsurf 等竞争对手相比如何?

A:Antigravity 将 entire monorepos directly into TPU memory,保留完整的结构关系,包括导入层次结构、继承链和跨文件引用。Cursor 和 Windsurf 使用带嵌入的 RAG(约 200k 有效上下文),根据语义相似性对代码进行分块和检索相关片段,这会导致检索失败和碎片化错误。对于代码行数低于约 400,000 行的仓库,Antigravity 完全消除了这些故障模式,实现了 40% faster codebase navigation, 94% refactor accuracy (vs. 78% for competitors), and 38% speed improvement

Q3:当前定价和系统要求是什么?

A:Antigravity 在公开预览期间目前在公开预览期间免费,在 macOS、Windows 和 Linux 上提供对所有功能和 Gemini 3 Pro 功能的无限制访问。预览结束后,定价将为每百万输入 token $2.00,每百万输出 token $12.00——一个典型完整功能的费用约为 $0.28。系统要求最低:64 位操作系统、现代处理器、至少 8GB RAM,以及可靠的互联网连接(所有代理操作均依赖云)。

Q4:多代理群如何工作,如何防止冲突?

A:Antigravity 部署多个专业代理同时在同一个代码库上运行——安全代理扫描漏洞、重构代理优化代码、QA 代理生成测试,所有这些都并行进行,同时保持共享内存和上下文。该平台通过乐观锁和自动合并冲突解决防止冲突,仅在需要手动协调时才排队顺序应用。代理会自动通信和协调工作,无需开发者干预。

Q5:哪些任务需要人工监督,哪些可以完全自主?

A:代理可以 自主完成功能实现:解析需求、创建计划、编写代码、安装依赖、运行测试,并在浏览器中验证功能,无需干预。但是,人工监督对于 高层架构决策、模糊的需求、安全关键的选择以及业务逻辑验证 仍然至关重要。构件系统和代理管理器允许您查看进度,并在需要判断时在执行过程中重定向代理。

Q6:Gemini 3 Pro 是否可在其他 IDE 中使用,Antigravity 是否可与现有工作流集成?

A:是的,Gemini 3 Pro 正在整个生态系统中扩展:JetBrains IDE(IntelliJ、PyCharm、WebStorm)、Replit、Cursor、GitHub 和 Manus 均支持集成。目前,Antigravity 与 GitHub 集成以进行版本控制(创建分支、提交更改、准备 PR),并通过 Canvas 集成将 CI/CD 和部署工具视为浏览器可访问的服务。与 Jenkins、GitHub Actions 和 AWS 部署的完整编程集成预计将在预览后版本中提供。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page