OpenAI o3 和 Gemini Sheets 引发新一轮工作流战争
- Sophie Larsen

- 6月12日
- 讀畢需時 9 分鐘
OpenAI 发布了 o3,其具备更深入的电子表格集成,同时 Google 在 Sheets 中推出了 Gemini。知识工作者现在比较每种工具在日常任务上实际节省的时间,而不是追逐排行榜分数。
过去一周的 Reddit 讨论中,用户发布了并排计时测试结果。一个线程记录了使用 o3 完成财务模型需要 48 分钟,而使用 Gemini Sheets 只需 31 分钟。另一个线程追踪了销售预测任务:当需要反复编辑公式时,Gemini 用时 22 分钟,o3 则用时 40 分钟。
这一转变之所以重要,是因为知识工作者以返回的分钟数来衡量价值,而不是参数数量。关于此类工作流比较如何重塑产品和工程团队的更多背景,请参阅本指南:practical AI workflows for product managers。
这些发布实际带来了哪些变化
OpenAI 在 o3 聊天会话中添加了原生公式生成和单元格引用处理功能。用户可以粘贴表格并请求计算,同时尊重现有列格式。Google 将 Gemini 直接嵌入 Sheets,使模型能够读取实时单元格值并直接写入公式,无需复制粘贴步骤。
两项更新均于 6 月初发布。OpenAI 于 6 月 3 日发布了变更日志,Google 于 6 月 5 日为 Workspace 用户启用了该功能。这一时间安排使两款工具同时出现在用户已在测试日常工作流的论坛对话中。The Verge 和 Google Workspace blog 的官方报道证实了快速采用曲线。
更深入的集成意味着 o3 现在能理解相对引用和绝对引用(如 $A$1 或 A1:A12),当用户描述列操作时即可识别。相比之下,Gemini 可以触发数组公式,当通过连接的数据源追加新行时自动扩展。这些技术细节直接转化为模型规模超过几百行时更少的手动调整。
除基础功能外,o3 还支持多步推理链,在最终公式出现前展示中间计算逻辑。这允许用户通过询问“显示隔离区域异常值的步骤”来调试方差分析,并同时获得公式和逻辑追踪。Gemini 则添加了对动态命名范围的支持,可跨链接的外部数据集刷新,包括直接馈入收入模型的 BigQuery 表。当营销团队隔夜刷新活动支出数据时,Gemini 可以在次日早晨将这些更新传播到贡献利润率公式中,无需任何用户干预。
进一步的变化包括改进的错误处理。o3 现在会在建议公式前标记潜在的 #REF! 问题,而 Gemini 则在侧边栏中预览数组溢出范围,以便用户在应用更改前批准。这些改进减少了之前每个复杂模型耗费的 5 到 10 分钟往返。9to5Google 的报道强调了这些错误预防功能如何区分两种方法。
团队还注意到,o3 新增了基于数据模式处理条件格式建议的能力,增加了另一层润色。例如,当用户请求利率情景的敏感性表时,o3 可以自动高亮安全边际低于预设阈值的单元格。Gemini 通过其原生条件格式引擎实现类似结果,但要求用户预先定义规则集,以便模型在刷新时重复使用。
时间节省与基准分数
Reddit 用户报告称,排行榜数字很少能预测真实的电子表格速度。一位会计师发布了三份客户报告的结果。当数据以干净的 CSV 形式到达时,o3 处理方差计算更快。当数据位于每小时更新的共享团队工作表中时,Gemini 处理相同报告更快。
差异来自上下文访问而非原始推理能力。Gemini 读取实时工作表,o3 则要求用户每次粘贴新数据。在整个工作周中,这些上下文切换会累积:运行每日收入对账的团队仅在标签页和聊天窗口之间移动数据就可能损失 30 到 40 分钟。
基准分数继续主导营销材料,但采用对话已转向每项任务节省的分钟数。财务团队现在发布内部记分卡,追踪“建模时间”而非静态测试集上的准确率百分比。一家企业发布了一项为期六周的内部研究,显示切换到 Gemini 后每个预测周期平均减少 17 分钟,而另一个使用 o3 处理外部客户工作的部门在标准化包含样本行引用的提示模板后,记录了平均节省 12 分钟。
团队还发现,节省因文件大小而异。少于 5,000 行的文件更适合 Gemini,因为实时上下文消除了重复导出。数万行的较大文件仍受益于 o3 总结跨多个计算阶段的推理追踪,而不会使工作表内存过载。在一次记录的测试中,一个 42,000 行的采购模型使用 o3 完成用时 19 分钟,而通过 Gemini 的实时连接强制处理同一文件则用时 27 分钟,因为 Gemini 暂停以请求确认每个溢出范围。
知识工作者测试两种工具
产品经理描述了运行每周更新模型的工作流。一种工作流将上一季度数字与预测范围进行比较。当新行数据到达时,Gemini 自动更新范围。o3 则要求用户在每次会话中重述比较逻辑。
销售团队测试了管道模型。Gemini 无需额外步骤即可从链接标签中提取机会数据。o3 需要在提示中明确提供列名。团队指出,当文件包含四个以上链接标签时,差距会扩大。运行群组留存报告的营销分析师得出了类似结论:Gemini 的实时工作表上下文消除了每天重新描述筛选条件的需求。
这些重复测试表明,工作流摩擦很少仅与推理深度有关,而是与每个模型在无需人工提示的情况下保留多少状态有关。几个产品团队开始追踪“提示重用率”,发现 Gemini 在一个月迭代中需要重述列名的次数比 o3 少 60%。运行供应链模型的运营团队记录到,o3 的显式推理追踪将向利益相关者解释输出异常所花费的时间减少了约三分之一。
第二个模式围绕委托出现。使用 Gemini 的初级分析师可以将刷新后的文件移交给高级审阅者,所有公式步骤已与实时来源对账,从而将审阅周期从三轮减少到两轮。o3 用户则导出带注释的聊天记录,审阅者随后与主工作簿交叉检查——每次移交额外花费 15 分钟。
日常任务的核心比较
数据处理
o3:每次新计算都需要粘贴表格
Gemini Sheets:读取实时单元格,并在源数据更改时更新
公式编辑
o3:在聊天中建议公式,用户将其复制到工作表中
Gemini Sheets:直接将公式写入选定单元格
团队共享
o3:输出保留在聊天记录中,直到手动转移
Gemini Sheets:输出出现在共享文件中,协作者可见
除这些主要差异外,Gemini 可以一步执行“应用于所有筛选行”操作,而 o3 返回静态列表,必须手动重新应用。相反,o3 提供更透明的思维链步骤,当模型产生意外输出时,审计人员有时更喜欢这些步骤。在一个记录的案例中,控制器使用 o3 的推理追踪重建了 Gemini 静默生成的递延收入计划的确切逻辑,在月末结账期间为团队节省了一小时的反向工程时间。
对不同角色的实际影响
大部分时间在单个工作簿内工作的分析师从 Gemini 的实时上下文获得最大即时收益。他们可以在模型持续反映上游数据变化的同时迭代假设。必须为审计追踪记录每个公式更改的控制器通常更喜欢 o3,因为每个建议都附带明确的推理追踪,可复制到合规说明中。
在没有 Workspace 账户的情况下处理多个客户文件的顾问经常留在 o3 上,以将敏感数据保留在共享文档之外。已标准化使用 Google Workspace 的运营团队将 Gemini 视为默认路径,因为它消除了之前引入版本冲突的复制粘贴步骤。处理季度董事会演示文稿的投资组合经理报告称,Gemini 让他们每天早上在两分钟内刷新情景输出,而 o3 则需要将每个情景导出到单独的聊天会话,平均每次迭代需要 9 分钟。
局限性和风险
几个线程指出,当提示模糊时,Gemini 有时会覆盖现有值。o3 避免了覆盖,但迫使用户验证每个复制的公式。在向客户交付成果前,两种工具仍需要人工审阅。
一位用户报告 Gemini 产生了循环引用,破坏了现有模型。另一位用户报告 o3 忽略了原始工作表中存在的命名范围。这些案例出现在模型收到复杂提示但缺乏逐步指导的线程中。
其他风险包括当工作表包含个人身份信息时的数据驻留问题,以及 Gemini 的直接单元格编辑可能在依赖易失性函数的大型文件中触发意外重算级联。财务团队还标记了通过连接的 API 将外部数据输入工作表时的提示注入风险;一位分析师发现,格式错误的供应商评论改变了 Gemini 应用于收入瀑布的筛选逻辑。两家供应商都建议在授予 AI 编辑权限前保留关键模型的只读备份副本。
详细工作流示例
考虑一个将上一季度实际值与当前季度预测进行对账的收入桥接模型。使用 Gemini 的产品经理可以输入“将桥接扩展到包含新产品线,并使用最新定价标签重新计算贡献利润率”。Gemini 读取定价标签,插入新行项目,并写入一个数组公式,该公式会随未来价格更新自动扩展。整个序列耗时不到 90 秒。
使用 o3 的同一经理必须首先导出定价标签,将其粘贴到聊天中,描述贡献利润率计算,将生成的公式复制回工作簿,然后手动调整引用以匹配实时文件。该过程耗时 6 到 8 分钟,如果基础定价在下次同步前再次更改,还会引入版本控制风险。
另一个例子涉及销售管道概率加权。Gemini 可以检测链接的 CRM 选项卡中阶段定义的变化,并相应重写加权值公式。o3 每次都需要粘贴更新的阶段列表并重述加权逻辑,这为每天多次刷新管道数据的团队增加了重复开销。
在团队中衡量投资回报率
跟踪生产力提升的团队已开始记录采用前后的基准任务时长。一家咨询公司记录到,在启用 Gemini 的文件中,模型构建时间从 47 分钟降至 29 分钟,相当于每位分析师每周节省约 2.5 小时。内部仪表板现在同时显示初稿耗时指标和传统准确率指标。与采用 AI 前的基准相比,使用 o3 处理外部交付物的组织测得每个模型 consistently 节省 15 分钟,但当文件必须在粘贴到聊天会话前进行清理时,节省的时间会减少。
特定行业应用
在生物科技领域,运行检测结果整合的研究人员使用 Gemini 在平板读取器导出文件与汇总统计之间保持实时链接,将重建数据透视表的时间从数小时缩短至数分钟。准备并购模型的投资银行分析师更倾向于使用 o3,因为客户数据敏感性禁止将数据存储在云端文档中。处理每周库存预测的零售运营团队已记录到,当多名规划人员同时更新同一区域选项卡时,Gemini 的实时上下文可防止版本漂移。
如何在两款工具间做出选择
团队应针对最常见的模型类型进行为期两周的试点。如果模型每周从实时仪表板或共享数据源拉取数据的次数超过三次,Gemini 通常更胜一筹。如果模型包含必须置于 Workspace 文档之外的专有假设,则 o3 更可取。混合方法——使用 Gemini 进行数据摄取、使用 o3 进行最终叙述撰写——正在成为务实的中间方案。已有多个团队维护两套并行模板:一套为 Gemini 配置实时连接,另一套为 o3 精简,仅包含匿名化样本数据。
AI 表格集成中的安全考量
安全团队正在研究每种集成如何处理权限和审计日志。Gemini 继承 Sheet 级共享设置,即任何具有编辑权限的协作者都可以在同一数据集上调用模型。o3 在独立的聊天环境中运行,可对谁能看到哪些提示进行更严格的控制。因此,制定严格数据分类政策的企业会将个人身份信息通过 o3 路由,而允许公开市场数据通过 Gemini 流动。两家供应商现在都提供管理控制台,可记录每一条 AI 生成的公式,但日志的粒度不同:Gemini 记录编辑的单元格范围,而 o3 记录推理链。合规官建议在扩大使用规模前,将这些日志与现有的 SOX 或 GDPR 要求进行映射。
值得关注的未来信号
团队将在 7 月下一轮财报周期后分享更新的时效结果。Google 可能会将 Gemini 访问权限扩展至个人 Google Sheets 账户。OpenAI 可能会通过新的连接器添加实时表格读取功能。这些举措都将改变知识工作者的实际对比结果。
需要持续实时数据访问的用户现在会首先测试 Gemini。偏好将敏感数据保留在聊天日志中的用户仍默认选择 o3。最终结果取决于各家公司消除剩余摩擦点的速度。
常见问题
这些工具会取代表格专业技能吗?
不会。两者仍需要用户验证逻辑,并防范会破坏自动公式的边缘情况。
Gemini 和 o3 可以用于同一文件吗?
可以。许多团队将子集导出到 o3 进行复杂情景建模,然后将最终输出粘贴回启用了 Gemini 的共享工作表。
当底层数据结构发生变化时会怎样?
如果列标题保持一致,Gemini 可以适应。o3 则要求用户在每次会话中重新描述新布局。


