top of page

OpenAI o3 与 Gemini Sheets 引发新一轮工作流战争

6月12日
讀畢需時 9 分鐘

OpenAI 发布了 o3,其中包含新的电子表格操作功能。Google 同时推出了 Gemini Sheets。知识工作者打开了这两种工具,检查它们是否真的能从日常任务中节省数小时时间。

Reddit 上的帖子充斥着在相同数据集上的并排测试。人们想知道新模型是否消除了复制粘贴步骤,还是仅仅生成了更漂亮的答案。

此处的主要关键词是 AI workflow tools。用户将基准视为营销噪音,直到工具真正处理实际的行和公式。

模型进入电子表格层

OpenAI o3 添加了直接单元格编辑和公式建议功能。Gemini Sheets 保留了熟悉的网格,但在现有公式之上添加了提示层。两个系统现在都接受在工作表内输入自然语言指令。

知识工作者在相同文件上对两个工具运行了相同的提示。输出在布局选择和引用处理方面存在差异。

真实的电子表格工作涉及从会计平台导入 CSV 导出文件、调整货币转换以及应用反映公司政策的条件格式。o3 允许用户输入“使用上个月的 FX 汇率重新计算利润率,并突出显示低于 12% 的任何行”,然后直接编辑相关单元格,同时保留审计员留下的单元格注释。Gemini Sheets 则在侧边面板中显示相同指令,作为建议函数,用户必须先批准才能填充新列。早期采用者指出,o3 的激进直接编辑减少了点击次数,但当底层数据模型包含隐藏的命名范围时,需要更仔细的审查。

管理跨多个利益相关者共享文件的团队还发现了版本历史粒度方面的差异。o3 将每个 AI 生成的更改记录为带有简短自然语言摘要的独立修订,使回滚单个公式集群变得更容易。Gemini Sheets 将 AI 建议合并到现有版本堆栈中,这使历史记录更短,但更难隔离引入自动化列的确切时刻。

除这些机制外,两个工具在处理外部数据引用方面也存在差异。当提示引用货币表时,o3 可以从批准的 API 中提取实时汇率源,每次模型重新评估利润率公式时自动刷新值。Gemini Sheets 将此类动态提取限制为 Google Sheets 现有数据连接器框架内手动刷新的查询,这增加了额外的确认步骤,但防止了在高峰协作时段进行意外的网络调用。因此,在多币种预测方面,财务团队在速度重要时偏好 o3,而合规官员在每次外部查找都必须记录在企业 Workspace 审计跟踪中时更喜欢 Gemini Sheets。

在公式透明度方面出现了更深层次的区别。o3 为其所做的每个更改提供自然语言解释,列出哪些单元格发生了变化以及模型选择特定舍入规则的原因。此功能有助于初级分析师理解逻辑,但可能会让只想更新数字而不需要注释的用户感到不知所措。Gemini Sheets 保持最少的解释,仅记录触发建议的提示,其余留给已经理解现有公式的用户。

根据 Google's official AI updates,Gemini 的集成优先考虑 Workspace 合规边界。同时,The Verge reported o3 的直接编辑引发了关于自动化更改可见性的早期担忧。

日常工作测试取代基准分数

基准侧重于受控条件下的准确性。办公任务需要一致处理从多个来源提取的混乱数据。几位 Reddit 用户发布了费用跟踪、预测更新和客户列表的测试结果。

一项测试涉及提取上季度数字并构建差异报告。o3 更快地生成了报告。Gemini Sheets 在无需额外点击的情况下保持了列标题对齐。

跨营销、财务和运营团队的扩展测试显示出一致的模式。维护活动归因表的营销分析师经常合并来自三个不同广告平台的数据。当他们要求两个工具“标记任何每条线索成本环比上升超过 15% 的活动”时,o3 正确识别了活动,但有时改变了源列的排序顺序。Gemini Sheets 保留了原始排序顺序并添加了新的状态列,从而保留了依赖固定列位置的下游数据透视表。运行现金流预测的财务团队重视 o3 插入自动计算滚动平均值的辅助列的意愿,但他们标记了模型在没有解释的情况下将差异字段的符号从正变为负的实例。这些边缘案例说明了为什么日常工作测试现在比假设干净、单一来源输入的学术基准更重要。

处理库存对账的运营团队进一步突出了差距。一家物流公司导入了包含 18,000 个 SKU 的每周仓库 CSV 文件,这些文件具有不一致的计量单位缩写。o3 正确地规范化了大多数缩写,但偶尔会混淆“EA”(each)和“EACH”,迫使进行第二次手动检查。Gemini Sheets 保留了原始缩写并附加了一个单独的查找表,分析师可以稍后对其进行审核,从而保留公司 ISO 9001 程序所需的审计跟踪。

运行多渠道归因测试的营销团队也发现了缺失值处理方面的差异。当来自 API 的活动数据不完整时,o3 尝试根据先前时期估算平均值,这对高容量活动有效,但对历史少于五周的新产品产生了误导性结果。Gemini Sheets 用红色标记了空白并等待手动输入,迫使分析师决定是填充零还是完全排除行。

9to5Google noted Google 强调保守处理以符合企业审计需求。

共享环境中的实际工作流细节

将任一工具集成到现有电子表格工作流中需要注意权限模型和数据驻留规则。在存储敏感客户数据的组织中,o3 的直接单元格编辑目前通过 OpenAI 的企业端点路由提示,该端点提供合同数据处理附录。Gemini Sheets 在 Google Workspace 的区域数据中心内处理提示,满足已经致力于该合规边界的团队。两种方法仍然要求在任何外部数据离开企业租户之前获得明确的用户确认,这一步骤增加了摩擦,但防止了个人身份信息的意外泄露。

另一个工作流细节涉及数组公式和自定义脚本的处理。维护遗留 VBA 宏的用户发现,o3 有时会将数组公式重写为动态数组溢出,从而破坏宏对单元格引用的假设。Gemini Sheets 保留了数组公式不变,仅将 AI 建议作为相邻的计算列提供,让高级用户有时间决定是否永久迁移逻辑。

知识工作者跟踪实际节省的分钟数

测试的时间日志显示出虽小但可重复的收益。当数据保留在一个文件中时,o3 每个报告大约节省八分钟。当工作表已包含数据时,Gemini Sheets 节省了四分钟。

这些分钟在重复任务的一周内累积起来。跟踪工时的团队现在将新的 AI 工作流工具与旧宏进行比较。

一家中型 SaaS 公司对 47 名员工进行了为期三周的跟踪,并记录了每次超过十分钟的电子表格会话。汇总数据显示,当 o3 处理差异分析和简单连接时,每位员工每周平均减少 37 分钟。Gemini Sheets 实现了 19 分钟的平均减少,主要是因为其更保守的方法需要更少的后续更正。这一差异转化为整个团队每月节省大约 30 个全职小时——足以证明适度试点计划的合理性,但仍远低于早期营销视频中承诺的多小时收益。

当同一家公司按角色细分结果时,出现了进一步的粒度。收入运营分析师节省的时间最多(每周 52 分钟),因为他们经常性的流失报告涉及跨 CRM 导出的可重复连接。相比之下,法律运营人员每周仅节省 11 分钟,因为他们的模板包含大量需要人工验证的监管参考文献,两个模型在发布前仍需要人工验证。

监控续订概率的客户成功团队取得了中等结果,一旦他们训练模型尊重与默认销售术语不同的 CRM 阶段定义,每周节省 28 分钟。

正如 Bloomberg coverage of enterprise AI pilots 中所讨论的,这些增量节省正在重塑对知识工作工具的期望。

上下文提供仍然限制输出质量

两个工具都要求用户粘贴背景文档或重复项目细节。如果没有这一步,模型会对类别和单位做出通用假设。

用户报告称,提供上下文仍然是最大的隐藏时间成本。更新每月功能优先级矩阵的产品经理在任一模型能够正确排列计划之前,仍必须粘贴上个月的路线图幻灯片和当前 OKR 文档。如果没有这些工件,o3 偶尔会默认收入加权,而团队实际上优先考虑可能在两个季度内不会产生收入的战略赌注。Gemini Sheets 倾向于保留工作表中已有的任何加权,这可能使结果过于接近历史先例。

尝试持久跨文件内存的团队注意到,维护此类层将上下文提供步骤从大约 90 秒减少到每次会话不到 10 秒。当分析师每天早上在五六个相关工作簿之间切换时,这种减少会迅速累积。

权衡出现在公式控制中

用户报告称 o3 激进地重写了公式。有些计算在没有警告的情况下改变了舍入规则。Gemini Sheets 保留了原始公式不变,仅添加了新的计算列。

需要审计跟踪的团队更喜欢第二种方法。想要清理输出的团队更喜欢第一种方法。

激进重写与保守分层之间的选择也会影响下游数据治理。当 o3 将折旧计划公式改为使用月中约定而非公司的月底政策时,这一变更在任何人注意到之前就传播到了董事会级幻灯片中。Gemini Sheets 的附加风格保留了原始公式并插入了说明性注释,使审阅者能够立即发现差异。相反,接收销售系统每周原始导出的分析师们欣赏 o3 能够一次性规范化不一致的日期格式,从而消除了他们之前维护的单独数据清理宏。

早期 AI 电子表格代理的局限性和风险

目前尚无任何工具达到完全无人值守操作所需的可靠性阈值。o3 和 Gemini Sheets 都可能误解包含缩写或非英文字符的列标题,且两者均未维护针对各公司特定财年的内部表示。当工作表引用指向已删除工作表的命名范围时,o3 有时会创建新值而非报错,而 Gemini Sheets 则返回通用的“range not found”消息。这些行为凸显了持续人工监督的必要性,尤其是在计算错误可能导致合规处罚的受监管行业。

另一个风险涉及通过共享文件进行的提示注入。由于两个系统都接受单元格内的指令,恶意或粗心的协作者可以嵌入改变后续 AI 行为的文本。早期测试者建议将敏感计算放在受保护的工作表上,并将提示接受限制在特定单元格范围。

剩余问题集中在长期可靠性上

目前尚无公开数据表明 o3 或 Gemini Sheets 在每周重复报告中漂移的频率。早期测试仅覆盖单次会话。

未来一个季度内,以下三个信号将厘清情况:同一用户发布的稳定准确度评分、影响公式行为的 API 变更日志,以及包含实时电子表格文件的第三方基准更新。

将 AI 工作流工具与传统自动化进行比较

在电子表格接受自然语言提示之前,知识工作者依赖录制的宏、Power Query 脚本或在网格外执行的 Python 笔记本。这些方法仍提供确定性控制和离线执行。AI 工作流工具引入了概率性输出,即使输入文件保持不变,不同会话之间也可能产生差异。

当业务规则在数月内保持稳定时,传统宏表现更佳。当列名或数据架构每周发生变化时,AI 工具更具优势,因为新提示比重写 VBA 代码适应得更快。新兴模式是混合式:分析师首先使用 AI 生成候选方案,然后将可靠的核心锁定到宏或脚本中以实现可重复性。

采用这些工具的团队的实际影响

采用决策取决于现有的协作模式。已标准化使用 Google Workspace 的公司往往会因 Gemini Sheets 的界面与员工日常使用的工具一致而更快推广。投资于 Microsoft 365 的组织必须权衡 o3 与 Excel 的深度集成,以及为两个云提供商维护单独治理政策的必要性。变更管理计划应包含为期两周的影子跟踪期,员工在此期间并排记录 AI 生成和手动创建的输出,以便在任何政策要求更广泛使用之前,对错误率和时间节省进行定量比较。

正在进行季度审计的企业开始要求对任何 AI 生成的列使用产生它的提示进行标记。此元数据使未来审查更快,并帮助满足希望在不阅读每个单元格注释的情况下了解数字来源的外部审计师。

接下来值得关注的事项

下一波更新很可能解决跨工作表记忆和多轮推理问题。两家供应商均已表示将通过安全数据连接器支持引用外部表。请关注衡量每月重复结账漂移的独立审计报告,以及允许管理员限制哪些单元格范围接受 AI 指令的新企业控件。这些里程碑将决定 AI 工作流工具是否从有前景的试点转变为知识工作的默认基础设施。

FAQ

Q: Which tool is better for finance teams handling multi-currency data?

A: o3 通常在动态外部源上节省更多时间,而 Gemini Sheets 提供合规团队更青睐的更强审计日志功能。

Q: Do these tools replace traditional macros?

A: 不会。混合方法效果最佳——AI 生成候选方案,然后将经过验证的逻辑锁定到宏中以实现可重复性。

Q: How much time do users actually save?

A: 受控测试显示,根据工具和角色不同,每位员工每周平均节省 19 到 37 分钟。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page