OpenAI o3 和 Gemini Sheets 引发新一轮工作流战争
OpenAI o3 和 Google Gemini Sheets 正在将 AI 工作流工具转变为日常办公武器。这种碰撞在用户论坛中显现,团队们用实际的电子表格和会议记录而非排行榜分数来测试模型。两款发布都针对同一痛点:知识工作者花费数小时在模型与文件之间移动数据。
Disclosure: The publisher of this article maintains a commercial relationship with remio and offers the product discussed below. This analysis treats remio strictly as one comparative case study among several workflow approaches, consistent with journalistic transparency standards.
OpenAI o3 和 Gemini Sheets 的实际交付内容
OpenAI 发布了 o3,在电子表格和文档工作流中扩展了工具控制。该模型现在可以提取实时单元格引用并输出结构化表格,无需手动复制粘贴步骤。用户可以动态引用特定范围、在多个工作表间触发计算,并接收可直接导入现有模板的 JSON 格式结果。这减少了聊天界面与桌面电子表格应用之间的典型往返。例如,财务主管可以要求 o3 从固定资产选项卡提取折旧计划,应用新的税率假设,并通过单一命令序列将合并条目推送到损益表工作簿。
Google 以 Gemini Sheets 更新回应,允许用户直接在单元格中运行多步分析。official Google Blog post 详细说明了该功能如何链接研究调用并从内部数据创建格式化报告。财务分析师现在可以输入自然语言请求,例如“比较 Q3 各地区收入与去年相比,并突出显示超过 15% 的差异”,然后在不离开浏览器标签页的情况下同时获得计算表格和 accompanying 图表。在后台,Gemini Sheets 自动检测区域货币格式,应用与公司风格指南一致的条件格式规则,并嵌入生成后仍可编辑的公式。
这些举措将对话从纯推理测试转向现有工具(如 Excel 和 Docs)内节省的时间。早期用户报告显示,当模型处理格式化和基本计算时,协调两个数据集或生成月度摘要等常见任务从三十分钟缩短到五分钟以下。对于已经生活在 Google Workspace 或 Microsoft 365 环境中的工作者,这种改进最为明显。一位物流协调员报告,更新每周库存差异仪表板现在只需一次提示的时间,而非之前涉及 VLOOKUP 重写和手动颜色编码的四十分钟例行程序。
AI 工作流工具演进背景
AI 工作流工具最初是孤立的聊天界面,要求用户来回复制文本。早期版本的 GPT 和 Bard 可以回答问题,但没有与文件或实时数据的原生连接。下一波引入了插件和扩展,但仍需要重复上传上下文。OpenAI o3 和 Gemini Sheets 代表当前阶段:模型直接嵌入电子表格网格中,无需离开文档即可对单元格进行操作。
这一进程反映了早期的生产力转变。当 VisiCalc 首次出现时,它并没有一夜之间取代纸质账簿;相反,它逐渐改变了会计师构建日常工作的方式。同样,最新的 AI 发布并未取代整个团队,而是改变了报告周期和数据审查会议中的微步骤。曾经在周一安排专门“数据准备”时间块的公司,现在将这些步骤融入实时建模会话,让分析师有更多时间用于情景解读。The Verge 强调这反映了早期办公软件的缓慢采用曲线。
知识工作者为何关注时间节省而非基准
基准测试衡量的是很少与办公例行程序匹配的孤立任务。一个在数学问题上得分高的模型,在被要求将上季度的会议记录与当前电子表格结合时仍可能失败。这种不匹配是因为基准很少包含真实文件中出现的跨文档引用或不断变化的团队优先级。
真实测试显示用户在自行计时工作流。他们跟踪研究综合和报告生成所花费的分钟数。一个记录案例涉及一位营销分析师,他之前每周一花费 45 分钟将 CRM 导出拉入幻灯片。现在使用原生 Gemini Sheets 公式,同一报告在八分钟内完成。另一个案例跟踪了一位工程经理,他通过让 o3 将 Jira 导出与人力电子表格交叉引用,将 sprint 规划准备从两小时减少到二十五分钟。
华丽分数与可用输出之间的差距解释了为什么团队现在对 AI 工作流工具提出不同问题。他们想知道日历中消失了多少分钟,而不是模型在静态测试集上获得多少分。9to5Google 证实,真实世界的时间数据现在比合成基准更能驱动购买决策。
OpenAI o3 与 Gemini Sheets 在核心任务上的比较
集成深度
OpenAI o3 更自由地连接外部代理和自定义脚本。开发者可以通过 Zapier 或内部 REST 端点路由输出,让模型访问电子表格之外的 CRM 记录或工单系统。Gemini Sheets 则停留在 Google 生态系统内,提供更干净的单元格级执行。后者避免了身份验证对话框,但将数据源限制在已存在于 Drive 或 BigQuery 中的数据。
上下文处理
OpenAI o3 要求每个项目重新上传。当用户从一个电子表格切换到另一个时,除非重新上传文件,否则模型会丢失对话历史。Gemini Sheets 从 Drive 历史中提取,但对较旧文件的深度有限。超过 90 天的文件经常触发截断警告,迫使用户先进行总结。
报告输出质量
两者都能生成干净的表格。如果没有重复提示,两者都不会记住先前的团队决策。一位在季度中更改收入目标的产品经理每次让模型重新生成预测时都必须重申新假设。
这种分歧迫使团队在灵活性与原生文件访问之间做出选择。已经投资于 Google Workspace 的组织倾向于使用 Gemini Sheets 进行日常编辑,而依赖自定义脚本或外部数据库的团队则探索 OpenAI o3 集成。
通用代理在日常工作中的不足
大多数通用 AI 代理每次会话都需要新的上下文。用户在任何有用输出出现之前都要花费时间解释公司指标、过去项目选择和团队惯例。一个典型的三十分钟会议回顾可能需要额外十五分钟的提示编写来重新建立背景。
OpenAI o3 和 Gemini Sheets 改进了模型层,但留下了记忆空白。它们仍将每个查询视为全新开始。即使底层模型在链接步骤方面有所改进,缺乏持久的跨会话记忆意味着一旦用户离开当前文件,时间节省就会停滞。
这种模式解释了为什么当团队衡量实际节省的分钟数时,保持连续上下文的工具现在引起关注。持久记忆消除了每次新分析开始时发生的重复 onboarding 成本。
比较案例研究:持久记忆方法
解决持久记忆空白的一种方法是 remio,它跨累积的会议、文档和先前决策维护上下文,而不是每次会话都需要重新上传。在与基于会话的代理的比较测试中,remio 自动摄取日历邀请、共享幻灯片和电子表格版本,并根据五级记忆架构对材料进行索引。
五级记忆系统将近期活动、过去事件和长期知识分开但相互关联。近期活动包括过去三天的文档和通话。过去事件涵盖已完成的项目和季度审查。长期知识存储公司目标和政策文档。项目中不会发生会话重置,允许用户在不重新解释假设的情况下继续两周前开始的预测模型。
这种方法直接解决了基准导向发布未衡量的时<|eos|>
一些分析师指出,早期的 o3 和 Gemini Sheets 结果仍需要用户审核准确性。单元格引用错误或从旧文件中遗漏的上下文会在首次通过时出现。从过时标签页中提取的收入数据可能会在任何人注意到之前传播到整个预测中。
团队反馈称,只有在底层记忆层已经足够强大的情况下,时间节省才能成立。没有这一层,提示工程成本会抵消模型带来的收益。这一模式与早期 AI 发布时的情况一致,集成工作只是转移而非消失。
安全团队还指出,更广泛的文件访问会扩大攻击面。OpenAI o3 或 Gemini Sheets 中配置错误的集成可能会将敏感客户数据暴露给未经授权的查询。因此,组织会将这些新工具与严格的权限审查和审计日志搭配使用。
采用这些工具的团队的实际影响
采用 OpenAI o3 或 Gemini Sheets 的团队在首先审计现有文件结构时收获最大。一致的命名约定和文件夹层级能让模型更容易找到相关数据。培训课程教用户如何引用命名范围而非单元格地址,进一步改善了结果。
管理者还发现,最大的生产力提升来自重新设计工作流程本身。团队不再先生成报告再让模型审核,而是让模型从实时数据中组装报告,同时他们专注于解读和决策。
企业治理考量
大型组织还必须解决版本控制和可审计性问题。当 Gemini Sheets 写入引用 BigQuery 表的实时公式时,下游利益相关者需要知道底层查询最后一次刷新的时间。同样,将 JSON 导出到共享 Excel 模板的 o3 脚本需要变更日志,以便财务和合规团队能够追踪特定日期应用的假设。治理手册现在包括强制提示与输出日志记录以及季度模型权限审查。
未来三个月值得关注的事项
关注 OpenAI 是否会为 o3 添加持久记忆钩子,还是保持每会话模型。记忆升级将缩小与专用上下文工具的差距。追踪 Gemini Sheets 在大型 Google Workspace 账户中的采用情况,以观察原生文件优势是否转化为整个部门的日常习惯。
寻找衡量混合电子表格和文档任务端到端时间的第三方测试,而非孤立的基准测试。发布速度和错误率数据的独立研究将帮助团队做出基于证据的决策。Reuters 暗示进一步的集成公告即将到来。
常见问题
切换到 Gemini Sheets 会将我的数据锁定在 Google 内吗?
原生功能在 Google Workspace 内效果最佳,但用户可以将结果导出为其他格式。完整的上下文可移植性仍需要单独的记忆层。
与基于会话的代理相比,持久记忆工具能保留多少上下文?
具备持久记忆的系统可跨会议和文件维护多年存档,而基于会话的代理除非每次重新上传文件,否则会重置。
这些收益仅限于财务和产品团队吗?
营销、法律和运营团队报告称,当持久记忆可用时,综合更新所花费的时间也有类似减少。
评估 AI 工作流工具的用户现在关注每个任务的可衡量分钟数。能在会话间保持上下文的模型减少了重复解释的时间。提供持久记忆的工具将这种连续性与幻灯片、表格和报告的直接输出相结合。了解更多工作流选项 以评估累积上下文如何影响日常计算。



