top of page

GPT-6 Astra 生成跑步路线成功了,但代码消失了

9月14日
讀畢需時 11 分鐘

GPT-6 Astra 花了 27 分钟,从 Simon Willison 的住址出发生成跑步路线,随后交付了符合其要求的地图和可下载文件。成功的结果反而让缺失的证据显得更加醒目。ChatGPT Work 向他展示了最终路线,却没有展示背后的 Python 代码或完整执行记录。

Willison 要求生成从其住址出发并返回原点的 5K 和 10K 环线。他让 ChatGPT Work 使用 OpenStreetMap 数据。根据他的跑步路线记录,该智能体返回了嵌入式可视化图、GPX 下载文件和 GeoJSON 文件。

这项任务是智能体式 AI 在传统办公场景之外变得实用的一个异常具体的例子。它在一次对话中整合了地理编码、地图数据获取、图分析、路线选择、文件生成和可视化。

然而,这一结果也暴露了 AI 智能体核心的一项矛盾:系统可以完成困难任务,却让用户无法还原它是如何得出答案的。

这项矛盾比路线本身更重要。OpenAI 将 GPT-6 Astra 定位为适用于长时间计算机工作的模型,用户可将复杂目标委托给它,而非仅请求孤立的答案。这种委托提高了执行记录、中间文件和可复现代码的价值。

因此,GPT-6 Astra 跑步路线这一案例同时检验了两项承诺。Astra 似乎能够完成专业的地理空间工作流;而 ChatGPT Work 在保留事后检查该工作流所需证据方面,似乎准备得并不充分。

GPT-6 Astra 跑步路线将多种工具整合为一个结果

真正重要的变化,不是 AI 建议了一条慢跑路径,而是它根据简短请求组装出了一份可用的地理空间交付物。

Willison 要求系统定位其地址,并使用 OpenStreetMap 数据计算两条环线。环线需要从同一地点出发和返回,同时与目标距离大致接近。

这比让地图服务提供两个固定点之间的路线更难。智能体首先需要获得地理起点坐标,随后还需要取得跑者可能使用的本地道路和步道网络。

ChatGPT 后来告诉 Willison,它使用 Nominatim 定位该地址。Nominatim 是一项地理编码服务,也就是说,它能将书写的地点或地址转换为地理坐标。

系统称,它使用 Overpass 下载附近的 OpenStreetMap 道路和步道数据。Overpass API 可对 OpenStreetMap 数据执行结构化查询,包括地理要素及其描述性标签。

其余工作据称在本地完成。智能体需要将地图元素转化为连通网络,识别候选环线,估算其长度,并选择接近 5 公里和 10 公里的路线。

Willison 没有收到具体实现,因此这些算法步骤仍只是基于信息的推测性重建。智能体的简短说明没有指出其使用的图数据库、搜索方法、路线评分规则或筛选逻辑。

可见的输出则更为具体。ChatGPT Work 生成了一条 5.1 公里的港湾环线,并在对话中展示了它。它还提供了 GPX 和 GeoJSON 文件,这两种都是交换路线几何数据的常见格式。

GPX 是一种基于 XML 的格式,许多健身设备和地图应用都支持它。GeoJSON 使用 JSON 表示地理要素,因此很适合用于网页地图和软件工作流。

嵌入式地图本身也是一项生成的成果。Willison 发现,ChatGPT 创建了一个 HTML 文件,其中包含路线几何数据,以及使用 D3 渲染可视化的 JavaScript。

HTML 将几何数据存储在应用数据元素中。这意味着展示的路线并非只是静态截图;它包含可由软件读取和重新绘制的坐标。

这种组合之所以重要,是因为它跨越了答案与成品交付物之间的界限。一份街道名称清单,在跑者能够使用之前仍需投入大量工作。

生成的文件可以导入其他工具、接受检查,或传输至兼容设备。地图则让用户无需打开其他应用,就能立即进行视觉核验。

OpenAI 将 ChatGPT Work 描述为用于较长、多步骤任务及成品交付物的智能体。其现行的 Work documentation 将这一体验与普通对话式协助区分开来。

这项路线任务与该定义高度吻合。它始于自然语言目标,使用外部数据,执行本地计算,并返回多个协调一致的输出。

不过,这一层级的成功也改变了用户对界面的需求。一旦智能体执行了有意义的计算,其过程便成为产品的一部分,而不再是可随意丢弃的后台活动。

为什么这项小型地图任务很重要

这条路线简洁地展示了 AI 智能体如何将专业工作流转化为普通请求。

手动构建这样的路线通常需要多种工具。用户可能需要对地址进行地理编码、下载地图数据、配置路线软件、检查候选路径,并导出选定的几何数据。

每个阶段都需要不同形式的知识。地理编码要求了解地点搜索服务;提取 OpenStreetMap 数据则需要掌握查询语法或使用合适的界面。

路线计算涉及节点、边、路径权重和连通性等图论概念。文件导出则要求了解健身和地图应用可接受的格式。

ChatGPT Work 显然协调了这些部分,而无需 Willison 监督每一项技术选择。该界面让他描述期望结果,而不是规定完整的实现方式。

这正是通用智能体的核心价值主张。它可以根据目标选择并组合工具,而不是将用户限制在预设工作流中。

通用智能体不必完全取代这些产品。相反,它可以处理固定界面难以表达的特殊请求。

跑者或许会要求路线距离精确接近某个数值、避开特定道路、优先选择步道、经过饮水点,或在日落前结束。自然语言可以轻松组合这些限制条件。

第二类受到冲击的是传统聊天机器人本身。一旦用户看到智能体完成这样的工作,纯文本答案就开始显得不够完整。

他们会期待生成文件、交互式视图、可编辑计算,以及已执行步骤的记录。交付物成为评判对话质量的标准。

OpenAI 在 9 月的发布说明中称 Astra 改进了多步骤工作能力。说明还表示,ChatGPT Work 经许可后可以使用本地文件和受支持的网站工具。

路线案例表明,这些能力的应用可以超越办公文档。它们可以支持带有技术要求的个人项目,而这类项目过去往往需要定制软件。

这并不意味着输出天然可信。恰恰相反,它使验证变得更加重要,因为智能体如今可以产出看似足够完整、可立即使用的成果。

核心矛盾在于能力与可审计性

ChatGPT Work 完成了用户要求的工作,但没有保留足够可见的证据,让用户能够复现结果。

Willison 在收到交付物后询问路线是如何生成的。ChatGPT 给出了涉及 Nominatim、Overpass 和本地计算的高层说明。

这一说明确认了整体架构,却没有透露调用了哪些服务端点、提交了哪些查询,或哪些地图标签被视为适合跑步。

它也没有说明候选环线如何生成。路线脚本可能使用最短路径搜索、途经点采样、环路检测、优化,或几种方法的组合。

这些选择会影响最终路线。它们可能决定系统倾向于铺装道路、海岸步道、过街点、陡坡路段,还是通行信息不完整的路径。

随后,Willison 索要 Python 代码。ChatGPT 已无法提供,显然是因为对话经历了上下文压缩。

上下文压缩会浓缩早期内容,使长时间运行的智能体能够在可用上下文窗口内继续工作。它可以帮助系统保持运行,但细节可能会从活跃上下文中消失。

Willison 认为,使用上下文压缩的系统应当保留原始材料。他还希望,当后续请求需要这些材料时,智能体能够通过工具检索它们。

他的批评指出的是界面问题,而不是模型智能问题。系统可能编写了可靠的代码,却仍未能提供足够的记录。

这一区分至关重要。模型能力回答的是智能体能否完成任务;可审计性回答的是人能否理解、验证、复现或质疑这一任务的完成过程。

对于随意的创意构思,简洁的过程摘要或许已经足够。但对于生成路线、财务计算、研究数据集或业务文件,情况往往并非如此。

有用的审计轨迹不需要暴露私密的思维链推理。它可以由属于任务本身的操作性证据构成。

这些证据可以包括生成的脚本、终端命令、数据源 URL、时间戳、工具响应、警告信息、中间文件,以及相关库的版本。

此类记录不同于隐藏的内部推理。它们记录可观察的操作和转换过程,就像构建日志记录软件是如何被产出的一样。

路线的 HTML 得以保留,是因为它属于最终交付物的一部分。Python 实现却没有保留下来,尽管后者对于验证而言可能更重要。

这种不对称会鼓励用户信任呈现形式而非来源。精美的地图看起来可能很权威,却隐藏了会对安全性和准确性产生实质影响的假设。

当代理工作持续 27 分钟时,问题会变得更加突出。更长的任务可能涉及更多状态、更多工具调用、更多中间决策,也会带来更多悄然失败的可能。

用户不应该需要预判以后会想要哪一份产物。系统应在上下文压缩移除重要细节之前,保留一份结构化的任务包。

一份完善的任务包应将每项输出与其来源关联起来。GPX 文件应关联到生成它的确切脚本、源数据、参数和执行过程。

这类似于维护一个具有可追溯输入与输出的 AI workflow。主题虽不同,但记录保存的原则不变。

因此,这个故事中最根本的对立在于能力与可审计性。Astra 交付了令人印象深刻的结果,但其周边产品未能让这一结果得到充分检视。

OpenStreetMap 带来政策与安全问题

一条路线在技术上可能有效,但仍可能不适合使用、不安全,或不符合其数据来源的管理政策。

生成的结果依赖 OpenStreetMap——一个协作式地理数据库,其覆盖范围和标注质量会因地点而异。它的开放性让不同寻常的工作流成为可能,但并不能消除不确定性。

道路或步道可能存在于数据库中,却未必适合每一位跑者。通行限制、临时封闭、路面状况、照明、过街点、施工和本地风险可能缺失或已经过时。

图计算也可能生成一条连通的环线,在屏幕上看似合理,但在实际地面环境中表现不佳。连通性本身并不能证明路线舒适或安全。

缺失的源代码使外部人员无法检查代理如何处理这些因素。目前尚不清楚它允许了哪些道路类别,或是否排除了标有私人通行权限的道路。

同样不清楚代理是否识别了人行道、行人限制、未铺装路面、楼梯、渡轮连接,或通行受限的步道路段。

Willison 报告称,系统准确生成了他所要求的结果。这为任务完成情况提供了有价值的第一手证据,但并非对路线质量的全面验证。

该示例只涉及一名用户、一个区域和一对请求距离。文章未报告实地测试、海拔分析、无障碍审查或独立对比。

地理编码步骤还带来另一项担忧,因为精确家庭住址属于敏感信息。用户应了解代理会将该地址发送到何处,以及哪些日志可能会保留它。

OpenAI 表示,Work 可根据所选环境的权限使用文件、浏览功能和任务上下文。受管理账户也可能受到组织的数据保留与治理设置约束。

所引用的路线案例并未说明代理联系了哪个 Nominatim 部署。因此,它无法确认该请求适用哪些日志、限制或保留做法。

如果代理使用了公共 OpenStreetMap Foundation 服务,Nominatim policy 就会具有重要意义。该政策限制高频使用,并要求请求具备可识别性和适当归属说明。

该政策还对自动生成的通用地理编码服务施加限制。一次个人查询不同于部署面向大众市场的路径规划产品,但代理必须区分这些情形。

Overpass 也带来类似的运营考量。根据 Overpass guidance,其公共服务器支持小型项目,但可能出现过载。

该指南建议常规或商业用户缓存请求、降低资源消耗、使用数据提取文件,或运行合适的基础设施。公共端点是共享资源,并非无限容量的代理后端。

一份可审计的执行记录将有助于解决这些问题。它可以展示确切端点、请求头、查询次数、归属信息和响应大小。

没有这份记录,用户无法确认代理是否遵守了相关服务政策。最终文件几乎无法证明数据是如何获得的。

安全性还要求将路线呈现为建议,而不是经过验证的指示。跑者在依赖自动生成的环线前,应检查陌生路段,并考虑当地当前状况。

系统应以清晰语言披露路线假设。例如,它可以说明已排除私人道路、优先选择步行路径、接受未铺装步道,以及未掌握当前封闭信息。

这些披露并非装饰性的免责声明。它们帮助用户判断输出是否符合自身需求,以及是否有必要进一步核查。

路线生成代理还需要一种报告不确定性的方式。如果地图标注互相冲突,或某条步道的通行状态不明确,这种模糊性应保留在最终交付物中。

Astra 的结果表明,开放地图数据可以支持复杂的个人任务。缺失的追溯记录则说明,开放数据访问并不能替代透明的执行过程。

透明的代理工作应保留什么

ChatGPT Work 的下一项考验,是能否让成功任务成为可复现的项目记录,而不是一次性对话。

最直接的信号将是对生成代码和命令的持续访问。用户应能重新打开已完成任务,并取得执行期间创建的每一项产物。

这并不要求默认持续展示终端输出。紧凑的界面可以先展示结果,同时在检查控件后保留完整活动记录。

第二个信号将是附加在每项交付物上的来源信息。文件应标明与其创建相关的输入、工具、转换过程和警告。

对于 GPT-6 Astra 的跑步路线任务,来源信息应将 GPX 和 GeoJSON 文件关联到同一次路线计算,还应保留相关的 OSM 查询和生成的 Python 脚本。

第三个信号将是对上下文压缩的更好处理。即使模型不再主动保留每一个细节,被压缩的对话也应保留可恢复的归档记录。

当用户询问此前发生了什么时,代理可以搜索该归档。这将把高效的活动上下文与持久的任务历史分离开来。

这些变化将在不暴露私有模型推理的情况下,加强 OpenAI 的透明度主张。OpenAI 表示,Astra 强调对齐、任务边界,以及委派工作期间更清晰的行为。

运营记录能让这些主张在产品层面得到检验。用户可以检查代理是否遵守范围,而不必只依赖其总结。

构建通用代理的竞争对手面临同样的挑战。当用户无法验证关键业务输出时,更快的任务完成速度和更好的基准测试分数将变得不那么重要。

开发者早已期待可复现的环境、版本历史和日志。随着代理开始生成分析、演示文稿、数据集和运营变更,知识工作者也将形成类似期待。

界面还应允许用户导出完整任务包。该任务包可以包含提示词、已批准权限、脚本、日志、来源参考、产物及简洁的执行摘要。

可共享的任务包将改善协作。同事无需重建整段对话或信任一张截图,就能审查方法。

它也将支持纠正。如果路线包含不合适的步道,用户可以识别相关规则,并用修订后的约束重新运行工作流。

持久记录会使代理工作具有累积性。一条成功的 5K 路线可成为后续涉及坡度、路面、照明或季节性封闭请求的起点。

没有这些记录,每一次后续请求都可能变成全新的推断。代理可能生成不同的方法,却将其表述为原始任务的延续。

不应低估其底层成就。一条简短的自然语言指令在 27 分钟内生成了两种环线距离、一张交互式地图和可移植的地理空间文件。

这是通用代理为特定个人目标协调工具的可信示例。它说明,完成的交付物可能比流畅的回答更重要。

该案例也表明,输出质量不能成为唯一的成功衡量标准。当代理的过程影响其工作可靠性、安全性或合法性时,用户需要持久的证据。

因此,未来对 GPT-6 Astra 跑步路线的评价应基于两个结果:路线是否满足请求,以及用户能否准确重建它是如何生成的?

如果 OpenAI 增加持久执行历史、产物来源信息和可恢复的压缩前记录,这一示例将显得像早期的产品缺口。否则,随着代理承担更高风险的任务,隐藏的工作过程将成为更大的负担。

实际的应对方式是在任务仍处于活动状态时索要证据。除最终交付物外,还应请求脚本、源端点、假设、中间文件和验证说明。

这种习惯不应永远是必要的。成熟的代理界面应自动保留这些材料,并由用户决定何时检查。

路线成功了。下一个里程碑,是让其背后的工作像 GPX 文件本身一样可移植、可审查且持久。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page