top of page

ChatGPT的悖论:为什么大型语言模型会随着时间推移而犯错

The Paradox of ChatGPT: Why a Large Language Model Stumbles Over Time

你可以要求 ChatGPT 写一首关于量子物理的十四行诗,或者调试一段 Python 代码,它通常会以令人不安的胜任度完成。但问它“现在几点了?”你可能会得到幻觉、拒绝,或者三小时前的错误时间。这是一种令人不适的体验。我们习惯于将计算机视为高级时钟;我们的手机、微波炉和汽车都能毫无花哨地完成这项任务。然而,作为现代旗舰大型语言模型的 ChatGPT,却难以回答五美元手表就能完美处理的问题。

这不仅仅是一个怪癖。它是对这些系统工作方式的根本揭示。无法报时揭开了“人工智能”的光鲜外表,暴露出其底层的概率机制。理解为什么ChatGPT 在此失败,能更清晰地描绘出大型语言模型究竟是什么——更重要的是,它不是什么。

大型语言模型的架构:ChatGPT 因设计而无时间感

The Architecture of a Large Language Model: Why ChatGPT Is Timeless by Design

要理解这个错误,你必须审视大型语言模型所处的环境。计算机操作系统有一个实时时钟(RTC)——一个由电池供电的专用电路,无论主处理器在做什么,它都在持续计秒。ChatGPT 没有这样的电路。它生活在一个完全由训练数据构建的静态宇宙中。

ChatGPT 中的文本预测与实时信息

大型语言模型本质上在一个封闭房间中工作。当你输入提示时,你是在门下塞一张纸条。ChatGPT 阅读纸条,查看其庞大的冻结文本库(训练数据),并预测最可能的响应。

核心问题是文本预测。该模型基于从数月或数年前的数据中得出的统计可能性生成语言。它不“知道”现在时态的事情。它预测如果被问及时间,一个有帮助的助手会说什么。由于无法访问实时信息,它可能会幻觉出一个看似合理的时间——也许是上午 10:10,因为模拟时钟的库存照片中经常显示这个时间——因为该标记序列在其训练集中频繁出现。

把它想象成一个被困在满是书籍的岛上的漂流者。如果你用瓶子发送消息询问日期,漂流者可以引用莎士比亚或解释相对论,但他们无法查看不存在的日历。他们与时间流脱节。ChatGPT 就是那个漂流者。

技术权宜之计:ChatGPT 大型语言模型中的工具调用与上下文窗口

Technical Band-Aids: Tool Calling and the Context Window in ChatGPT's Large Language Model

OpenAI 和其他实验室的工程师并非对此视而不见。他们知道“个人助理”需要知道你的会议何时开始。他们实施的解决方案是“工具调用”,一种允许大型语言模型暂停生成并运行脚本的方法——如 Google 搜索或系统时钟检查。

函数调用允许 LLM 在对话期间从外部服务和 API 请求信息。当用户提出需要外部数据的问题时,LLM 会识别需求并调用适当的函数。你的函数处理器执行并返回结果,LLM 将其纳入响应中。

修复 ChatGPT 无法报时问题的代价

虽然工具调用听起来是完美的修复,但它仍然极其不可靠。该系统是非确定性的。你可能询问 ChatGPT 时间,它可能决定不调用工具,自信可以直接猜测。或者,它可能调用工具,获取正确时间,但随后在对话进行中丢失该特定细节。

这就引出了上下文窗口。这是大型语言模型的短期记忆。包括当前时间戳在内的每条信息都会消耗该窗口中的“标记”。一位AI 机器人专家向 The Verge 解释说,如果工程师强迫 ChatGPT 每秒检查一次时钟以模拟人类的时间感,它会用无用的噪声淹没上下文窗口。这就像试图在有人每时每刻向你耳朵尖叫当前秒数的情况下进行对话。你最终会失去实际讨论的思路。

因此,ChatGPT 将时间视为按需的外部事实,而非内部常量。它必须在你每次询问时“查找”它。如果提示未触发该特定搜索行为,模型就会回退到其权重——其静态内存——并自信地告诉你现在是 2025 年,而实际是 2024 年,或者给出半个地球以外的时区。

大型语言模型 ChatGPT 中的 AI 幻觉与能力幻象

报时失败引发了一种称为AI 幻觉的现象,但它也暴露了用户期望与系统现实之间的哲学裂痕。当人类助理不知道时间时,他们会看手表。如果找不到手表,他们会说“我不知道。”ChatGPT 受完成模式的驱使,往往更喜欢编造一个听起来合理的时间,而不是打破对话流。

从 ChatGPT 到拼字游戏冠军:大型语言模型的模仿

原始报告的评论区提供了一个绝妙的类比:Nigel Richards。Richards 在不会说法语的情况下赢得了法语拼字游戏冠军。他记住了字典——字母序列和有效组合——但不理解定义。

ChatGPT 的运作遵循同一原则。它是一个大型语言模型,记住了人类互动的“字典”。它知道问题“现在几点了?”通常后跟“XX:XX PM”这样的数字模式。它提供该模式。它不理解该模式本应与地球自转或石英晶体振动相对应。

这就是用户挫败感达到顶峰的地方。我们将心智投射到机器上。我们假设如果它能写代码,它就必须具备基本的认知情境意识。无法报时证明它没有。正如一位用户所指出的,这就像“抄别人的作业。在老师问你一个无法偷看的直接问题之前,你都没问题。”它只是一个非常先进的文本预测器。它能得 A+,直到老师问一个需要从纸上抬起头的问题。

ChatGPT 的用户挫败感:期望与大型语言模型现实

User Frustrations with ChatGPT: Expectation vs. Large Language Model Reality

围绕这些工具的营销加剧了混乱。公司将 ChatGPT 宣传为超能力代理。当用户如此对待它时,失败感觉像背叛。

将大型语言模型营销为数字人类:ChatGPT 的失败之处

不一致性是致命伤。有时 ChatGPT 能报对时间,因为它成功执行了搜索。五分钟后,它失败了。这种非确定性使其成为客观现实的糟糕界面。传统代码是透明的:输入 A 通过规则 C 导致输出 B。你可以看到层级。神经网络是黑箱。我们不知道为什么模型决定在这个特定时刻幻觉时间,而不是检查互联网。

对于普通用户,这种不可预测性使“助理”头衔对于时间敏感任务毫无意义。你无法信任一个偶尔认为现在是上周二的日历管理器,因为某个特定神经元错误触发。大型语言模型在没有单一正确答案的创造性任务上表现出色。它在只有唯一正确答案且该答案每秒都在变化的任务上表现糟糕。

“打字机上的猴子”批评在此引起共鸣。它突出了处理信息与理解信息之间的差异。ChatGPT 处理时间的语法,但缺乏时间存在的语义。在架构改变以弥合静态知识与动态现实之间的差距之前,向 AI 询问时间仍将是一场赌博。

FAQ:ChatGPT、时间与 LLM 局限

FAQ: ChatGPT, Time, and LLM Limitations

为什么 ChatGPT 有时能报对时间,有时却错?

当 ChatGPT 成功触发“工具调用”以搜索互联网或检查其系统提示时,它能报对时间。当它依赖其内部训练数据(静态的)或未能执行该外部检查,导致基于概率的猜测时,它会出错。

我可以通过不同的提示方式修复 ChatGPT 无法报时的问题吗?

你可以通过明确命令它“使用浏览器工具检查当前时间”或在初始系统提示中提供当前日期和时间来提高准确性。然而,即使有这些指令,如果对话过长,大型语言模型仍可能偶尔漂移或幻觉。

什么是“上下文窗口”,它如何影响报时?

上下文窗口是对AI 一次能考虑多少文本的限制。它包括所有内容:你的提示、你提供的任何上下文、对话历史和模型的响应。当你接近此限制时,你本质上是在最大化模型理解和处理信息的能力。

不断将不断变化的当前时间注入此窗口会使其混乱,迫使模型“忘记”对话的早期部分以腾出空间给时间戳更新。

为什么开发者不直接给大型语言模型内置时钟?

大型语言模型一个时钟并不像听起来那么简单,因为模型不以实时方式“思考”;它逐个标记生成文本。集成实时时钟需要一个位于核心模型之外的外部架构(如代理工作流),这增加了复杂性和延迟。

无法报时是否表明 AI 实际上并不智能?

许多专家认为,这一局限突出了“功能处理”与“真正理解”之间的差异。虽然 ChatGPT 能以高水平操纵符号和语言,但其缺乏时间意识表明它缺乏人类意识或基础智能的基本组成部分。

这个问题影响所有 AI 模型,还是仅影响 ChatGPT?

这个问题影响所有原生大型语言模型,因为它们共享相同的预训练静态数据底层架构。然而,像 Google 的 Gemini 这样的模型通常与搜索引擎和系统工具有更紧密的集成,尽管存在相同核心局限,但它们在报时任务上显得更可靠。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page