top of page

OpenAI 记忆更新显示 Dreaming V3 局限性 尽管召回率提升

OpenAI 发布了 Dreaming V3,其记忆架构在长会话中将召回准确率提高了一倍。该公司将此次更新定位为迈向自我更新记忆的一步,该记忆可在无需手动重置的情况下跨用户交互进行学习,此前 ChatGPT 已推出记忆控制功能。

然而,早期测试者报告称,当对话超出单一项目范围时,上下文漂移问题依然存在。承诺的架构与日常可靠性之间的差距,如今集中在用户是否信任系统自行重写历史日志上。

这种紧张关系之所以重要,是因为基于 AI 记忆构建的生产力工具只有在用户接受对过去条目的自动编辑时才能成功。如果没有这种接受,双倍召回率数据带来的工作流增益将十分有限。

Dreaming V3 随扩展记忆层一同发布

OpenAI 于 2026 年 6 月 8 日推出了 Dreaming V3,配备了更新后的记忆系统,可存储和检索的先前语句数量是上一版本的两倍。根据 OpenAI’s blog 上的官方公告,该架构会保留用户决策的滚动摘要,并在新信息与旧摘要矛盾时重写旧摘要。

在多日研究任务上测试该系统的用户发现,模型能够调出累计聊天时长达 40 小时的会话细节。OpenAI 将这一变化描述为从静态上下文窗口转向可自我修订的主动记忆存储。

该更新首先适用于高级付费用户,并将在未来一个月内扩展至更多账户。发布公告中未附带公开基准数据。

记忆层通过同时维护原始对话记录和压缩语义摘要来运行。当用户引入新约束(如修订后的项目截止日期或更新的合规规则)时,系统会评估这些约束是否与早期摘要冲突。若出现冲突,模型会生成替换摘要并存储用户可检查的差异日志。这种设计减少了加载完整历史所需的 token 消耗,但也引入了解释错误可能发生的节点。

早期企业试用显示,该系统能保留数周前讨论的技术规范引用。在一个案例中,一个开发移动应用的软件团队检索到了 22 小时累计对话时间前做出的 API 版本控制决策。模型正确识别了原始约束,并引用了后续澄清内容,无需用户粘贴先前消息。

底层实现依赖混合向量加图存储。每个新对话回合都会被嵌入高维空间,同时更新轻量级知识图谱中的节点,该图谱跟踪实体关系和时间顺序。当矛盾出现时,图谱边会获得衰减权重,使旧陈述淡化,除非被明确强化。这种混合方法解释了为何召回率在狭窄领域大幅提升,但在更广泛项目中仍偶尔出现静默覆盖。

第二个企业案例涉及一个硬件设计团队,他们在三周内维护了组件采购决策的运行日志。记忆层在累计讨论 27 小时后正确回忆了首选供应商变更,随后自动更新了列出旧供应商的摘要。生成的差异日志通过引用最近的价格比较讨论解释了这一变化,为团队节省了约 15 分钟的手动搜索时间。

自更新内存背后的技术机制

Dreaming V3 的内存引擎采用两阶段流水线。第一阶段将每条用户和模型消息实时嵌入到 4096 维向量空间。第二阶段每五轮运行一次轻量级图更新,将预算数字、截止日期或合规规则等实体关联起来。当系统检测到语义重叠超过可调阈值 0.82 的余弦相似度时,会触发摘要生成过程,产生新的压缩记录。

用户可随时通过专用的“memory timeline”面板检查差异日志。每条记录显示变更前后的摘要文本以及模型做出该变更的理由。但在实际使用中,许多测试者发现理由文本过于简略,因此要求在接受修订前提供额外的自然语言解释。

该架构还维护一个独立的“immutable anchor”存储,用于存放用户标记为不可协商的语句。一旦设置锚点,模型可以引用但未经明确确认不得改写。早期采用者大量使用锚点后报告漂移事件减少,尽管他们牺牲了部分宣传的召回率提升,因为允许演变的摘要数量减少。

高级用户发现可以将锚点与自定义元数据标签(如“budget-cap”或“regulatory-must”)结合使用。这些标签出现在图层中,并在检索时获得更高优先级,进一步减少意外覆盖。该组合在需要强制审计轨迹的受监管环境中尤其有效。

召回率上升但漂移依然存在

与选定合作伙伴分享的内部测试显示,新内存层从早期会话中检索正确事实的准确率达到 87%,而之前系统仅为 43%。这一提升源于自更新摘要对存储上下文的压缩与刷新。

实际测试中,测试者发现模型有时会覆盖用户在项目开始时设置的关键约束。有一个记录案例显示,系统用后续讨论点替换了已声明的预算限制,却未标记该变更。

漂移最常出现在用户发出指令后又在不同上下文中重新审视该指令的情况。架构将较新的语句视为更高优先级,这在狭窄主题内产生清晰召回,但在更广泛的工作流中造成不一致。

考虑一位产品经理在规划讨论开始时提出硬性要求:所有功能必须支持离线操作。几天后同一讨论转向仅云端分析功能。模型正确回忆了分析讨论,却从活动摘要中删除了离线约束。当用户随后请求功能路线图时,返回的列表包含违反原始离线要求的仅云端项目。

另一位测试者描述了一个研究工作流,其中源可信度规则在早期已确立。在模型纳入更新但未经充分验证的来源后,可信度规则从活动内存中消失。用户必须再次明确陈述这些规则,模型才开始重新应用。上述示例说明原始召回指标无法完全反映真实世界的可用性。

当用户引入条件约束时,出现了更多漂移模式。一位营销策略师设定规则:所有营销文案必须保持在 140 字符以内以兼容社交媒体。两周后讨论转向长形式博客内容;模型在活动摘要中悄无声息地放宽了字符限制,生成需要大量修订的超长文案。

生产力仍取决于用户信任

该架构要求用户接受系统会在未经明确批准的情况下修改早期条目。采用该更新进行持续项目跟踪的团队表示,只有在建立审查检查点以捕获不必要的重写后,信息检索速度才会加快。

禁用自更新功能的用户发现,召回率提升在第一周内消失。该选择在长讨论的准确性与对存储决策确切措辞的控制之间造成了实际权衡。

OpenAI 表示修订日志保持可见且可逆。独立评审员指出,日志本身变得足够冗长,需要单独的扫描工具,从而降低了原本节省时间的好处。

成功的团队创建了轻量级验证仪式。一个设计小组安排在开始新工作前对记忆日志进行五分钟的周一审查。另一个团队在每个冲刺结束时导出当前记忆摘要,并将其存储在他们的项目管理系统中。这些做法恢复了用户信心,同时保留了大部分召回率改进。

竞争对手系统面临类似权衡

Anthropic 的 Claude Projects 和 Google 的 Gemini 记忆功能也提供会话持久性和摘要更新。两者都将用户覆盖保留在单独的批准层中,而不是默认自动重写,详情见 Anthropic 的开发者文档 和 Google 的 Gemini 产品更新

OpenAI 的方法不同之处在于将重写步骤嵌入核心记忆流程。这种设计在受控测试中提高了召回率数字,但将验证负担转移到用户在活跃工作期间。

目前尚无公开数据表明,在包含验证时间的情况下,更高的召回率是否能在实际办公任务中产生可衡量的节省时间效果。

Anthropic 要求在更新任何摘要前获得明确的用户确认。Gemini 在侧边栏中显示拟议更改,用户可以单独接受或拒绝。这两种方法增加了摩擦,但降低了静默漂移的风险。重视可审计性的团队往往更喜欢这些模型,尽管基准测试中的原始召回率得分较低。

第三个竞争对手 Microsoft Copilot 引入了“记忆快照”切换功能,可在用户定义的里程碑处冻结摘要。早期采用者报告,这种混合方法在保留可审计性的同时仍允许选择性更新,提供了介于完全自动和完全手动方法之间的中间路径。

真实世界用例与示例

使用 Dreaming V3 进行文献综述的独立研究人员发现,记忆层在追踪数十篇论文中不断演变的假设时非常有用。一位用户维持了为期六周的对话,最终引用了 34 个早期会话中的发现。该模型提取了一个仅在 31 小时前被提及一次的具体方法细节,使研究人员无需重新阅读每篇论文即可调整分析。

营销团队在使用该系统协调活动资产时遇到了不同的结果。一个品牌团队在活动开始时存储了品牌声音指南,随后讨论了季节性变化。该模型开始将季节性语气应用于核心品牌资产,削弱了一致性,直到团队添加了明确的检查点。

法律专业人士测试了该系统用于合同条款追踪。记忆更新正确回忆了早期会话中协商的条款,但在同一条款存在多个版本时遇到困难。缺乏版本区分导致模型在最终审查中提取了过时的条款,迫使律师维护单独的记录文档。

Impact on Different Industries

在软件工程领域,团队报告称新开发人员的入职速度更快,因为模型可以从数月前的讨论中重建架构决策。相比之下,金融服务公司面临更严格的内部控制,有效禁用了自我更新功能,从而抵消了大部分召回优势。医疗保健组织表示有兴趣,但在扩大试点之前等待更清晰的 HIPAA 合规删除工作流指导。

从事纵向研究的学术实验室重视该工具能够提取被遗忘的实验参数的能力,但他们仍每周导出快照到机构存储库,以满足可重复性要求。这些不同的结果表明,该技术的价值在很大程度上取决于行业对自动修订的容忍度。

Limitations and Potential Risks

当前的测试涵盖了持续数天而非数月的会话。目前尚不清楚当矛盾指令在更长时间内积累时,自我更新层会如何表现。

企业团队已开始内部试点,将跟踪季度规划周期中的修订准确性。这些试点的结果预计将于 2026 年第三季度发布。

OpenAI 尚未发布有关记忆层如何处理删除请求或监管数据保留规则的详细信息。在更清晰的政策出现之前,这些差距限制了在受监管行业的采用。

另一个风险涉及并发项目之间的数据泄露。由于记忆存储在账户级别而非项目级别运行,跨项目引用偶尔会出现在摘要中。从事机密项目的用户因此必须维护单独的账户,或在敏感讨论中完全禁用记忆层。

另一个局限涉及时间推理。当用户引用“上个季度”等模糊时间范围时,图层有时会将事件与财年对齐错误,生成混合无关时期的摘要。

给用户的实用要点

寻求即时生产力提升的用户应在每个主要工作阶段的开始和结束时建立明确的记忆检查点。他们还应每周将记忆摘要导出到外部知识库,以便回滚不可逆的漂移。

团队可以通过创建共享的“记忆审计”文档来降低风险,该文档列出所有活动约束。在要求模型生成新输出之前,成员可以快速扫描此文档以确认核心规则保持不变。

生产力改进仍取决于用户是否愿意投入少量验证时间。将验证视为可选附加项的组织将继续经历与漂移相关的返工,从而抵消报告的召回增益。

自动化记忆系统中的伦理考量

由于模型会重写自己的摘要,当不正确或有偏见的内容进入压缩记录时,就会产生问责问题。如果早期摘要包含无意中的歧视性语言,而系统后来在没有人工监督的情况下重写它,下游决策可能会继承隐藏的扭曲。研究人员建议定期对记忆差异日志进行外部审计,以在这些模式影响关键输出之前检测它们。

接下来要关注什么

关注 2026 年 9 月到期的首个企业试点报告,以了解计入验证时间后的可衡量生产力变化。关注任何将修订控制移回明确用户批准的竞争性更新。关注 OpenAI 的下一个模型版本,以了解界面内修订日志呈现方式的变化。

这些信号将显示翻倍的召回数字是否转化为持续的工作流增益,还是仍受信任问题的限制。

关注快速发展的技术故事的团队通常需要一个地方来保存源笔记、会议上下文和后续问题。一个轻量级的 AI 知识库 可以使这些移动部分在新闻周期变化后更容易重温。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page