OpenAIのメモリ更新がDreaming V3の限界を示す、リコール向上にもかかわらず
- Olivia Johnson

- 6月24日
- 読了時間: 13分
OpenAIはDreaming V3をリリースし、長いセッションでのリコール精度を2倍にするメモリアーキテクチャを導入した。同社はこれを、手動リセットなしでユーザーとのインタラクションを通じて学習する自己更新メモリへの一歩として位置づけ、ChatGPT向けのメモリコントロールの以前のロールアウトに続くものとしている。
しかし初期テスターは、会話が単一プロジェクトを超えて長引く場合にコンテキストドリフトが継続していると報告している。約束されたアーキテクチャと日常的な信頼性のギャップは、システムが自身の履歴ログを書き換えることをユーザーが信頼するかどうかに集中している。
この緊張は重要である。AIメモリ上に構築された生産性ツールは、ユーザーが過去のエントリへの自動編集を受け入れる場合にのみ成功するからだ。その受け入れがなければ、2倍になったリコール数値は限定的なワークフロー向上しかもたらさない。
Dreaming V3は拡張メモリレイヤとともに提供される
OpenAIは2026年6月8日にDreaming V3をロールアウトし、以前のバージョンより2倍の過去の発言を保存・取得できる更新されたメモリシステムを搭載した。このアーキテクチャはユーザー決定のローリングサマリーを保持し、新しい情報が矛盾する場合に古いサマリーを書き換えると、OpenAIのブログでの公式発表で述べられている。
複数日にわたる調査タスクでシステムをテストしたユーザーは、累積チャット時間40時間までのセッションから詳細をモデルが引き出すことを確認した。OpenAIはこれを静的コンテキストウィンドウから自己修正するアクティブメモリストアへの移行と説明した。
この更新はまず上級ティアの有料ユーザーに適用され、今後1ヶ月で追加アカウントに拡大される。リリース発表に公開ベンチマーク数値は添付されなかった。
メモリレイヤは生の会話トランスクリプトと圧縮されたセマンティックサマリーの両方を維持することで動作する。ユーザーが改訂されたプロジェクト期限や更新されたコンプライアンスルールなどの新しい制約を導入すると、システムはそれらの制約が以前のサマリーと矛盾するかどうかを評価する。矛盾が検出された場合、モデルは置換サマリーを生成し、ユーザーが検査可能なdiffログを保存する。この設計により、履歴全体を読み込む場合と比べてトークン消費が削減される一方で、解釈エラーが発生するポイントも生じる。
初期のエンタープライズトライアルでは、数週間前に議論された技術仕様への参照をシステムが保持することが示された。あるケースでは、モバイルアプリケーションに取り組むソフトウェアチームが、累積会話時間22時間前に決定されたAPIバージョニングに関する決定を検索した。モデルは元の制約を正しく特定し、ユーザーが以前のメッセージを貼り付けることなく後続の明確化を参照した。
基盤となる実装はハイブリッドベクトル+グラフストアに依存している。各新しい会話ターンは高次元空間に埋め込まれ、エンティティ関係と時間順序を追跡する軽量ナレッジグラフのノードも更新される。矛盾が生じるとグラフエッジに減衰重みが与えられ、古い発言は明示的に強化されない限りフェードアウトする。このハイブリッドアプローチにより、狭いドメインではリコールが劇的に向上した一方で、より広範なプロジェクトでは時折サイレント上書きが発生する理由が説明される。
2つ目のエンタープライズ事例では、ハードウェア設計グループが3週間にわたる部品調達決定の実行ログを維持した。メモリレイヤは27時間の議論後に優先サプライヤ変更を正しく想起し、古いベンダーをリストしたサマリーを自動更新した。生成されたdiffログは最新の価格比較議論を参照して変更を説明し、チームは推定15分の手動検索を節約できた。
自己更新メモリの技術的メカニズム
Dreaming V3のメモリエンジンは2段階のパイプラインを使用します。最初の段階では、すべてのユーザーおよびモデルメッセージを4096次元のベクトル空間にリアルタイムで埋め込みます。2番目の段階では、予算額、期限、コンプライアンスルールなどのエンティティをリンクする軽量グラフ更新を5ターンごとに実行します。システムが0.82のコサイン類似度という調整可能な閾値を超える意味的重複を検出すると、新しい圧縮レコードを生成する要約パスがトリガーされます。
ユーザーは専用「memory timeline」パネルを通じて、いつでも差分ログを検査できます。各エントリには、変更前後の要約テキストと変更に対するモデルの根拠が表示されます。ただし実際には、多くのテスターが根拠テキストが簡潔すぎると感じ、改訂を受け入れる前に追加の自然言語説明を求めるようになりました。
このアーキテクチャは、ユーザーが譲れないものとしてマークしたステートメント用の独立した「immutable anchor」ストアも維持します。アンカーが設定されると、モデルはそれを参照できますが、明示的な確認なしに書き換えることはできません。アンカーを積極的に使用した初期採用者はドリフトの発生が少なかったと報告していますが、進化が許される要約が減るため、宣伝されているリコール改善の一部を犠牲にしました。
上級ユーザーはアンカーを「budget-cap」や「regulatory-must」などのカスタムメタデータタグと組み合わせられることを発見しました。これらのタグはグラフレイヤーに表示され、検索時に優先度が上がるため、偶発的な上書きがさらに減少します。この組み合わせは監査証跡が必須の規制環境で特に効果的であることが証明されました。
リコール数値は上昇するがドリフトは残る
選ばれたパートナーに共有された内部テストでは、新しいメモリレイヤーが以前のセッションから正しい事実を87%の確率で検索できたのに対し、従来のシステムでは43%でした。この改善は、保存されたコンテキストを圧縮・更新する自己更新要約によるものです。
実際には、テスターはモデルがプロジェクト開始時にユーザーが設定した主要な制約を上書きすることがあると気づきました。文書化された事例の1つでは、システムが明記された予算上限を後の議論点で置き換え、変更をフラグ付けしなかったというものです。
このドリフトは、ユーザーが後で異なる文脈で再検討される指示を出したときに最も頻繁に発生します。アーキテクチャは新しいステートメントをより高い優先度として扱うため、狭いトピック内ではクリーンな検索が可能ですが、より広いワークフローでは不整合が生じます。
オフライン操作をすべての機能がサポートしなければならないという厳しい要件で計画議論を開始するプロダクトマネージャーを考えてみましょう。数日後、同じ議論でクラウドのみの分析機能を検討します。モデルは分析の議論を正しく思い出す一方、アクティブな要約からオフライン制約を削除します。ユーザーが後で機能ロードマップを求めると、返されたリストには元のオフライン要件に違反するクラウドのみの項目が含まれます。
別のテスターは、ソースの信頼性ルールが早い段階で確立された調査ワークフローを説明しました。モデルがより新しいが検証の少ないソースを取り込んだ後、信頼性ルールはアクティブメモリから消えました。ユーザーはモデルが再びルールを適用し始める前に、ルールを明示的に再記述する必要がありました。これらの例は、生のリコール指標が現実世界の使いやすさを完全に捉えていない理由を示しています。
ユーザーが条件付き制約を導入したときにも、追加のドリフトパターンが現れました。マーケティングストラテジストが、すべてのキャンペーンメッセージをソーシャルメディア互換のために140文字以内に抑えるというルールを設定しました。2週間後、議論が長文のブログコンテンツに移行すると、モデルはアクティブ要約内の文字数制限を静かに緩和し、広範な修正を必要とする oversized なコピーを生成しました。
生産性は依然としてユーザーの信頼に依存する
このアーキテクチャでは、ユーザーがシステムが明示的な承認なしに以前のエントリを修正することを受け入れる必要があります。進行中のプロジェクト追跡のためにアップデートを採用したチームは、不要な書き換えを防ぐレビュー チェックポイントを設けた後でのみ、情報検索の高速化を報告しました。
自己更新機能を無効にしたユーザーは、最初の1週間以内に想起精度の向上が消失するのを見ました。この選択は、長文の議論における正確性と、保存された決定の正確な文言に対する制御との間に、実用的なトレードオフを生み出します。
OpenAIは、リビジョンログは表示可能かつ元に戻せると述べています。独立したレビュアーは、ログ自体が長くなりすぎて別途スキャンツールが必要になり、当初の時間節約効果が減少すると指摘しました。
成功したチームは軽量な検証ルーチンを作成しました。あるデザイングループは、新しい作業を開始する前に毎週月曜日に5分間のメモリログレビューをスケジュールしました。別のチームは各スプリントの終わりに現在のメモリサマリーをエクスポートし、プロジェクト管理システムに保存しました。これらの実践により、ユーザーの信頼が回復しつつ、想起改善の大部分が維持されました。
競合システムも同様のトレードオフに直面
AnthropicのClaude ProjectsとGoogleのGeminiメモリ機能も、セッションの永続化とサマリー更新を提供しています。どちらも、Anthropicの開発者向けドキュメントとGoogleのGemini製品アップデートで詳述されているように、デフォルトで書き換えを自動化するのではなく、ユーザーによるオーバーライドを別個の承認レイヤーに保持しています。
OpenAIのアプローチは、書き換えステップをコアメモリプロセス内に埋め込む点で異なります。この設計により制御テストでの想起数値は向上しますが、検証の負担をアクティブな作業中にユーザーに移します。
検証時間を含めた場合に、より高い想起率が実際のオフィス業務で測定可能な時間節約を生むかどうかを示す公開データはまだありません。
Anthropicはサマリーが更新される前に明示的なユーザー確認を必要とします。Geminiは提案された変更をサイドバーに表示し、ユーザーが個別に承認または拒否できます。どちらのアプローチも摩擦を増やしますが、サイレントな逸脱のリスクを低減します。監査可能性を重視するチームは、ベンチマークテストでの生の想起スコアが低いにもかかわらず、これらのモデルを好むことが多いです。
3番目の競合であるMicrosoft Copilotは、サマリーをユーザー定義のマイルストーンで固定する「memory snapshot」トグルを導入しました。初期採用者は、このハイブリッド方式が選択的な更新を可能にしつつ監査可能性を維持すると報告しており、完全自動と完全手動の中間パスを提供しています。
実世界のユースケースと例
文献レビューにDreaming V3を使用する個人の研究者は、数十の論文にわたって進化する仮説を追跡する際にメモリレイヤーが役立つことを発見しました。あるユーザーは6週間にわたる会話を維持し、最終的に34の以前のセッションからの発見を参照しました。モデルは31時間前に一度だけ言及された特定の方法論的詳細を浮上させ、研究者がすべての論文を再読することなく分析を調整できるようにしました。
マーケティングチームは、キャンペーン資産の調整にシステムを使用した際に異なる結果に直面しました。ブランドチームはキャンペーン開始時にブランドボイスのガイドラインを保存し、後で季節ごとのバリエーションについて議論しました。モデルは季節ごとのトーンをコアブランド資産に適用し始め、一貫性が損なわれるまでチームが明示的なチェックポイントを追加しました。
法務専門家は契約条項の追跡にシステムをテストしました。メモリの更新は初期セッションの交渉済み条項を正しく思い出すことができましたが、同じ条項の複数のバージョンが存在する場合に苦戦しました。バージョン差別化の欠如により、モデルは最終レビューで古い条項を提示し、弁護士は別途記録文書を維持せざるを得ませんでした。
異なる業界への影響
ソフトウェアエンジニアリングでは、チームが新しい開発者のオンボーディングを迅速化できたと報告しました。モデルが数ヶ月前の議論からアーキテクチャ上の決定を再構築できたためです。一方、金融サービス企業はより厳格な内部統制に直面し、自己更新機能を事実上無効化せざるを得ず、想起の利点のほとんどが失われました。医療機関は関心を示しましたが、HIPAA準拠の削除ワークフローに関する明確なガイダンスを待ってからパイロットを拡大する方針です。
長期研究にツールを使用する学術ラボは、忘れられた実験パラメータを浮上させる機能を評価しましたが、再現性要件を満たすため、週次スナップショットを機関リポジトリにエクスポートし続けています。これらの異なる結果は、技術の価値が業界特有の自動改訂に対する許容度に大きく依存することを示しています。
限界と潜在的リスク
現在のテストは数日続くセッションを対象としており、数ヶ月続く場合の自己更新レイヤーの動作は不明です。
企業チームは四半期計画サイクル全体での改訂精度を追跡する内部パイロットを開始しています。これらのパイロットの結果は2026年第3四半期に予定されています。
OpenAIはメモリレイヤーが削除リクエストや規制上のデータ保持ルールをどのように扱うかについて詳細を公開していません。これらのギャップは、明確なポリシーが登場するまで規制産業での採用を制限します。
もう一つのリスクは同時進行プロジェクト間のデータ漏洩です。メモリストアがプロジェクトレベルではなくアカウントレベルで動作するため、プロジェクト横断の参照が要約に時折現れました。機密プロジェクトに取り組むユーザーは、別アカウントを維持するか、機密議論ではメモリレイヤーを完全に無効にする必要があります。
さらなる限界は時間的推論に関するものです。ユーザーが「前四半期」などの曖昧な時間枠を参照すると、グラフレイヤーが会計年度をまたいでイベントを誤って位置づけ、無関係な期間を混ぜた要約を生成することがあります。
ユーザー向けの実践的なポイント
ユーザーは即時の生産性向上を求める場合、各主要作業フェーズの開始時と終了時に明示的なメモリチェックポイントを確立する必要があります。また、不可逆的なドリフトをロールバックできるように、メモリサマリーを毎週外部のナレッジベースにエクスポートする必要があります。
チームは、すべてのアクティブな制約をリストした共有の「メモリ監査」ドキュメントを作成することでリスクを軽減できます。モデルに新しい出力を生成するよう依頼する前に、メンバーはこのドキュメントを素早くスキャンして、コアルールがそのまま残っていることを確認できます。
生産性の向上は、ユーザーが少量の検証時間を投資する意思があるかどうかに依存します。検証をオプションの追加として扱う組織は、報告されたリコール向上を相殺するドリフト関連のやり直しを経験し続けます。
自動化されたメモリシステムにおける倫理的考慮事項
モデルが自身のサマリーを書き換えるため、誤ったまたは偏ったコンテンツが圧縮された記録に入った場合の説明責任について疑問が生じます。初期のサマリーに意図せず差別的な言語が含まれていて、システムが後で人間の監視なしにそれを書き換えた場合、下流の決定が隠れた歪みを引き継ぐ可能性があります。研究者は、重要な出力に影響を与える前にそのようなパターンを検出するために、メモリdiffログの定期的な外部監査を推奨しています。
次に注目すべき点
検証時間をカウントした後の測定可能な生産性変化について、2026年9月予定の最初の企業パイロットレポートに注目してください。リビジョン管理を明示的なユーザー承認に戻す競合するアップデートに注目してください。インターフェース内でリビジョンログの提示方法の変更について、OpenAIの次のモデルリリースに注目してください。
これらのシグナルは、2倍になったリコール数が持続的なワークフロー向上につながるのか、それとも信頼性の問題によって制限されたままなのかを示すでしょう。
速いペースで動くテクノロジーのストーリーを追うチームは、ソースノート、会議の文脈、フォローアップ質問を一緒に保管する場所を1つ必要とすることがよくあります。軽量な AIナレッジベース は、ニュースサイクルが変わった後でもそれらの可動部分を再訪しやすくします。


