top of page

Jevによる『Pokémon Red』攻略は37時間で完了、だが勝利のシステム構築にはClaudeが貢献

9月28日
読了時間: 16分

Jevは37時間40分で『Pokémon Red』をクリアし、16,150回のモデル判断を要した攻略を完遂した。この結果は、類似のゲームを何週間、あるいは何か月もさまよい続けた従来のチャットボット実験と比べると印象的だ。ただし、LLMではないシステムの勝利に見えるこの成果には重要な留保がある。開発者によれば、Claude Opus 5が失敗の診断と、Jevを取り巻く意思決定環境の改善を支援したという。

この違いは重要だ。Jevはゲーム画面を見ていたわけでも、全行程を記憶していたわけでも、コントローラーを直接操作していたわけでもない。カスタムのソフトウェアハーネスがGame Boyのメモリから選択したデータを読み出し、合法的な選択肢を構築し、各選択肢に関する情報を付与した。そのうえでJevが、準備済みの行動から選んだ。

Claudeは、システムの別の層で機能したとされる。ログを確認し、Jevに有用な情報が欠けている状況を見つけ、意思決定モデルに提示する選択肢や指示の改善を支援した。したがってこの攻略は、AIエージェントに関するよくある前提に疑問を投げかけるものの、小規模な意思決定モデルが単独で最先端のチャットボットを上回れることを証明したわけではない。

Jevによる『Pokémon Red』攻略は37時間で終了

この見出しの成果は、開発者が公開した構成の範囲では事実だが、測定しているのは単独モデルではなく完全なソフトウェアシステムである。

Frigadeの開発者Christian Mathiesenは、このオープンソース実験を構築し、2026年9月25日から9月26日にかけて最終攻略を配信した。プロジェクトの公開された攻略データによると、Jevは37時間40分で『Pokémon Red』をクリアした。

リポジトリには、16,150回の判断と約3,920万入力トークンが記録されている。1回の判断には通常、約0.4秒かかったとされる。Jevはパーティ全滅を16回経験し、そのうち14回は四天王への挑戦中だった。クリアまでに四天王へ15回挑戦した。

最終パーティにはレベル83のCharizardとレベル62のGravelerが含まれていた。Nidoqueen、Beedrill、Haunter、Primeapeが残るメンバーを構成した。これらの詳細は、このシステムが序盤エリアを短い既定ルートで進んだだけではないことを示している。

Jevは最初のポケモンを選び、パーティを管理し、ポケモンを捕まえ、技を選び、アイテムを購入し、回復し、育成し、移動先を決めた。メニュー操作やストーリー上の問いへの回答も処理した。リポジトリによれば、ハーネスはゲームメモリへの直接書き込みやイベントフラグの変更を行っていない。

ただし、このシステムにはGame Boyを手にする人間よりはるかに多くの構造化情報が与えられていた。ハーネスはマップ、パーティ情報、戦闘状況、所持品、画面上のテキストをメモリから読み取った。そしてその状態を、有用な情報を添えた明示的な選択肢へ変換した。

ナビゲーションでは、通常のコードが衝突判定と、定義された目的地への経路を計算するA*経路探索を担った。Jevはマップ上の方向ボタンを一つひとつ決めていたわけではない。より上位の目標を選び、その物理的な実行の多くは決定論的なソフトウェアが処理した。

ハーネスには、次の目標とその場所を示すストーリー上のマイルストーンも組み込まれていた。進行状況はゲーム本来のイベントフラグに照らして検証された。これにより、隠しアイテムは隠されたままであったものの、エージェントには物語内での現在位置を構造化して示せた。

ループ防止も別の層を加えた。以前に試みて変化を生まなかった選択肢には警告を付けられた。失敗が繰り返されると、別の選択を促すことができた。最終的には、最新のマイルストーン・チェックポイントを再読み込みすることも可能だった。

こうした介入は攻略の価値を損なうものではない。実用的なAIエージェントはすべて、周辺ソフトウェア、メモリ、ツール、復旧ロジックに依存している。ただし重要なのは、ここでの成果が単一モデルとカートリッジの素朴な対決ではなく、巧みに設計されたエージェント・アーキテクチャにあるという点だ。

最も妥当な結論は限定的である。目的に特化した環境と決定論的な制御を組み合わせた意思決定モデルが、数千回に及ぶ連続的な選択を要する長時間ゲームを完了した。この実験は、Jevがピクセル入力、無制限の行動空間、あるいは外部状態管理なしでどのように機能するかを示すものではない。

PokémonがAIエージェントの弱点を露呈させ続ける理由

Pokémonは個々のターンだけを見れば単純に見えるが、依存関係の長い意思決定連鎖は、弱い記憶と不十分な復旧能力を容赦なく露呈させる。

初代『Pokémon Red』はターン制で、視覚表現も限定的であり、高速アクションゲームと比べれば寛容だ。それでもエージェントには、何時間にもわたって目標を維持することが求められる。プレイヤーはマップを探索し、会話を読み、パーティを編成し、資源を管理し、後の進行を妨げる障害を覚えておかなければならない。

戦闘での悪い選択が一度あっただけで、ゲーム全体が終わることはめったにない。しかし小さなミスを繰り返せば、アイテムを消耗し、チームを弱体化させ、回復施設へ戻される可能性がある。エージェントは、局所的には魅力的に見える行動が長期計画を損なう可能性を認識しなければならない。

この組み合わせにより、Pokémonは汎用AIモデルの公開テストとなった。2025年2月、AnthropicはClaude 3.7 Sonnetにメモリ、スクリーンショット、ボタン操作ツールを与えた。同社の拡張思考に関する研究では、数万回のインタラクションに及ぶゲームプレイが説明されている。

この実験は、洗練されたチャットボットとの会話では見えにくい弱点を露呈させた。モデルは首尾一貫しているように聞こえても、自分の位置を見失ったり、失敗した経路を繰り返したり、古い計画に固執したりすることがある。ゲームでは、すべての判断が持続する環境を変化させるため、こうした誤りが可視化される。

その後、他の開発者もGemini、GPT、新しいClaudeモデルを中心に構築したシステムを配信した。一部は最終的にPokémonゲームをクリアしたが、比較は依然として難しかった。プロジェクトごとに公開する情報、使用するメモリシステム、許容する開発者支援の形態が異なっていたからだ。

2026年1月のゲームエージェント分析は、これらの攻略中に主要モデルが遅く、混乱し、自信過剰になりがちだと説明した。この批判が指摘した問題はPokémonにとどまらない。汎用モデルは、環境の内部表現が不完全であっても、もっともらしい理屈を生成できてしまう。

Jevは異なるアプローチを取る。TypeSafe AIはこれをSystem Oneモデル、すなわち長いテキスト生成ではなく、高速で範囲を限定した判断に最適化されたモデルだと説明している。コンテキストと焦点を絞った問いを受け取り、選択、スコア、あるいは二値の確率を返す。

同社は、こうした出力を通常のソフトウェアに組み込むコンポーネントとして位置づけている。Jevの紹介では、分類、ルーティング、スコアリング、分岐が重視されている。JevをLLMのあらゆる能力を置き換える存在としては提示していない。

開発者がゲームを再構成すれば、この限定的な役割はPokémonに驚くほど適している。ほとんどの場面で、プレイヤーはエッセイを書いたり、無制限の計画を考案したりしているわけではない。攻撃を選び、目的地を選び、アイテムを買い、育成するかどうかを決めている。

課題は、適切な選択肢の集合を生成し、正しい情報を付与することにある。モデルが関連するすべての選択肢を見られれば、高速な意思決定エンジンはゲームを進め続けられる。ハーネスが重大な事実を隠せば、速度はエージェントが誤った判断をより速く繰り返す助けになるだけだ。

これが、エージェントを全面的にチャットモデル中心で構築するチームに対して、Jevの結果が圧力をかける理由である。繰り返し発生する多くのエージェント処理には、高価で自由形式の応答は不要だと示唆している。特化モデルは準備済みの判断を担い、従来のコードは正確な計算と実行を担える。

またこれは、単一の大規模モデルが一つの連続した会話の中で知覚、記憶、計画、判断、制御をすべて行うべきだという考えにも異議を唱える。Pokémonの攻略では、これらの責任を別々のコンポーネントに分けている。この分離こそが、この実験における最も重要な貢献と見られる。

Jev対チャットボットという比較は誤っている

本当に意味のある対決は、単一構造のAIと、各タスクを最も適したコンポーネントに割り当てる分割型システムの間にある。

チャットボットは自由形式のプロンプトを受け取り、言語を生成する。この柔軟性により、未知の状況を説明し、計画を書き、曖昧な指示を解釈し、会話を通じて復旧できる。一方で、ソフトウェアが必要としているのが一つの選択だけの場合、同じ柔軟性が不要な遅延や信頼性の低い形式を生むことがある。

Jevは新しい戦略文書を書いたり、画面を自由に説明したりはできない。アプリケーションから与えられた質問と選択肢に対して、型付けされた判断を返す。この制約により、コードは出力をより容易に扱える。

Pokémonシステムでは、役割分担が明確だった。エミュレーターが機械可読な状態を生成した。ハーネスはその状態を変換し、経路を計算し、戦闘結果を推定し、合法的な代替案を準備した。Jevは、厳格なルールでは扱いにくい判断を担った。

このアーキテクチャは、チャットボットのデモというより成熟した本番ワークフローに近い。信頼性の高いシステムでは、決定論的な処理と確率的な処理を分離することが多い。コードは算術を計算し、権限を強制し、スキーマを検証すべきだ。モデルは、固定ルールではきれいに解決できない曖昧さを扱うべきだ。

この攻略は、外部化されたメモリの価値も示している。Jevは会話履歴を増やし続ける必要がなかった。ハーネスが判断ごとに最新の状態説明を再構築したからだ。関連する履歴はアプリケーション側で保存し、必要に応じて挿入する必要があった。

この設計は、長いコンテキストが古い計画で雑然とするリスクを抑える。また、どの事実が重要かを開発者に決めさせる。この明確さは信頼性を高めうるが、大きな責任をモデルからシステム設計者へ移す。

汎用チャットボットは、その作業の多くを隠してくれる。開発者はスクリーンショットを渡し、大まかな目標を示し、次に何をするかをモデルに尋ねればよい。インターフェースは単純に感じられる一方で、モデルが知覚、解釈、計画、応答生成を引き受ける。

この見かけ上の単純さには、計算以外のコストもある。何かが失敗したとき、問題が視覚、記憶、推論、ツール選択、不明瞭な指示のどこにあったかを開発者が特定しなければならない。長い自然言語の応答が手がかりを与えることはあっても、正確な診断を保証するわけではない。

型付けされた意思決定パイプラインは、別種の証拠を示す。Jevプロジェクトは、各呼び出しについて完全な状態、選択肢、確率、レイテンシーを記録した。開発者は利用可能な選択肢や、モデルが不確実性を表していたかどうかを確認できた。

このログにより、エージェントの失敗はより具体的なエンジニアリング上の問いへ変わる。十分なコンテキストがあるにもかかわらずモデルが悪い選択をしたのか。ハーネスが必要な選択肢を省いたのか。正しい上位判断が悪いボタン操作列になったのか。答えごとに異なる修正が示唆される。

これは、意思決定モデルが常に勝つことを意味しない。自由形式の環境では、開発者が予測していない出来事が日常的に生じる。選択肢が限定されたモデルは、アプリケーションが一度も提示しなかった行動を選べない。

チャットボットは、未知の状況に対する復旧計画を考案できる場合がある。異例のテキストを解釈し、現在のツールが不十分な理由を説明し、新しい操作手順を提案できる。Jevのより狭いインターフェースでは、その作業を別のコンポーネントに委ねる必要がある。

因此,“Jev 对比 LLM”的框架掩盖了真正取得成功的架构。完成的运行结合了快速决策模型、细致的状态转换器、寻路代码、检查点、循环保护机制,以及在开发阶段使用的前沿模型。

这一技术栈并未排除大语言模型,而是将其中一个置于监督角色。

Claude Opus 5 引导系统走出死胡同

Claude 的参与,使这一结果不再只是一次模型逆袭,而成为双层 AI 架构的证据。

据 Google News 报道的开发者说法,Claude Opus 5 监控日志,并协助调整提供给 Jev 的选项和措辞。据称,当决策模型陷入死胡同时,这项工作变得尤为重要。

这种干预似乎通过开发阶段的改动发生,而不是由 Claude 在每一个游戏回合中直接选择行动。这一区别保留了 Jev 在作出记录决策时所扮演的角色。但它也使“非 LLM 系统在聊天机器人失败之处独立成功”的说法变得更复杂。

模型只能基于它所接收到的世界作出良好选择。假设某个智能体因提示未标明所需物品,而不断朝一条被阻断的路径前进。重新表述可用选项或许有帮助,但更根本的修复是补上缺失的状态信息。

前沿模型很适合审查这类失败。它可以阅读长轨迹、比较重复尝试、推断遗漏了哪项事实,并提出对执行框架的改动建议。这些属于涉及诊断和生成新文本的开放式任务,恰恰不是 Jev 的设计目标。

由此形成的安排类似于快速与缓慢思维之间的分工。Jev 负责频繁且边界明确的判断;当系统表现异常,或遇到设计者未能表示的情境时,Claude 则执行较低频的分析。

这不只是由 Jev 局限所迫的折中方案,也可能是一种实用的生产模式。大多数软件事件都很常规,只有较小一部分需要更深入的解释。将每个事件都交由最强大的模型处理,可能浪费资源并增加延迟。

监督模型可以改为分析不确定案例、审查成批失败,或重写决策策略。之后,它的改进可让快速组件执行的数千次后续调用受益。

不过,在研究人员能够将这次运行视作一项干净的比较之前,辅导过程仍需要更严格的文档记录。公开摘要没有提供使用最终执行框架的受控 Jev-only 基线,也没有量化 Claude 改变系统的频率,或每次改动带来了多少进展。

该代码库的历史包含数百次提交,原则上可检视其演进过程。然而,开发提交序列并不等同于实验协议。恰当的比较应冻结环境、定义干预规则,并以受控随机种子进行多次试验。

还存在另一层模糊性。每个智能体基准测试都包含支撑结构,但这些支撑结构可能蕴含大量任务知识。Jev 的执行框架了解剧情里程碑和地点、计算路径、估计伤害,并准备合法行动。

若聊天机器人运行时只接收截图和宽泛的按钮工具,它面对的将是另一类问题。它必须在模型内部完成更多感知和规划工作。若不匹配这些接口,就比较完成时间,可能会把执行框架提供的优势错误归功于模型。

合理的解读既不是否定,也不是凯旋。Jev 在一个最终完成游戏的系统中作出了数千项具有实质影响的选择。Claude 协助工程师改进了该系统。二者共同实现了比多项知名聊天机器人演示更快的结果,但它们并未进行同一项测试。

这一结果并不能证明什么

一次成功通关,无法证明决策模型总体上比 LLM 智能体更聪明、更自主或更可靠。

最大的未知数是可复现性。公开结果描述的是:围绕系统持续开发之后的一次成功运行。Pokémon 包含随机遭遇战、不确定的战斗结果,以及许多可能的队伍配置。

第二次运行可能采取不同路线,或在另一处地点停滞。重复实验才能揭示该系统是能够稳定完成游戏,还是从有利的运行轨迹中获益。

该设置也缺少匹配的竞争者。若要公平比较 Jev 与 Claude,两种模型都需要拥有相同的状态表示、选项、确定性导航、恢复规则和检查点。否则,这项基准衡量的是模型与软件的两种不同组合。

一项有用的实验会运行三种配置。一种使用冻结执行框架的 Jev;另一种在保留其余所有组件的前提下,以通用模型替换 Jev;第三种则采用由监督模型审查选定失败案例的混合系统。

研究人员随后可在重复试验中比较完成率、决策数、干预次数、实际耗时及恢复行为。这些测量将显示专用模型在哪些环节有帮助,以及前沿模型在哪些地方仍不可或缺。

开发者使用内存检查也限制了更广泛的结论。读取结构化游戏状态消除了视觉感知问题。作为决策测试,这种选择是合理的;但它不能证明 Jev 能够直接在复杂的视觉环境中运作。

现实应用很少提供完美的合法选项清单。支持路由器可能会收到不属于任何已知类别的新问题。浏览器智能体可能遇到重新设计的页面。实体机器人可能观察到其规划器从未表示过的物体。

有边界的模型需要为这些情况提供安全的退出路径。置信度阈值可将不确定的决策交给人工或通用模型。应用还需要一种方式,用于检测正确选项是否完全缺失。

仅凭概率无法解决这一问题。一个模型可能会在错误备选项之间表现出很高置信度,因为所有可用选项都是错误的。开发者必须验证行动集合,并监测下游结果。

Jev 的循环保护机制展示了此类安全措施的必要性。执行框架会标记无效选择,在反复失败后抽样替代方案,并在最后手段下恢复检查点。这些机制避免了一次错误判断将系统永久困住。

这也意味着,通关并非纯粹源自每一步都选择正确。系统能够容忍错误并从中恢复。生产级 AI 同样需要这种能力,尽管业务流程通常没有可以逆转损失的便利检查点。

一次错误的游戏行动可能损失几分钟;错误删除、付款或客户回复则可能造成长期后果。考虑采用 Jev 风格架构的开发者,必须明确哪些决策可逆,哪些决策需要审批。

该实验对安全性也几乎没有说明。一个消费外部来源文本的模型,可能遇到操纵性指令或误导性上下文。将输出限制为类型化选择缩小了行动面,但并不能保证正确理解。

最后,Pokémon Red 是一个已知且稳定的环境。其地图、战斗机制、菜单和剧情结构不会在运行期间变化。这种稳定性使工程师能够构建异常细致的状态转换器。

许多企业环境则持续变化。文档会以新格式到达,政策不断演进,工具返回的数据也可能不完整。环境越不稳定,执行框架所需的维护就越多。

因此,这次运行支持的是一种设计假设,而非普遍排名。当行动有边界、上下文可被结构化、且确定性软件能够执行结果时,专用决策模型展现出前景。当系统必须解释新事物、生成计划或修复自身表示时,通用模型仍然很有价值。

三个信号将表明 Jev 的结果是否重要

接下来的考验是:这一架构能否经受重复、匹配比较,以及未围绕它精心准备的环境。

首先,应关注使用冻结版执行框架进行的可复现 Pokémon 通关。多次无人值守完成将强化这样的主张:该系统代表了一个可靠的决策循环。公开失败同样有价值,因为它们会揭示状态表示的哪些部分仍然脆弱。

最有价值的发布应包括完整轨迹、固定模型版本、干预日志,以及清晰的完成定义。它还应将自动恢复与两次运行之间人工进行的改动区分开来。若没有这种区分,开发者无法判断改进来自模型,还是来自持续的工程工作。

其次,应寻找匹配的 Jev 对比 LLM 测试。两个系统应接收完全相同的状态、选择、导航代码和检查点规则。这将把当前的架构差异转化为可测量的模型比较。

匹配测试可能表明,LLM 的表现相近但响应较慢;也可能显示 Jev 擅长常规选择,却在罕见情况中落后。它还可能揭示,细致的执行框架已从任一模型身上移除了大部分智能负担。

第三,应关注游戏之外、结果具有客观标签的应用。工单路由、审核队列、文档分类、工具选择和警报优先级排序都是合理候选。这些工作流会产生重复决策,团队可根据后续结果进行审计。

最有力的证据不会是一场引人注目的演示,而是面对变化输入时仍保持稳定准确性、具备清晰校准、较低异常率,并能在预设选项均不适用时安全升级处理。

对开发者而言,眼下的教训很实际。不要仅仅因为聊天界面让这种安排看起来方便,就要求单一模型承担每一种认知功能。应分离感知、状态、判断、执行、记忆与恢复,并评估每一处边界。

团队也可将相同理念应用于自己的 AI 工作流,保留每项决策背后的源材料。可搜索的工程知识库能帮助审阅者将模型行为与规范、日志及过往修复关联起来。

Jev Pokémon Red 实验之所以重要,是因为它让这种架构变得可见。一个专注模型处理了数千项选择,常规软件执行了精确操作,而据报道,当系统表示失效时,Claude 协助重新设计了系统。

这并不是对 LLM 的明确胜利,而是支持更少、更有意识地使用它们。

接下来的问题是,开发者能否无需数月的任务专用调优,就复现这种劳动分工。如果独立团队能够冻结执行框架、重复运行,并将这种模式带入真实工作流,Jev 所展示的将不只是完成 Pokémon Red 的一种特殊方式。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page