top of page

GPT-6 Astraのランニングルートは機能したが、コードは消えた

9月14日
読了時間: 18分

GPT-6 AstraはSimon Willisonの自宅を起点に、27分かけてランニングルートを生成し、彼の要望に合う地図とダウンロード可能なファイルを提供した。この成功が、欠けていた証拠をいっそう際立たせた。ChatGPT Workは完成したルートを表示したものの、その裏で使われたPythonコードや完全な実行履歴は示さなかった。

Willisonは、自宅住所を出発点・終点とする5Kおよび10Kの周回ルートを依頼していた。彼はChatGPT WorkにOpenStreetMapのデータを使うよう指示した。彼のランニングルートに関する記録によると、エージェントは埋め込み型の可視化、GPXダウンロード、GeoJSONファイルを返したという。

このタスクは、エージェント型AIが従来のオフィス業務以外でも実用的になりつつあることを、非常に具体的に示す例だ。一つの会話の中で、ジオコーディング、地図データの取得、グラフ分析、ルート選定、ファイル生成、可視化を結び付けた。

しかしこの結果は、AIエージェントの中心にある対立も露呈させた。システムは難しいタスクを完了できる一方で、ユーザーがどのように答えに至ったのかを再構築できない場合がある。

この対立は、ルートそのものより重要だ。OpenAIはGPT-6 Astraを、ユーザーが個別の回答を求めるのではなく、複雑な目標を委任する長時間のコンピューター作業向けモデルとして提示している。こうした委任は、実行記録、中間ファイル、再現可能なコードの価値を高める。

したがって、GPT-6 Astraによるランニングルートの事例は二つの約束を同時に試している。Astraは専門的な地理空間ワークフローを完了できるように見える。一方でChatGPT Workは、その後にワークフローを検証するために必要な証拠を保存する準備が十分ではないように見える。

GPT-6 Astraのランニングルートは複数のツールを一つの成果物に結び付けた

重要な変化は、AIがジョギングコースを提案したことではなく、短い依頼から実用的な地理空間成果物を組み立てたことにある。

Willisonはシステムに、自宅住所を特定し、OpenStreetMapデータを用いて二つの周回ルートを計算するよう依頼した。周回ルートは、同じ場所で始まり同じ場所で終わりつつ、目標距離に合理的に近い必要があった。

これは、二つの固定地点間の経路を地図サービスに尋ねるより難しい。エージェントはまず、地理的な出発座標を得る必要があった。次に、ランナーが利用できそうな道路やトレイルの地域ネットワークを取得する必要があった。

ChatGPTは後にWillisonに対し、住所の特定にNominatimを使ったと説明した。Nominatimはジオコーダーであり、記述された地名や住所を地理座標へ変換する。

システムは、近隣のOpenStreetMap上の道路とトレイルをダウンロードするためにOverpassを使ったと述べた。Overpass APIは、地理的フィーチャーとその説明用タグを含むOpenStreetMapデータに対し、構造化クエリを提供する。

残りの作業は、報告によればローカルで行われた。エージェントは地図要素を接続されたネットワークへ変換し、候補となる周回ルートを見つけ、距離を推定し、5キロメートルおよび10キロメートルに近いルートを選ぶ必要があった。

Willisonは実装を受け取っていないため、これらの具体的なアルゴリズム上の手順は、情報に基づく再構成にとどまる。エージェントの短い説明では、グラフライブラリ、探索手法、ルートのスコアリング規則、フィルタリングロジックは特定されなかった。

可視の出力はより具体的だった。ChatGPT Workは5.1キロメートルの港湾周回ルートを生成し、会話内に表示した。また、ルート形状を交換する際に一般的な二つの形式であるGPXとGeoJSONのファイルも提供した。

GPXは、多くのフィットネス機器や地図アプリケーションが対応するXMLベースの形式だ。GeoJSONはJSONを使って地理的フィーチャーを表現するため、Web地図やソフトウェアパイプラインに便利である。

埋め込み地図も、それ自体が生成された成果物だった。Willisonは、ChatGPTがルート形状と、D3で可視化を描画するJavaScriptを含むHTMLファイルを作成していたことを発見した。

HTMLは、アプリケーションデータ要素の内部に形状データを格納していた。つまり、表示されたルートは単なる静的なスクリーンショットではなかった。ソフトウェアが読み取り、再描画できる座標を含んでいた。

この組み合わせが重要なのは、回答と完成済み成果物の境界をまたいでいるからだ。道路名の一覧だけでは、ランナーが利用できるようになるまで依然として相当な作業を要する。

生成されたファイルは、他の場所へインポートし、検査し、対応デバイスに転送できる。地図は、別のアプリケーションを必要とせず、ユーザーに即座の視覚的確認を提供した。

OpenAIはChatGPT Workを、より長く複数ステップにわたるタスクと完成した成果物のためのエージェントとして説明している。現在のWorkドキュメントでは、この体験を通常の会話型支援と区別している。

このルートタスクは、その定義に密接に当てはまる。自然言語による目標から始まり、外部データを使い、ローカル計算を実行し、複数の連携した出力を返した。

ただし、その水準で成功すると、ユーザーがインターフェースに求めるものも変わる。エージェントが意味のある計算を行うようになると、そのプロセスは使い捨てのバックグラウンド活動ではなく、製品の一部になる。

この小さな地図タスクが重要な理由

このルートは、AIエージェントが専門的なワークフローを日常的な依頼へ変えられることを、簡潔に実証している。

このようなルートを手作業で作るには、通常はいくつものツールが必要になる。ユーザーは住所をジオコーディングし、地図データをダウンロードし、ルーティングソフトウェアを設定し、候補経路を確認し、選択した形状をエクスポートすることになるだろう。

各段階には異なる種類の知識が必要だ。ジオコーディングには地点検索サービスへの理解が求められる。OpenStreetMapの抽出には、クエリ構文または適切なインターフェースが必要となる。

ルート計算では、ノード、エッジ、経路重み、接続性といったグラフの概念が導入される。ファイルのエクスポートには、フィットネスおよび地図アプリケーションで受け入れられる形式の知識が必要だ。

ChatGPT Workは、Willisonに各技術的選択を監督させることなく、これらの要素を調整したように見える。このインターフェースにより、彼は完全な実装を指定するのではなく、結果を説明できた。

これが汎用エージェントの中心的な価値提案である。あらかじめ定められたワークフローにユーザーを限定するのではなく、目標に応じてツールを選び、組み合わせることができる。

タイミングも重要だ。OpenAIはAstraを、コーディング、ブラウジング、コンピューター操作、複雑な専門業務を重視して導入した。Astraの発表ページでは、ファイル、プロット、Webサイト、その他の完成した成果物を生成できるモデルとして紹介している。

OpenAIによれば、Astraは同社が引用するOSWorld 2.0構成で72.6パーセントを記録した。GPT-5.6 Solは、同じ報告上の設定で65.7パーセントだった。

同社はまた、Astraがこれらのシミュレーションされたコンピュータータスクを約40分で完了したのに対し、GPT-5.6 Solは約75分だったとしている。これらは引き続き同社報告によるベンチマーク結果であり、Willisonのルートに対する独立した検証ではない。

それでも、27分間のランニングタスクは、こうしたより広範な主張に分かりやすい形を与える。モデルは、単に使い慣れたWebサイトを操作したり、標準フォームの項目を埋めたりしただけではない。

オープンな地理情報インフラを軸に、ワークフローを即興で組み立てたように見える。サービスを選び、データをダウンロードし、計算を実行し、持ち運び可能なファイルを作り、独自の表示レイヤーを構築した。

この柔軟性は、二つのソフトウェア領域に圧力をかける。一つ目は、固定的なルート計画インターフェースを中心に構築された専門的な消費者向けツールだ。

汎用エージェントは、こうした製品を完全に置き換える必要はない。代わりに、硬直的なインターフェースでは表現しにくい特殊な要望を扱える。

ランナーは、正確な目標距離に近い周回ルート、特定の道路の回避、トレイルの優先、給水所の通過、日没前のゴールなどを依頼できる。自然言語なら、こうした制約を簡単に組み合わせられる。

圧力を受ける二つ目の領域は、従来型のチャットボットそのものだ。ユーザーがエージェントによるこうした作業の完了を見ると、テキストだけの回答は不十分に感じ始める。

ユーザーは、生成ファイル、インタラクティブなビュー、編集可能な計算、実行された手順の記録を期待する。成果物が、会話を評価する基準になる。

OpenAIの9月のリリースノートは、Astraを複数ステップの作業における改善として説明している。また、ChatGPT Workは許可を得てローカルファイルと対応Webサイトのツールを利用できるとしている。

このルートの例は、こうした機能がオフィス文書を超えて利用され得ることを示している。これまでカスタムソフトウェアを必要とした技術要件を含む個人プロジェクトを支援できる。

これは、出力が自動的に信頼できることを意味しない。エージェントが今や、すぐに使えるほど完成して見える成果物を生み出せるため、検証はより重要になる。

主な対立は能力と監査可能性の間にある

ChatGPT Workは依頼された仕事を完了したが、ユーザーが結果を再現するための十分に可視化された証拠を保存していなかった。

Willisonは成果物を受け取った後、そのルートがどのように作られたかを尋ねた。ChatGPTは、Nominatim、Overpass、ローカル計算を含む高レベルの説明を提供した。

その説明は大まかなアーキテクチャーを示した。しかし、どのサービスエンドポイントに接続したのか、どのクエリを送信したのか、どの地図タグをランニング可能と見なしたのかは明らかにしなかった。

候補となる周回ルートをどのように生成したかも明らかにされなかった。ルーティングスクリプトでは、最短経路探索、経由地サンプリング、サイクル検出、最適化、あるいは複数の手法を組み合わせる可能性がある。

こうした選択は最終ルートに影響する。舗装道路、海岸沿いのトレイル、横断箇所、急な区間、アクセス情報が不完全な経路のどれを優先するかを左右し得る。

Willisonはその後、Pythonコードを求めた。ChatGPTは、会話が圧縮処理を受けたためか、もはや提供できなかった。

圧縮処理は、長時間稼働するエージェントが利用可能なコンテキストウィンドウ内で継続できるよう、以前のコンテキストを要約する。システムの稼働継続には役立つが、詳細がアクティブなコンテキストから失われることがある。

Willisonは、圧縮処理を使うシステムは元の資料を保存すべきだと主張した。また、後の依頼で必要になった際に、エージェントがツールを通じてその資料を取得できるようにすべきだとも考えている。

彼の批判は、モデル知能の問題ではなくインターフェースの問題を指摘している。システムは健全なコードを生成していたかもしれないが、それでも十分な記録を提供できなかった。

この区別は不可欠だ。モデル能力は、エージェントがタスクを完了できるかどうかを問う。監査可能性は、人がその完了を理解、検証、再現、あるいは異議申し立てできるかどうかを問う。

気軽なアイデア出しであれば、プロセスの簡潔な要約で十分かもしれない。しかし、生成されたルート、金融計算、研究データセット、ビジネスファイルでは、そうではないことが多い。

有用な監査証跡は、非公開の思考過程をさらすことを必要としない。タスクに属する運用上の証拠で構成できる。

その証拠には、生成されたスクリプト、ターミナルコマンド、データソースのURL、タイムスタンプ、ツール応答、警告、中間ファイル、関連ライブラリのバージョンなどを含められる。

こうした記録は、隠された内部推論とは異なる。ソフトウェアがどのように作られたかをビルドログが記録するように、観測可能な行動と変換を文書化する。

ルートのHTMLは最終成果物の一部だったため残った。Python実装は、検証にはむしろ重要だったにもかかわらず、残らなかった。

この非対称性は、ユーザーに来歴よりも見た目を信頼させる方向に働く。洗練された地図は権威的に見える一方で、安全性と正確性に実質的な影響を与える前提を隠している可能性がある。

問題は、エージェントが27分間にわたって作業する場合、さらに深刻になる。長いタスクでは、より多くの状態、ツール呼び出し、中間判断、そして見えないまま失敗する機会が増えうる。

ユーザーが後でどの成果物を必要とするかを予測する必要はない。コンテキスト圧縮によって重要な詳細が失われる前に、システムは構造化されたタスクパッケージを保存すべきだ。

優れたパッケージは、各出力をその起点に結び付ける。GPXファイルは、それを生成した正確なスクリプト、ソースデータ、パラメータ、実行履歴と関連付けられるべきである。

これは、追跡可能な入力と出力を備えたAI workflowを維持することに似ている。対象は異なるが、記録管理の原則は変わらない。

したがって、この物語における根本的な対立は、能力と監査可能性の間にある。Astraは印象的な成果を出した一方で、その周辺のプロダクトは成果を完全に検証可能なものにできなかった。

OpenStreetMapが提起するポリシーと安全性の問題

ルートは技術的に有効であっても、そのデータソースを規律するポリシーに照らして不適切、安全でない、あるいは整合性を欠く可能性がある。

生成された結果は、地域によってカバレッジやタグ付けが異なる協働型地理データベース、OpenStreetMapに依存していた。そのオープン性は特殊なワークフローを可能にするが、不確実性をなくすものではない。

道路やトレイルはデータベースに存在していても、すべてのランナーに適しているとは限らない。通行制限、一時閉鎖、路面状況、照明、横断箇所、工事、地域固有の危険は、欠落していたり古くなっていたりする可能性がある。

グラフ計算によって、画面上では妥当に見える接続済みの周回コースが生成されても、実地では使い勝手が悪いことがある。接続性だけでは、快適性や安全性は保証されない。

ソースコードが欠けているため、外部の人はエージェントがこれらの要因をどう扱ったか確認できない。どの道路種別が許可されたのか、あるいは私有地へのアクセスを示すタグが除外されたのかも不明である。

エージェントが歩道、歩行者規制、未舗装路面、階段、フェリー接続、またはアクセスが限定されたトレイル区間を認識していたかも明らかではない。

Willisonは、システムが依頼どおりのものを生成したと報告している。これはタスク完了に関する有用な一次情報だが、ルート品質を包括的に検証するものではない。

この例に含まれるのは、1人のユーザー、1つの地域、そして依頼された2つの距離だけである。記事では、実地テスト、標高分析、アクセシビリティ評価、独立した比較について報告されていない。

正確な自宅住所は機微な情報であるため、ジオコーディングのステップも別の懸念を生む。ユーザーはエージェントがその住所をどこへ送るのか、どのログに残りうるのかを理解すべきである。

OpenAIによれば、Workは選択された環境の権限に従って、ファイル、ブラウジング、タスクコンテキストを利用できる。管理対象アカウントには、組織の保持およびガバナンス設定が適用される場合もある。

引用されたルートの事例だけでは、エージェントがどのNominatimデプロイメントに接続したかは確定しない。したがって、そのリクエストに適用されたログ、制限、保持方針を確認することはできない。

エージェントがOpenStreetMap Foundationの公開サービスを使った場合、Nominatim policyが重要になる。このポリシーは大量利用を制限し、識別可能なリクエストと適切な帰属表示を求めている。

このポリシーは、自動生成された汎用ジオコーディングサービスにも制限を設けている。個人的な1回の検索と、大衆向けルーティング製品の展開は異なるが、エージェントはその違いを区別しなければならない。

Overpassにも同様の運用上の考慮事項がある。Overpass guidanceによると、その公開サーバーは小規模プロジェクトを支援する一方、過負荷になる可能性がある。

このガイダンスは、継続的または商用の利用者に対し、リクエストのキャッシュ、消費量の削減、抽出データの利用、または適切なインフラの運用を推奨している。公開エンドポイントは共有リソースであり、無制限のエージェント向けバックエンドではない。

監査可能な実行記録があれば、こうした疑問の解消に役立つ。正確なエンドポイント、リクエストヘッダー、クエリ数、帰属表示、レスポンスサイズを示せるだろう。

その記録がなければ、ユーザーはエージェントが関連するサービスのポリシーを守ったか確認できない。完成したファイルだけでは、データがどのように取得されたかをほとんど示せない。

安全性のためには、ルートを検証済みの指示ではなく、提案として提示する必要もある。ランナーは、自動生成された周回コースに頼る前に、未知の区間を確認し、その時点の地域状況を考慮すべきである。

システムはルートの前提を平易な言葉で明示すべきだ。たとえば、私道を除外したこと、歩行者向け経路を優先したこと、未舗装トレイルを許容したこと、最新の閉鎖情報を持たないことを示せる。

こうした開示は装飾的な免責事項ではない。ユーザーが出力が自身のニーズに合うか、追加の確認が必要かを判断する助けになる。

ルート生成エージェントには、不確実性を報告する手段も必要である。地図タグが矛盾している場合や、トレイルのアクセス状況が不明確な場合、その曖昧さは最終成果物にも残されるべきだ。

Astraの成果は、オープンな地図データが高度な個人向けタスクを支援できることを示している。欠けている実行履歴は、オープンデータへのアクセスが透明な実行の代わりにならない理由を示している。

透明なエージェント作業が保存すべきもの

ChatGPT Workの次の試金石は、成功したタスクを使い捨ての会話ではなく、再現可能なプロジェクト記録にできるかどうかだ。

最も直接的な指標は、生成されたコードとコマンドへの永続的なアクセスになるだろう。ユーザーは完了したタスクを開き直し、実行中に作成されたすべての成果物を取得できるべきである。

これは、デフォルトで常時ターミナル出力を表示することを意味しない。簡潔なインターフェースでまず結果を示しつつ、確認用の操作の背後に完全なアクティビティ記録を保持できる。

第2の指標は、各成果物に付与される来歴情報である。ファイルは、その作成に関係した入力、ツール、変換、警告を識別できるべきだ。

GPT-6 Astraのランニングルート作成タスクでは、来歴情報によってGPXファイルとGeoJSONファイルが同一のルート計算に結び付けられる。また、関連するOSMクエリと生成されたPythonスクリプトも保存される。

第3の指標は、コンテキスト圧縮のより良い処理になる。圧縮された会話でも、モデルがすべての詳細をアクティブに保持しなくなった場合に、復元可能なアーカイブを残すべきである。

ユーザーが以前何が起きたかを尋ねた際、エージェントはそのアーカイブを検索できる。これにより、効率的なアクティブコンテキストと永続的なタスク履歴を分離できる。

これらの変更は、非公開のモデル推論を公開せずにOpenAIの透明性に関する主張を強化する。OpenAIは、Astraが委任された作業におけるアラインメント、タスク境界、より明確な挙動を重視すると述べている。

運用記録があれば、これらの主張はプロダクトレベルで検証可能になる。ユーザーは、エージェントの要約だけに頼るのではなく、エージェントがスコープ内に留まっていたか確認できる。

汎用エージェントを開発する競合各社も、同じ課題に直面している。ユーザーが事業上重要な出力を検証できなければ、タスク完了の高速化やベンチマークスコアの向上の重要性は下がる。

開発者はすでに、再現可能な環境、バージョン履歴、ログを期待している。エージェントが分析、プレゼンテーション、データセット、運用上の変更を作り始めるにつれ、ナレッジワーカーも同様の期待を持つようになるだろう。

インターフェースは、完全なタスクバンドルをエクスポートできるようにすべきである。そのバンドルには、プロンプト、承認済みの権限、スクリプト、ログ、ソース参照、成果物、簡潔な実行要約を含められる。

共有可能なバンドルはコラボレーションを改善する。同僚は、会話全体を再構成したりスクリーンショットを信頼したりせずに、手法をレビューできる。

また、修正にも役立つ。ルートに不適切なトレイルが含まれていた場合、ユーザーは原因となったルールを特定し、修正した制約でワークフローを再実行できる。

永続的な記録は、エージェント作業を蓄積可能なものにする。成功した5Kルートは、丘、路面、照明、季節的な閉鎖に関する後続の依頼の出発点になりうる。

こうした記録がなければ、すべてのフォローアップが新たな推論になるリスクがある。エージェントは、元のタスクの継続として提示しながら、異なる手法を生成するかもしれない。

根底にある成果を過小評価すべきではない。短い自然言語の指示によって、27分で2つの周回距離、インタラクティブな地図、携帯可能な地理空間ファイルが生成された。

これは、特定の個人的目標に向けてツールを連携させる汎用エージェントの信頼できる例である。流暢な回答よりも、完成した成果物のほうが重要になりうる理由を示している。

この事例は、出力品質だけが成功指標になりえないことも示している。エージェントのプロセスが作業の信頼性、安全性、合法性に影響する場合、ユーザーには永続的な証拠が必要である。

したがって、将来のGPT-6 Astraによるランニングルート作成は、2つの結果で評価されるべきだ。ルートは依頼を満たしたか。そしてユーザーは、それがどのように生成されたかを正確に再構成できるか。

OpenAIが永続的な実行履歴、成果物の来歴情報、圧縮前記録の復元機能を追加すれば、この例は初期のプロダクト上の欠落として見えるだろう。追加しなければ、エージェントがより高いリスクを伴うタスクを担うにつれて、見えない作業はより大きな負債になる。

実践的な対応は、タスクがまだアクティブなうちに証拠を求めることだ。最終成果物とともに、スクリプト、ソースエンドポイント、前提条件、中間ファイル、検証メモを依頼する。

その習慣がいつまでも必要であるべきではない。成熟したエージェントインターフェースは、こうした資料を自動的に保存し、ユーザーがいつ確認するかを決められるようにすべきである。

ルートは機能した。次の到達点は、その背後にある作業をGPXファイルそのものと同じくらい持ち運びやすく、レビュー可能で、永続的なものにすることだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page