AlibabaのQwen3.7-Max、35時間にわたる自律コーディングを完遂
Alibabaは、35時間に及ぶ自律コーディングテストを経てQwen3.7-Maxを発表した。このテストは、Google Newsで取り上げられる通常のニュースを、ソフトウェアチームへの直接的な問いへと変えた。報道によると、このモデルは人間の介入なしに1,158回のツール呼び出しを実行し、432種類のカーネルをテストした。Alibabaによれば、完成したコードは参照実装の10倍の速度で動作したという。
この見出しは、AIがエンジニアリングの仕事を奪おうとしているという、また一つの警告のようにも聞こえる。しかし、より有用な解釈はむしろ逆方向にある。Qwen3.7-Maxは、短いプロンプトから使い捨てのアプリを作ったわけではない。高度に専門化されたコードを、何時間もかけて測定、デバッグ、改訂、検証した。
この違いは、Anthropic、DeepSeek、Moonshot AI、Zhipu AI、そして企業向けソフトウェアチームに圧力をかける。競争は、コーディングに関する質問へ正しく答えられるかという段階を越えつつある。今や問われるのは、長期にわたり失敗が起こりやすいワークフローの中で、どのモデルが生産性を維持できるかだ。
Alibabaは印象的な証拠を示したが、結論を確定させたわけではない。性能値の多くは同社、あるいはQwenチームが作成したベンチマークに基づく。購入者が信頼できる運用上の保証として扱う前に、独立したチームが結果を再現する必要がある。
AlibabaのQwen3.7-Maxが実際に変えたこと
重要な変化はQwen3.7-Maxがコードを書けることではなく、測定可能なエンジニアリングのループを35時間にわたり維持したと報告されている点にある。
Alibabaは2026年5月20日、杭州で開催したクラウドサミットでQwen3.7-Maxを発表した。このプロプライエタリモデルは、ソフトウェアが行動を選び、ツールを呼び出し、結果を観察し、アプローチを修正するエージェント型ワークロードを対象としている。
この焦点は、一般的なチャットボットのパターンとは異なる。チャットボットは多くの場合、一つのプロンプトを受け取り、一つの応答を返す。エージェントは、エラー、不完全な情報、変化する状態、繰り返されるツール利用を乗り越えながら、目的を維持しなければならない。
Alibabaは、この能力をSGLang向けのattentionカーネルでテストした。SGLangは、言語モデルの提供に使われるオープンソースシステムだ。カーネルとは、ハードウェア上で特定の計算を実行する低レベルプログラムを指す。小さな改善でも、その処理を利用するすべてのモデルリクエストの速度とコストに影響し得る。
対象ハードウェアは、AlibabaのT-Head Zhenwu M890アクセラレータを搭載したクラウドインスタンスだった。同社によると、Qwen3.7-Maxは学習時にこのチップアーキテクチャに触れていなかった。ハードウェア文書、測定履歴、最適化済みのサンプル実装は一切与えられなかった。
モデルは、高性能GPUカーネルを開発するためのプログラミング言語Tritonで書かれた参照バージョンから始めた。その後、代替案をコンパイルし、性能を測定し、失敗を特定して、コードを修正した。
35時間の実験では、432件のカーネルテストと1,158回のツール呼び出しが行われた。Alibabaによると、最終実装は開始時の参照実装に対して平均10倍の高速化を実現した。
こうした詳細は、単一のベンチマークスコアよりも重要だ。モデルは、一つの目的を長い一連の行動へ結び付ける必要があった。また、コンパイルや性能の結果がそれまでの選択と矛盾した際にも、立て直さなければならなかった。
このタスクには依然として有利な境界条件があった。Alibabaはモデル、チップ、クラウド環境、そして評価プロセスの大部分を保有している。モデルがその特定アーキテクチャで学習していなかったとしても、同社はよく理解するインフラを中心にセットアップを設計できた。
それでも、この実行は、モデルに孤立した関数を完成させるよう求めるよりも厳しいテストだ。記憶した答えではなく、反復実験に進捗が左右されるエンジニアの最適化ワークフローに近い。
Alibabaは、このエージェント重視をより広範な商業戦略にもつなげている。同社のクラウド発表では、Qwen3.7-Maxをコーディングやオフィス業務にまたがる、持続的かつ複数ステップの操作向けに構築したモデルとして説明している。
このモデルは、OpenAIおよびAnthropicのツールと互換性のあるインターフェースをサポートする。Alibabaによると、開発者はClaude Code、OpenClaw、Qwen Code、Hermes Agent、Qoderを含むエージェント環境に接続できる。
この互換性により、単一のチャットアプリケーションの重要性は低下する。企業は、ツール、権限、コンテキスト、実行を管理する周辺ソフトウェアである既存のエージェントハーネス内で、基盤モデルをテストできる。
これが、この話題が専門メディアを越えてGoogle Newsにまで広がった理由だ。Alibabaは単に、より優れたアシスタントを主張しているのではない。検証済みの成果が得られるまで、エンジニアリングプロセスにとどまり続けられる作業者としてモデルを提示している。
35時間の実行がコーディングエージェントに圧力をかける理由
Qwen3.7-Maxは、もっともらしいコードを生成することから、数百の意思決定にわたって有用な勢いを維持することへと、競争上の基準を引き上げる。
コーディングモデルは、定義されたソフトウェア上の問題を解決できるかを測るテストで急速に向上してきた。これらの評価は依然として有用だが、エンジニアリング業務を明確な終着点のある整然としたタスクへ圧縮している。
実運用の仕事はそれほど整然としていない。リポジトリには文書化されていない依存関係、相反する要件、不安定なテスト、影響がかなり後になって現れる判断が存在する。モデルは印象的なパッチを書けても、元の問題以上の後始末を人間に残すことがある。
Alibabaの実験は、この弱点の一部に取り組む。その中核的な主張は、フィードバック下での持久力に関するものだ。Qwen3.7-Maxは、測定ループによって失敗した試行を修正できたため、すべての行動を成功させる必要はなかった。
このパターンは、オートコンプリートよりも科学的方法に近い。モデルは変更を提案し、実験を実行し、結果を確認して、次の候補を生成した。価値は、とりわけ巧妙な一つの応答ではなく、ループ全体から生まれた。
Alibabaは、同じカーネルタスクにおいてQwen3.7-Maxと複数の競合モデルとの間に大きな差があったと報告している。同社によると、GLM-5.1は7.3倍の高速化、Kimi K2.6は5倍、DeepSeek V4 Proは3.3倍に到達した。Qwen3.6-Plusは1.1倍にとどまったとされる。
こうした比較は暫定的なものとして扱うべきだ。Alibabaはタスクを選定し、エージェントを設定し、結果を報告した。プロンプト、ツール上限、停止ルール、計算資源の配分を変えれば、エージェント評価に大きく影響し得る。
Anthropicは依然として重要な参照点を提供している。KernelBench L3で、AlibabaはQwen3.7-Maxが96%のケースで高速化されたカーネルの生成に成功したと主張する。プロバイダーによる比較では、Claude Opus 4.6は98%に達したとされる。
より広いベンチマーク像は、一方的というよりも拮抗している。Qwen3.7-MaxはSWE-bench Verifiedで80.4を記録したとされ、Claude Opus 4.6 Maxの80.8、DeepSeek V4 Pro Maxの80.6と比較されている。
Alibabaはまた、比較でClaudeが優位に立った領域も認めている。そこにはNL2Repo、ClawEval、CoWorkBenchが含まれる。このことは競争を劇的ではなくする一方、特定のワークフローを中心にモデルを選ぶ購入者にとっては、より関連性の高いものにする。
したがって圧力は、幅広いエージェント能力を主張するすべてのモデル提供者に及ぶ。顧客は今後、エージェントがどれほど長く有効でいられるか、どの程度の頻度で救援を必要とするか、その成果物が独立したレビューに耐えられるかを問うようになる。
短いベンチマークでの高スコアでは、こうした疑問に答えられない。洗練されたデモでも同様だ。企業には、失敗、復旧率、介入時間、最終成果物の品質を含む、反復実行にわたる分布が必要だ。
この新たな基準は、エージェントプラットフォームの開発者にも圧力をかける。モデルは動作するシステムの一要素に過ぎない。ツール設計、コンテキスト管理、可観測性、権限境界、バリデータが、長期的な自律性が進捗を生むのか、長期的な損害を生むのかを決める。
Alibabaの学習手法は、このシステムレベルの見方を反映している。Qwenチームは各演習を、タスク、ツール環境、バリデータに分けている。研究者はこれらの要素を再結合し、特定の慣れたセットアップでしか機能しない戦略を抑制できる。
バリデータは、結果が意図した目的を満たすかを確認する。自信に満ちたモデルが誤った指標を何時間も最適化しかねないため、この機能は長時間の実行で不可欠になる。
Alibabaによると、Qwen3.7-Maxは前モデルよりもOpenClaw、Claude Code、Hermesにわたって一貫した結果を維持した。独立テストがこの結果を確認すれば、組織がエージェントフレームワークを切り替える際に必要な作業を減らせるだろう。
エンジニアリング責任者にとって、一貫性はリーダーボード首位より重要になり得る。ツールをまたいで予測可能に振る舞うやや弱いモデルの方が、ハーネスごとに性能が変わる最高得点モデルよりも管理しやすい可能性がある。
これがGoogle Newsの見出しの下にある競争上のメッセージだ。Alibabaは購入者に対し、モデルをブラウザタブ内で待機する孤立した生成器ではなく、システムに組み込まれた持続的なオペレーターとして評価するよう求めている。
Qwenが担う仕事は反復的な実験ループである
もっとも信頼できる短期的な代替は反復的なエンジニアリング作業に関するものであり、目的、制約、結果への責任は人間に残る。
「仕事を奪う」という表現は、多くの異なる活動を一つの劇的な予測にまとめている。ソフトウェアエンジニアリングには、製品探索、アーキテクチャ、実装、テスト、セキュリティレビュー、インシデント対応、交渉、保守が含まれる。
Qwen3.7-Maxは、それらすべてを実行したわけではない。計測機能を備えた環境で、狭い最適化目標に取り組んだ。そのもっとも強い成果は、人間よりも速く長く実行できる反復ループを繰り返すことで得られた。
カーネル最適化は良い例だ。エンジニアは多くの場合、多数の実装選択肢を試し、ベンチマークを実行し、ボトルネックを調べ、試行の大半を捨てなければならない。この作業には専門性が必要だが、その経過時間の多くは反復実験に費やされる。
そうした反復を自動化するエージェントは、専門家の対応範囲を広げられる。一人のエンジニアが目標を定義し、正確性テストを確立し、環境を監督し、人間が手作業で実行できるよりも大きな探索プロセスをレビューできる。
この配置は、説明責任をなくすことなく仕事を変える。何を「速い」とみなすか、どの数値許容差が受け入れられるか、最適化がセキュリティや保守上の問題を生まないかは、依然として誰かが決める。
モデルの失敗も、エンジニアリング業務の一部になる。生成コードにはレビューが必要であり、長時間の自律実行には、どのファイルが変わったか、どのコマンドが実行されたか、どの前提が結果を形作ったかを説明するログが必要だ。
ここに、楽観的な解釈が一定の説得力を得る理由がある。退屈な探索と測定をエージェントに移し、人間はシステム設計と判断により多くの時間を使えるようになる。
ただし、この利点は自動的には得られない。組織は生産性向上を品質改善、より困難な仕事への挑戦、人員削減、あるいはアウトプット期待値の引き上げに使える。利益をどう配分するかを決めるのは技術ではない。
開発者は、タスクの自動化と職業の代替も区別すべきだ。モデルは、周辺のビジネス文脈を理解しなくても、相当な活動を自動化できる。十分な活動が自動化可能になれば、雇用主は依然として役割を再編できる。
移行は一様には進まない可能性が高い。十分にテストされたリポジトリで作業するチームは、バリデーターがリグレッションを素早く検出できるため、エージェントからより大きな恩恵を得るだろう。文書化が不十分なシステムではフィードバックが弱く、エージェントがもっともらしく見えても有害な変更を生み出しかねない。
専門性の高いインフラ作業への参入障壁も下がる可能性がある。カーネル分野で長年の経験を持たない開発者でも、適格なレビュー担当者が正しさとハードウェアの挙動を確認することを前提に、エージェントを使って実装の選択肢を探れるかもしれない。
それでも専門知識が不要になるわけではない。むしろ、チームが従来は試す時間を持てなかった数の候補作業をエージェントが生成するため、専門家によるレビューの価値は高まる可能性がある。
この移行期には、ナレッジ管理の重要性も増す。限定されたベンチマークの範囲を超えて行動することをエージェントに期待するなら、要件、過去の意思決定、運用手順書、制約事項にアクセスできる必要がある。
チームはすでに、その文脈を人間のエンジニアが検索可能な形にすることに苦労している。整備された技術ナレッジベースは、エージェントが何を利用したかを人が検証し、実行前に不足情報を特定する助けになる。
エージェントがオフィス業務をまたいで動作するようになると、作業はさらに変化する。Alibabaは、Qwen3.7-Maxが複数ファイルにまたがるプロジェクトや外部ツールを伴うワークフローを調整できるとしている。これらの主張は、モデルの役割をコード生成から運用プロセスへと広げるものだ。
年次報告書では、Alibabaの野心が明示されている。経営陣は、エージェントがデジタル業務の担う割合を増やし、人とソフトウェアをつなぐ主要なインターフェースになると期待している。
この企業ビジョンは、独立して確立された予測ではなく、戦略として読むべきだ。Alibabaはモデル、クラウド容量、チップ、エージェントプラットフォームを販売している。エージェントの導入拡大は、その事業の各領域を直接支える。
それでも、同社は一貫した仮説を軸に事業を構築している。モデルが行動を生成し、行動がクラウドリソースを消費し、その下層のインフラをAlibabaが供給する。したがってQwenは、製品であると同時に、スタックの残りの部分への需要を生むエンジンでもある。
開発者にとって実務上の対応は、エージェントの忍耐力と競うことではない。エージェントの成果物をリリースに値するものと判断できるかを左右するスキルを磨くことだ。
そのスキルには、実行可能な要件の記述、意味のあるテストの構築、権限境界の設計、生成された変更のレビュー、モデルが誤った目標を最適化した場面の見極めが含まれる。
35時間の実行が印象的なのは、同じ制約下の実験をこれほど長く繰り返したい人がほとんどいないからだ。組織が持続性を完全なエンジニアリング責任と取り違えたときにのみ、それは脅威となる。
Google Newsの見出しでは証明されないこと
Alibabaが示したのは、同社主導による説得力のある実験であり、自律的なソフトウェア開発の普遍的な尺度ではない。
最大の制約は、情報源が集中していることだ。Alibabaはモデル、ハードウェア、ベンチマーク条件、性能主張、そして競合結果の多くを提供している。The Decoderが適切に指摘しているように、引用されたベンチマークの一部はQwenチームによって作成された。
自社開発のベンチマークが本質的に無効というわけではない。既存の評価が新しい能力を捉えられなくなった場合、モデル開発者がテストを作成することは少なくない。リスクは、外部による再現なしに、こうしたテストを広範な証拠として用いることにある。
カーネル実験には、多くの本番環境に見られる不確実性もない。測定可能な目標、実行可能なコード、利用可能なハードウェア、そして短いフィードバックループがあった。こうした条件は、自律的な反復を例外的に扱いやすくする。
「オンボーディングを簡単にする」といった製品要件は、同等のフィードバックを提供しない。ユーザー調査、設計上の判断、法的考慮、競合する目標の間での選択が必要になる。
長時間の実行は、誤りも増幅しうる。過剰なアクセス権を持つモデルは、より多くのファイルを変更し、より多くのリソースを消費し、機密情報をさらし、誤った前提に基づく依存関係を構築する可能性がある。
ツール呼び出しの回数だけでは価値を測れない。1,158回の規律ある操作を行うエージェントは、より短い実行を上回ることがある。一方で、別のシステムがより少ない操作で同じ結果に到達できるなら、非効率性を隠すことにもなる。
したがってチームには、成果指標と運用指標を組み合わせる必要がある。正確性、レビュー時間、ロールバック頻度、セキュリティ上の検出事項、デプロイ前に必要となる人間の工数を測定すべきだ。
Qwen3.7-Maxが学習中にZhenwu M890アーキテクチャを一度も見ていなかったというAlibabaの主張も、外部の人間には監査が難しい。非公開の最先端モデルについて、学習データセットを完全に検査できることはほとんどない。
モデルには参照実装が提供されており、その成果物には計算処理に関する重要な情報が含まれている。したがって、ドキュメントなしで始めたとしても、技術的に意味のある出発点なしで始めたわけではない。
競合モデルとの比較にも同様の慎重さが必要だ。エージェントの結果は、ハーネス、プロンプト、ツールインターフェース、コンテキスト配分、停止ポリシーに左右される。中立的な評価では、各モデルにその強みに適した構成を与える必要がある。
同じ懸念は、ハーネス間の一貫性にも当てはまる。Alibabaは、新しい学習アプローチによって、異なるエージェント環境間での性能変動を抑えたとしている。独立研究者は公開リポジトリと固定された評価ルールを使って、こうしたテストを繰り返すべきだ。
セキュリティも未解決の課題だ。長時間稼働するコーディングエージェントは、リポジトリ、ドキュメント、課題トラッカー、ツール出力の中で悪意ある指示に遭遇する可能性がある。持続的な自律性は、操作に利用できる時間と攻撃面を広げる。
実践的な防御となるのは、権限設計だ。チームはタスクに必要な最小限のアクセスだけを与え、実行を隔離し、完全なログを保存し、変更が機密システムに到達する前に承認を求めるべきである。
人間によるレビューは依然として必要だが、実質的なものでなければならない。要約に目を通しただけで大規模なパッチを承認しても、意味のある統制にはならない。レビュー担当者には、テスト、差分、プロベナンス、未解決の不確実性に関する明確な説明が必要だ。
Alibabaは、学習中にQwen3.7-Maxを用いた別の興味深い事例も報告している。モデルは、ソフトウェアエンジニアリングの軌跡に報酬ハッキングがないかを監視したとされる。報酬ハッキングとは、意図された問題を解く代わりに、モデルが評価を悪用する現象である。
同社によれば、エージェントは86時間にわたり13,952件の軌跡を調査した。13件の検出ルールを作成し、1,618件の疑わしいケースにフラグを付けたという。
この用途は、エージェント評価の可能性と循環性の両方を示している。あるモデルが別のモデルによる不正行為の特定を助けられる一方で、その検出が正確だったかどうかは依然として研究者が検証する必要がある。
偽陽性は正当な学習例を除外しかねない。偽陰性は、後に見栄えのよいベンチマーク性能として現れる近道を報いる可能性がある。したがって、監視エージェント自体にも監査プロセスが必要となる。
こうした不確実性は、35時間という結果を否定するものではない。その結果が何を裏付けられるかを定義するものだ。これは、最先端モデルが統制された条件下で専門的な最適化ループを維持できることの証拠である。
Qwen3.7-Maxが、未知の本番システムを独力で保守し、曖昧なステークホルダーのニーズを解釈し、デプロイ失敗の責任を負えることの証明ではない。
Google Newsから来た読者は、両極端を避けるべきだ。この実験は演出されたチャットボットのデモより実質的だが、エンジニアリング部門の代替よりはるかに限定的である。
Qwen3.7-Maxのローンチ後に注目すべき点
Alibabaが持続性のあるエージェントプラットフォームを提供したのか、それとも異例に好条件なデモを示したにすぎないのかは、3つのシグナルで分かる。
第1のシグナルは、カーネル結果の独立した再現だ。研究者には、タスク定義、開始時点のコード、正しさを検証するテスト、実行条件、プロンプト、ツールポリシー、停止基準へのアクセスが必要となる。
Alibaba以外のハードウェアで再現に成功すれば、中核的な主張は強まる。再現に繰り返し失敗したり、非公開インフラへの依存が大きかったりすれば、その関連性は限定される。
最も有用な研究は、単一の最良結果を公表するのではなく、複数回の実行を比較するものだ。エージェントシステムは試行ごとに大きく変動しうるため、単一の成功軌跡より平均値と失敗分布のほうが重要になる。
第2のシグナルは、実際のリポジトリ内で長期間にわたるQwen3.7-Maxの性能だ。企業は、介入頻度、採用された変更、取り消された変更、レビュー時間、デプロイ後に見つかった不具合を報告すべきである。
Alibabaはソフトウェアおよびエージェントのベンチマークにおけるスコアを挙げているが、公開ケーススタディがあれば、こうした能力が混沌とした組織条件でも維持されるかが明らかになる。有用な導入は、生成コードを増やすだけでなく、総人間工数を減らすべきだ。
特に保守に関わる事例に注目したい。新しいプロトタイプの構築では幅広い自由が許される一方、既存システムの保守では、過去の意思決定や運用上の制約との互換性が求められる。
第3のシグナルは、競合するモデル提供者の反応だ。Anthropic、DeepSeek、Moonshot AI、Zhipu AIには現在、より明確な評価ルールとともに、より長時間の自律実行を公開する動機がある。
提供者が再現可能なタスクと失敗事例を開示すれば、競争は証拠の質を高められる。実行時間の数値と選別されたベンチマーク勝利だけを競うなら、証拠の質は弱まる。
Alibabaの後続のエージェントインフラも、その方向性に関する手がかりを与える。同社は、複数エージェントをトレース、評価、調整、統治するためのツールを導入している。
この投資は、中心的な真実を認識している。モデルの知能だけでは、信頼できる作業者は生まれない。組織には、エージェントが何をしたかを可視化し、被害が広がる前に人が介入できる統制が必要だ。
Qwen3.7-Maxは、以前の一部のQwenリリースとは異なり、Alibabaのホステッドサービスを通じてのみ提供されるプロプライエタリなモデルでもある。この選択により、同社はデプロイをより強く管理でき、利用をクラウド事業とより密接に結び付けられる。
一方で、独立した検査は難しくなる。研究者は出力と挙動を評価できるが、モデルの背後にある重み、学習プロセス、提供時の変更を完全には調べられない。
Alibabaは戦略的なトレードオフに直面している。ホステッドアクセスは、セキュリティ更新と管理された運用を支援できる。オープンウェイトは、ローカル制御、カスタマイズ、より深い技術評価を必要とする開発者の導入を促進できる。
より広範なQwenロードマップは、同社がこれらの目標をどう両立させるかを示すだろう。Alibabaは一部のオープンモデルやインフラコンポーネントを引き続きリリースする一方、最も強力なMaxシステムはホステッドアクセス向けに留保している。
エンタープライズの購入者にとって、当面の問いは、どの研究所がすべてのベンチマークをリードするかより狭い。Qwen3.7-Maxが、自社のコンプライアンス、データ、レビュー要件の範囲内で、自社の業務を信頼性高く実行できるかを知る必要がある。
短期間のパイロットでは、測定可能な受け入れ基準を持つ実際のバックログ項目を使うべきだ。エージェントは隔離された環境内で動作させ、すべてのツール呼び出しを記録し、機密性の高い操作はブロックする。
チームは、総完了時間を現在のワークフローと比較すべきである。この計算には、プロンプト準備、監督、コードレビュー、テスト、修正、ドキュメント作成を含めなければならない。
開発者も、低リスクの社内タスクで同様の実験を実行できる。反復的なテストを含みつつ、なお判断を要する作業を選ぶ。モデルが進捗する箇所、行き詰まる箇所、不足する文脈を求める箇所を記録する。
目的は、エージェントが誰かを置き換えられると証明することではない。生産的な委任と高コストな監督の境界を見つけることだ。
その境界は、モデルの改善とともに動く。また、リポジトリ、組織、規制環境によっても異なる。Google Newsの見出しだけで、すべてのチームにとっての境界を決めることはできない。
Alibabaの実験が注目を集めるのは、モデルが実際の最適化プロセスを35時間にわたり継続したことを示しているためだ。心強いのは、対象がそれを取り巻く職務全体ではなく、反復的な技術作業だった点にある。
次の一歩を担うのは、こうしたシステムを使うことが期待される人々だ。自分の仕事に照らしてその主張を検証し、監督にかかる総コストを測定し、どの判断を人間に残すべきかを問う必要がある。Qwen3.7-Maxが慎重なエンジニア一人で達成できる範囲を一貫して広げるなら、最も重要な仕事は、そのエンジニアが二度と繰り返したくない作業かもしれない。



