Anthropic Claude Code が50日間壊れていた。ポストモーテムの真の教訓はバグではない。
- Aisha Washington

- 6月5日
- 読了時間: 12分
Anthropic Claude Codeは、2026年に開発者から最も愛されたAIコーディングツールとして評価され、品質を低下させる3つの別々の変更を50日間にわたってリリースしました。シニアAMDエンジニアがAnthropicより先に問題を発見しました。4月2日、AMDのAI担当ディレクターであるStella Laurenzoは、GitHub issueを提出しました。これはバグ報告というより法医学的監査のようでした:6,852のClaude Codeセッション、234,760のツールコール、17,871のthinking blocksが、3ヶ月間の安定した社内エンジニアリング作業を通じてキャプチャされました。すべての指標が同じ結論を示しました。ツールは測定可能な形で悪化しており、外部ユーザーが同社自身が構築していなかったテレメトリーを構築するまで、Anthropicの誰も気づいていませんでした。
The postmortem that followed on April 23 was remarkable by AI industry standards , transparent, detailed, self-critical. It traced the quality decline to three product-layer changes that, shipped separately, each passed testing. Shipped together, they broke the product for seven weeks. But the real story is not what broke. It is why nobody at Anthropic knew it was breaking, and what that says about every piece of AI-powered infrastructure developers now depend on.
What Happened , Three Bugs, One Postmortem
タイムラインは正確で不名誉なものです。品質の低下は2026年3月4日頃から始まりました。4月2日までに、Laurenzoの監査(1月の中央値思考長が2,200文字から3月には600文字へ、73%の低下を記録)がGitHub上で公開されました。Anthropicは4月20日にv2.1.116をリリースし、3つの問題すべてを修正しました。postmortemは3日後の4月23日に続きました。
3つのバグはモデル自体にはありませんでした。Anthropic Claude CodeはClaudeのAPIと同じ基盤モデル上で動作します。問題は完全に製品レイヤー、つまりモデルとユーザーの間にあるハーネス、プロンプト、キャッシングロジックにありました。この事実 alone が、このインシデントから得られる最も重要な技術的洞察です。モデルが愚かになったわけではありません。それを取り巻く足場が悪化したのです。
最初の変更はreasoning effortのダウングレードでした。レイテンシと推論コストを管理するため、AnthropicはClaude Codeのオーケストレーションレイヤー内のデフォルトreasoning depthを静かに下げました。Claude Codeは依然として回答を生成しますが、応答前に thinking less するようになりました。これは複雑なアーキテクチャの質問に、熟考した分析ではなく第一印象で答える認知的な equivalent です。Claude Codeをマルチファイルリファクタリング、システム設計、デバッグに使用する開発者にとって、Claude Codeを人気にしたまさにそのユースケースにおいて、その違いは壊滅的でした。
2つ目はthinking-historyシステムにおけるキャッシングバグでした。Claude Codeは長いコーディングセッションを通じてコンテキストを維持するため、モデルがすでに考えた内容をキャッシュし、シンプルなオートコンプリートツールと差別化するlong-contextでagenticなワークフローを可能にします。このキャッシュのロジックエラーにより、セッションが長くなるにつれてコンテキストが徐々に破損するようになりました。開発者は古典的で苛立たしい症状を報告しました:Claude Codeはタスクを有能に開始するものの、徐々に何をしていたかを忘れ、自身を繰り返し、以前の決定を忘れ、数分前に書いたコードと矛盾する提案をするようになりました。
3つ目はverbosity-limiting system promptでした。Anthropicはトークン消費を制御し応答長を短縮するためプロンプトを調整しました。その副作用は、Reddit、X、Hacker Newsで報告された通り、Claude Codeが崩壊するほどterseになることでした。コードブロックを短くし、説明を省き、開発者がワークフローを構築していたコンテキストを省略するようになりました。ツールの主な価値提案がコードベース全体の深い文脈理解である場合、応答を短くすることは最適化ではなく切断です。
Anthropicの公式説明(postmortemおよびその後のメディアブリーフィングで繰り返された)は、各変更は単独では許容範囲内だったというものです。一緒になると、同社がnonlinear collapseと表現するものを生み出しました。これは技術的に妥当な主張です。また戦略的にも都合が良いものです。いずれにせよ、製品を50日間破壊した3つの独立した変更はエンジニアリングについての一つの物語を語ります。内部システムが何も気づかなかったという事実は、異なる、より重要な物語を語ります。
Why It Matters , The Competition Is Now About Reliability, Not Intelligence
AIコーディングツール市場は、モデル能力がもはや差別化要因ではなくなった段階に入っています。製品の信頼性がそれです。
Anthropic Claude Codeは、開発者満足度調査で46%の「最も愛された」評価を2つの理由で獲得しました:agentic coding(複雑なマルチステップエンジニアリングタスクを自律的に完了する能力)と、コードベース全体を作業メモリに保持できるlong-context windowsです。これらの競争優位性は、まさに製品レイヤーの劣化に最も脆弱な機能です。Claude Codeのreasoning depthが73%低下すれば、そのagentic優位性は一夜にして蒸発します。コンテキストキャッシュが徐々に破損すれば、そのlong-context windowは資産ではなく罠となります。
競争環境はこの脆弱性をさらに深刻にしています。2026年の真剣なclaude code reviewは、Anthropic Claude Codeを三つ巴のレースに位置づけます。GitHub Copilotは現在Fortune 100企業の90%をカバーし、2026年5月12日に400万件のコミットにGit co-authorとして密かに追加されたことが確認されました。これは他の月であればAI開発者ニュースを独占したでしょう。Cursorは年間売上20億ドルを超え、500億ドルの評価を求めていると報じられています。OpenAI Codexは4月20日にdesktop agent機能をリリースし、Claude Codeが開拓した自律的コーディングエージェントのナラティブを直接狙いました。これはAnthropicがv2.1.116の修正をリリースしたのと同日です。
3つの競合他社はいずれも、Claude Codeが動作するモデルと同等の品質の基盤モデルにアクセスできます。今それらを区別するのは、特定のベンチマークでどのモデルが賢いかではありません。開発者が月曜朝に開いて、金曜午後と同じように正確に動作すると信頼できるツールです。競争はモデルレイヤーから信頼性レイヤーへ移行しました。
"Not getting dumber" is becoming a more valuable product attribute than "getting smarter." AMDがチップ設計エンジニアリングに使用したように、Claude Codeのagentic機能を中心にワークフローを構築した開発チームは、思考深度の低下とほぼ同じ割合で生産性を削られました。警告なく静かに劣化したツールによる73%の生産性低下は、些細な不便や許容できるトレードオフではありません。プロフェッショナルツールと、それを中心に業務日を構成する人々との暗黙の契約違反です。
The Uncomfortable Question , Three Changes, Zero Alerts
postmortem全体で最も不穏な詳細は、Anthropicが3つの劣化変更をリリースしたことではなく、内部監視システムがそのいずれも検知しなかったことです。
3つの製品レイヤー変更がcross-monitoringなしで本番投入されました。中央値思考深度の73%低下を捉える自動品質回帰テストは存在せず、セッション全体でコンテキスト整合性が徐々に劣化し始めたときにアラートは発火せず、応答が短くなり許容品質に到達するまでにより多くの反復を要したため開発者が使用制限を大幅に速く消費しているという事実をダッシュボードは表面化しませんでした。
問題を発見したのは外部ユーザー、AMDのシニアエンジニアで、Anthropicがそれを捉えられるテレメトリーパイプラインを構築していなかったため、自身で構築したものです。Stella LaurenzoのGitHub auditは学術的好奇心ではありませんでした。AMDは複雑なチップ設計エンジニアリングワークフローにClaude Codeを依存しています。彼女のチームは品質低下に気づき、Anthropicのサポートチャネルから満足のいく回答を得られず、重要なツールが説明なく故障し始めたときに有能なエンジニアが行うことをしました:自身で測定し、証拠を公開したのです。
Anthropicの従業員でも内部SREでも自動システムでもない外部ユーザーが、6,852セッションと234,760ツールコールを計測し、品質低下の統計的に反論不可能な証拠を、Anthropicが自らの評価を公開する21日前に作成できたという事実は、一社のエンジニアリング才能についての物語ではありません。カテゴリ全体の運用成熟度についての物語です。
ここで信頼の問題が結晶化します。Anthropicのpostmortemは、AI業界史上で品質回帰に関する最も透明性の高い公開説明の一つであり、外部圧力ではなく同社自身によるclaude code reviewでした。同社は3つの変更すべてを認め、相互作用の連鎖を説明し、具体的なタイムラインを公開し、新たな監視プラクティスを約束しました。Anthropic Claude Codeのユーザーにとって、postmortemは、品質に関する苦情に通常沈黙または否定で応じる業界において稀な率直さの瞬間でした。Fortune's coverage captured the paradox in its headline: "Anthropic's explanation has done little to win them back."
透明性はバグを修正しますが、自動的に信頼を回復するわけではありません。プロフェッショナルツールへの信頼は一貫した動作への期待の上に築かれます。開発者が6週間にわたり、他の開発者、Redditスレッド、自身の劣化する出力からClaude Codeが悪化していると告げられ、Anthropicのその間の対応が事実上「調査中」だったとき、彼らは関係性について構造的なことを学びました。彼らは、自分たちが監視システムであることを学んだのです。暗黙の契約「作業に影響する可能性のある変更があれば通知する」は、別の契約「ツールが動作しなくなったらあなたが通知する」に置き換えられました。
postmortem後に残る疑問は、Anthropicが3つのバグを特定して修正できるかどうかではありません。同社には世界最高水準のエンジニアリング人材がいます。疑問は、Anthropicまたは規模で運用するAIツールプロバイダーが、ユーザーより先に劣化を検知する運用インフラを構築しているかどうかです。2026年5月時点の答えはノーのようです。
This Has Happened Before , And Will Again
Claude Codeの品質低下は孤立したインシデントではありません。作成者がユーザーから指摘されるまで気づかなかったAI製品の劣化という、3年間で3件目の主要事例です。
2023年、ChatGPTユーザーはGPT-4が明らかに「lazier」「dumber」になったと報告し始めました。数ヶ月間、Reddit、X、OpenAIのフォーラムに苦情が殺到しました。同社は当初モデルの変更を否定し、その後断片的なコミュニケーション(ここでのツイート、あそこでのフォーラム投稿、モデル動作に関する広範なブログでの間接的な言及)で、特定のドメインで意図しない副作用を生むアップデートがあったことを認めました。Anthropicとは異なり、OpenAIは体系的なpostmortemを公開しませんでした。ユーザーは部分的な説明を信じるか、管理されているかを自分で判断するしかありませんでした。
2024年、GitHub Copilotはサイレントモデル更新により一貫性のないコード提案を生み、類似の苦情の波を経験しました。開発者はCopilotが文法的には正しいが周囲のプロジェクトコンテキストと意味的に互換性のないコードを時折生成すると報告しました。これは製品レイヤーの統合テストがデプロイ前に捉えるべき回帰の典型です。Microsoftはpostmortemではなくモデルロールバックで対応し、開発者が何が変わり、なぜ変わったのか、類似のサイレント変更が再び起こるかどうかを理解することを困難にしました。
Anthropicのpostmortemは、AI企業が品質回帰についてこれまで公開した中で最も徹底した説明です。それは genuinely 称賛に値し、開発者がツールプロバイダーに期待すべき水準を引き上げます。しかしそれは異常値でもあります。この業界全体(OpenAI、Microsoft、Googleなど)でのnormは、品質変動をproprietary operational detailsとして扱うことです。ユーザーは、低下を想像しているのか、支払っている製品にmaterialな変更があったのかを推測するしかありません。
パターン(静かに劣化させ、質問をかわし、静かに修正する)は、これらのツールが今運用する規模では持続可能ではありません。Claude Codeはプロのエンジニアが使用し、その出力が信頼性に依存しています。CopilotはFortune 100企業の90%の開発ワークフローに組み込まれています。CodexとCursorは本番ソフトウェアの出荷に使用されています。claude code vs copilot comparisonは、賭けたツールが警告なく劣化するなら意味がありません。これらのツールが静かに壊れるとき、下流のコスト(失われたエンジニアリング時間、誤ったデバッグ努力、AI支援ワークフローへの信頼の浸食)は、それらに依存するすべての組織にわたって増幅します。監視ギャップはもはやスタートアップの問題ではなく、インフラの問題です。
What's Next , The Reliability Era of AI Coding Tools
Anthropicは製品レイヤー監視の強化を約束しました。postmortemの詳細は依然として薄く、同社は「new quality regression detection」と「cross-signal alerting」に言及しましたが、それらのシステムが何を測定し、どの閾値でトリガーし、次のmulti-change interactionバグをどれだけ迅速に捉えるかについては詳述していません。市場は注視しており、競合他社もメモを取っています。
競争の時計は止まっていません。Claude Codeが能力のほんの一部で動作していた50日間、GitHub Copilotは静かに400万件のコミットのco-authorとなりました。OpenAI Codexはdesktop agentをリリースし、Claude Codeが開拓し一時的に放棄した自律的コーディングエージェントのナラティブを主張しました。Cursorは2026年の最大のAIツールIPOの一つになり得るものに向かって前進を続けました。Claude Codeの46%の「最も愛された」評価は、耐久性のあるブランド資産であり、製品の設計と能力に対する本物の開発者愛情の上に築かれたものです。しかし、競合が毎週出荷し、あなたが7週間コア体験を劣化させていた場合、ブランドの耐久性には有効期限があります。
The AI coding tool market is entering its reliability era.最初のフェーズ(おおよそ2022年から2025年)はモデル能力を中心に組織されていました。マインドシェアと市場シェアを獲得したツールは、最も賢いモデル、最も長いコンテキストウィンドウ、最も印象的なデモビデオを持つものでした。そのフェーズは終わっています。モデルが改善を止めているからではなく、収束したからです。2026年の主要プレイヤーはすべて、ほぼ同等の知能を持つ基盤モデルにアクセスできます。今後それらを分けるのは運用成熟度です:デプロイメントの規律、回帰テストの厳格さ、監視のカバレッジ、インシデントコミュニケーションの質です。
2027年に勝つツールは、リーダーボードで最高のベンチマークスコアを持つものではありません。開発者が月曜朝に開いて、金曜午後と同じように正確に動作すると信頼できるものです。Claude Codeのpostmortemは失敗についての正直な文書です。Anthropicおよび規模でAIツールを出荷するすべての企業にとっての未解決の疑問は、それが失敗の終わりを意味するのか、それとも次を完全に防ぐ運用規律の始まりを意味するのかです。
AIコーディングツールが作成者自身に気づかれることなく73%の思考深度を50日間失うことができるなら、それは今開発者が依存する他のすべてのAIインフラについて何を物語るでしょうか。Claude Codeのpostmortemは有用な成果物であり、業界のnormである不透明さに対して透明で、標準的な沈黙に対して詳細です。しかしそれは警告でもあります。今や世界のソフトウェアエンジニアリング出力のかなりの部分を駆動するAIツールは、あまりにも多くの場合、最初のベータ版を出荷するスタートアップの監視成熟度で運用されています。それがこれらのツールが目新しさだったときには許容できました。インフラである今は許容できません。reliability eraは始まっており、それを最初に理解する企業がこの市場の次のフェーズを所有するでしょう。コーディングアシスタントであれ、AI-powered knowledge managementプラットフォームであれ、AIツールを中心にワークフローを構築するチームにとって教訓は同じです:自身を監視することを証明するツールを選び、監視をあなたに求めるツールを選ばないことです。


