Anthropic Biology Lab、Claudeの創薬への野心を現実世界の試験へ
Anthropicは物理的な生物学施設を開設し、AIによる生物学的リスクへの懸念が高まるなかでも、Anthropic biology labをコンピューターシミュレーションの先へ進めている。サンフランシスコ・ベイエリアのこの施設は、Claudeが生み出したアイデアを実際の実験へ持ち込む経路を提供する。そこでは、ベンチマークのスコアに代わり、分子、細胞、機器、そして失敗した結果が待ち受ける。
この動きは、Anthropicのライフサイエンス部門責任者であるEric Kauderer-Abramsが、9月18日にReutersが掲載したインタビューで確認した。Anthropicは自社施設内での研究と、外部パートナーが実施する実験を組み合わせている。
この組み合わせが、中心的な緊張関係を生む。AnthropicはClaudeによって前臨床科学を加速させる一方、製薬企業の顧客に対し、データ、プログラム、商業的利益が守られることを保証したい考えだ。また、AIシステムによるラボ作業への関与を強めても、安全性に関する同社の約束を損なわないことを示さなければならない。
Alphabet傘下のIsomorphic Labsは、特化型の創薬システムを通じて、長年にわたり関連する目標を追求してきた。Anthropicは別の道を選び、汎用AIモデルを実験運用により近づけながら、製薬企業を顧客として支援し続けている。
その結果は、単なる製薬企業との新たなAI提携ではない。Anthropicは、Claudeが継続的な科学ループに参加できるかを検証するためのインフラを構築している。すなわち、アイデアを提案し、実験を実行し、結果を検討し、次に何をするかを決めるループだ。
Anthropic Biology Lab、Claudeをシミュレーションの先へ進める
Anthropicにとって最も重要な変化は、会話面ではなく物理的なものだ。Claudeの生物学的提案が、現実のラボエビデンスに直面できるようになった。
wet-lab reportによると、Anthropicはサンフランシスコ・ベイエリアにこの施設を設立した。ウェットラボとは、研究者が生物材料、化学物質、実験手順を物理的に検証する管理された空間である。
Kauderer-Abramsは、実際のラボ作業が生物学研究における最終的な試験であり続けると述べた。同氏はAnthropicの運営モデルをバイオテクノロジー企業に近いものと説明し、一部の実験は社内で実施し、他の実験はパートナーに委託しているとした。
この違いは重要だ。計算上の成功が、生物学的な成功を裏付けるわけではない。モデルがあるタンパク質設計を高く評価しても、提案された分子が結合しない、安定性を保てない、適切に発現しない、あるいは安全に振る舞わない可能性がある。
社内ラボは、モデルの提案とそれを検証するエビデンスとの距離を縮める。AnthropicはClaudeの推論がどこで破綻するか、どのツールが摩擦を生むか、科学者が推奨を受け入れる前にどの情報を必要とするかを観察できる。
このラボは、Anthropicに実験科学の地道な側面を直接体験させるものでもある。研究者は試料を準備し、機器を校正し、逸脱を記録し、汚染を調査し、異常な結果に再試行の価値があるかを判断しなければならない。
こうした運用上の詳細を、静的なベンチマークの問いで捉えることは難しい。AIシステムが複数のツールを連携させたり、人間がすべての指示を書き直さずに結果へ反応したりするようになると、特に重要になる。
Anthropicはすでに、Claudeが設計したタンパク質バインダーのラボ試験を報告している。ミニバインダーとは、選択した生物学的標的に強く結合するよう設計された小型タンパク質である。
同社のprotein design experimentsでは、外部評価者が15の標的に向けた設計を作製・試験した。Anthropicによると、Claudeは14の標的で成功したバインダーを生成した。
報告されたヒット率は、モデルと実験設定によって異なった。Anthropicによると、Mythos Previewは全標的で26.7%の総合ヒット率に達し、Opus 4.8は22.6%だった。
Mythosが別セッションで単一標的に集中した場合、Anthropicは35.1%の総合ヒット率を報告した。これらの結果は、初期段階のタンパク質設計研究に関するものであり、承認済み医薬品や患者における有効性の証拠ではない。
それでも、この実験はAnthropicがラボ運用へのより直接的なアクセスを求める理由を説明している。システムが信頼できる実験フィードバックを吸収し、次の提案を修正できるとき、計算上の出力はより価値を持つ。
Anthropicの広報担当者も、この施設について慎重な線引きを示した。同社は、このラボが創薬のために特別に設立されたものではないと述べる一方、その完全な目的については説明を控えた。
この留保により、重要な疑問は未解決のままだ。Anthropicは、研究対象となる疾患、ラボの処理能力、バイオセーフティレベル、社内で実施される作業の割合を公表していない。
それでも方向性は明確だ。Claudeは、生物学的情報を解釈するアシスタントから、新たな生物学的エビデンスの生成を調整する支援ができるエージェントへと移行している。
Anthropicが独自の実験フィードバックループを求める理由
Anthropic biology labは、モデル訓練だけでは得られないものを同社にもたらす。AIの判断が生物学という現実に触れたとき、どのように持ちこたえるかについての直接的なエビデンスだ。
Anthropicによると、ライフサイエンスは人員とリソースの両面で同社最大級の投資分野の一つとなっている。同社はClaude Scienceの立ち上げ、専門家の採用、バイオテクノロジー分野の知見獲得、大手製薬企業との関係構築も進めている。
Reutersは、Anthropicが株式取引を通じてCoefficient Bioを買収したと報じた。Anthropicは買収を認めたが、報じられた取引額については確認しなかった。
Coefficient Bioは、計算生物学と医薬品開発ツールにおける経験をもたらした。この専門性は、Anthropicが汎用推論モデルを、科学者が評価・再現できるワークフローへ落とし込む助けとなり得る。
Anthropicはラボ運用と生化学的特性評価の人材も採用している。こうした職務は、ソフトウェアだけを生み出すのではなく、機器、調達、実験データ、品質管理を扱う準備を進める組織を示唆している。
戦略的な魅力はスピードにある。すべての物理的試験を外部受託業者に通す場合、スケジューリングとコミュニケーションが各設計サイクルを遅らせる可能性がある。社内能力は、Anthropicに選定した実験へのより大きな統制をもたらす。
短縮されたサイクルにより、研究者はClaudeの予測と物理的な結果をより頻繁に比較できる。失敗した実験も、パートナーのプロジェクトアーカイブの中に埋もれるのではなく、構造化されたフィードバックになり得る。
このプロセスは、システムが不確実性を最も効率よく減らす実験を選択するアクティブラーニングに似ている。モデルは固定されたデータセットを検索するだけではない。どの新たなデータを作るべきかの判断にも関与する。
ラボ自動化は、このループを高速化できる。ロボットシステムは、機械可読な指示を受け取った後、液体を分注し、プレートを移動させ、測定値を収集し、再現可能な手順を実行できる。
Anthropicは、限定的な人間の介入でClaudeにロボットユニットを指示させたいと報じられている。同社は、特に実験が機微な生物学的能力や曖昧な結果を伴う場合、人間による監督が不可欠であり続けるとも述べている。
これが、より大きな野心を支える仕組みだ。Claudeが仮説を生成または評価し、ソフトウェアがその判断を機器の操作へ変換し、実験結果がモデルへ戻る。
そのサイクルは繰り返される。各反復は、タンパク質設計を洗練し、不適切な候補を除外し、あるいは次に進む前に科学者が必要とする測定を特定する可能性がある。
ただし、エビデンスが信頼できるものである場合にのみ、スピードは役に立つ。自動化されたワークフローは、有用な実験と同じ効率で、選定を誤った実験も再現できる。
また、観測結果が初期仮説と矛盾するとき、モデルは過信に陥る可能性がある。有用な科学エージェントには、不確実性を認識し、代替的な説明を提示し、否定的なエビデンスを保持する能力が求められる。
そのため、ラボ記録は製品上の課題の一部となる。機器出力、プロトコル、モデルプロンプト、人間による承認、逸脱はすべて、追跡可能な履歴を通じて結び付けられなければならない。
この課題はAnthropicに限らない。科学チームは実験の文脈を、ノート、データベース、メッセージングシステム、機器ソフトウェアにまたがって保管することが多い。断片化された記録は、人間とAIの双方の推論を監査しにくくする。
機能するフィードバックループには、有能な言語モデル以上のものが必要だ。信頼できるデータ来歴、相互運用可能な機器、明確な権限、そして別のチームが結果を再現できるという証拠が求められる。
Anthropicのラボは、同社がこうした制約に直接直面する助けとなり得る。また、Claudeと科学機器をつなぐインターフェースを含め、Anthropicが外部ラボへ販売するツールにも情報を与え得る。
この商業的フィードバックは、社内の創薬プログラムと同じくらい重要になるかもしれない。実験を運用することで、ベンダーがAPIを提供するだけでは見えない失敗が明らかになる。
AI創薬は依然として生物学で最も厳しい関門に直面している
分子設計の成功は創薬への入力であり、有用な医薬品が存在することの証明ではない。
Anthropicは、従来企業が商業的に魅力が薄いと見なす可能性のある疾患に向けた前臨床プログラムについて議論している。前臨床研究には、薬剤がヒト試験に入る前に実施されるラボ試験および動物試験が含まれる。
希少疾患はこの戦略に適している。患者数が少ないと、従来型開発の採算性が弱まるためだ。AI支援設計は、初期研究のコストを一部削減したり、これまで十分な注目を集めなかった標的を科学者が検討する助けになったりする可能性がある。
Kauderer-Abramsは、「創薬困難」と見なされる疾患にも言及している。この言葉は、その構造や挙動により有効な介入が難しく、従来の治療戦略に抵抗してきた生物学的標的を表す。
複雑な分子は、考えられる一つの道筋を提供する。二重特異性抗体および三重特異性抗体は、2つまたは3つの標的に結合でき、単一標的の分子では実現できない治療効果を生み出す可能性がある。
AIシステムは、科学者がこうしたより大きな設計空間を探索する助けとなるかもしれない。専門モデルを連携させ、文献を検索し、候補を順位付けし、物理的試験向けの配列を提案できる。
しかし、医薬品開発には初期設計が回避できない複数の関門がある。分子は適切な効力、選択性、安定性、製造可能性、分布、安全性を示さなければならない。
さらに、ヒトでの臨床試験を乗り越える必要がある。患者間の生物学的な違いにより、計算モデル、精製アッセイ、動物試験では説得力があった機序が失敗に終わる可能性がある。
clinical impact researchが要約した最近の分析では、承認済み医薬品へのAIの貢献は、これまでのところ限定的だとされた。候補の特定は、臨床的な検証よりも速く進んでいる。
第2相試験は、研究者が患者で意味のある有効性を示さなければならないため、とりわけ厳しい試験であり続ける。予測の向上が、このボトルネックを自動的に解消するわけではない。
Anthropicは、臨床試験を実施する計画があるとは述べていない。Kauderer-Abramsは、同社が既存の製薬・バイオテクノロジー企業が対応していない前臨床ニーズに焦点を当てていると述べた。
この線引きにより、Anthropicは開発のうち最も高コストで規制の厳しい部分から距離を置くことになる。同時に、同社だけでは治療プログラムの最終的な価値を実証できないことも意味する。
Isomorphic Labsとの比較は示唆に富む。Alphabetは、DeepMindによるタンパク質構造の研究が科学的な注目を集めた後、AIファーストの創薬を軸に同社を設立した。
Isomorphicは候補プログラムの開発と臨床入りに向けた取り組みを長年続けてきた。その経験は、計算能力とヒトでの医薬品試験との間にどれほど多くの作業が横たわっているかを示している。
OpenAIも生命科学向けの評価インフラを構築している。LifeSciBenchベンチマークには、7つのワークフローと7つの生物学分野にまたがる、専門家執筆の750のタスクが含まれる。
LifeSciBenchは、単純な事実の想起ではなく、実際の研究における判断力を測定しようとしている。タスクには、エビデンスの解釈、実験設計、トラブルシューティング、検証、トランスレーショナルリスクが含まれる。
こうしたベンチマークは、モデルが研究上の問題を首尾一貫して扱えるかを明らかにできる。一方で、適切に統制された実験、独立した再現、臨床エビデンスの代わりにはならない。
この違いは、Anthropicが報告した結果の解釈にも反映されるべきだ。高いバインダーヒット率はさらなる研究を後押しし得るが、Claudeが安全な医薬品をより速く生み出せることの証明ではない。
より意味のある試験は、透明性のあるベースラインを備えた反復的なプログラムに関わるものになる。観察者は、人間のチームが何を達成したのか、Claudeがどのツールを用いたのか、各結果の前にどれだけの失敗があったのかを知る必要がある。
また、独立した研究機関からのエビデンスも必要だ。ベンダー主導のデモンストレーションは能力を示し得るが、外部による再現の方が、隠れた前提やワークフロー上の優位性を明らかにしやすい。
Anthropic biology labは、より強いエビデンスを生み出す場を同社に与える。同時に、探索的な結果と医学的に重要な進展を区別する責任も重くする。
Anthropicの創薬への野心は顧客信頼の問題を生む
Anthropicは製薬顧客を支援したい一方で、その同じ顧客が競合的と見なす可能性のある隣接領域の能力も開発している。
Anthropicは、Genentech、Bristol Myers Squibb、Novo Nordiskなどの組織にAIツールを提供している。これらの顧客は、機密性の高い研究データ、独自の標的、非公開の実験プログラムを扱っている。
同社は、顧客情報は保護され、自社研究とは分離されていると述べている。技術的な管理策があっても、競合しているように見えることは、顧客が共有する意思に影響し得る。
製薬会社は、Anthropicが別の創薬プログラムに利益をもたらす一般的なワークフロー上の知見を得ているのではないかと考えながら、Claudeを使って社内データを分析するかもしれない。懸念は、機密ファイルへの直接アクセスだけにとどまらない。
製品の優先順位は商業的な方向性を示し得る。サポートの依頼は、どのワークフローが最も重要かを明らかにし得る。統合のパターンは、研究組織がどこでボトルネックを経験しているかを示し得る。
Anthropicが臨床試験を避けると決めたことは、この緊張関係の一部に対処している。同社は、完全な製薬競合企業ではなく、前臨床研究とインフラのパートナーとして位置付けられる。
しかし、この境界は本質的に恒久的なものではない。有望な社内分子が生まれれば、資産をライセンス供与する、新会社を立ち上げる、製薬企業と提携するといった圧力が生じる可能性がある。
同社は、こうした判断をどのように統治するかを説明していない。また、社内研究チームと顧客向け生命科学チームが正式な情報障壁の下で運営されているかについても説明していない。
信頼は具体的な管理策に左右される。顧客は、データ保持、モデル学習、従業員アクセス、監査ログ、インシデント報告、競合目的での利用について、明確なルールを求めるだろう。
Anthropicの新しいLife Sciences Verification Programは、関連するアクセス上の問題に対処している。正当な生物学タスクの多くは、単一のプロンプトだけで判断すると危険な要求に似て見える場合がある。
verification programの下で、承認済みの組織は、より寛容な生物学的セーフガードを備えたモデルへのアクセスを得る。Anthropicはアクセスを付与する前に、資格情報、セキュリティ慣行、研究監督を審査する。
標準的なアクセスは、一般的な研究開発ワークフローを対象とする。より高リスクのプロジェクトには、追加の審査とプロジェクトごとの承認が必要となる。
Anthropicによると、このプログラムは各組織が申告した研究範囲に照らして活動を監視する。即時ブロックから、複数セッションにまたがる行動のオフラインレビューへと、執行の一部を移している。
この監視を支援するため、プログラムはフラグが立てられたトラフィックデータを30日間保持する。Anthropicは、この情報は区分管理され、同社の生命科学研究チームは利用できないとしている。
こうした管理策は、顧客信頼とバイオセキュリティがどのように収束しているかを示す。モデル提供者は、不正利用を検知できるだけの可視性を必要とする一方、商業情報が組織の境界を越えて移動する経路を作ってはならない。
社内ラボは、さらに別のガバナンス層を加える。Anthropicは、安全性評価、製品開発、潜在的な治療研究のために行われる実験を分離しなければならない。
その明確さがなければ、顧客はAnthropicがインフラ提供者、研究協力者、評価者、あるいは将来の競合相手のいずれとして行動しているのかを判断しにくくなる可能性がある。
リスクは意図的な不正利用に限定されない。科学データは誤って解釈されたり、不適切に組み合わされたり、不適切に設定されたツールを通じて露出したりする可能性がある。
研究室システムに接続されたAIエージェントは、機器、データベース、クラウドサービスへのアクセス許可を受ける可能性がある。接続が増えるたびに、セキュリティレビューを要する経路の数も増える。
したがって製薬企業の買い手は、モデルの知能だけでなく、Anthropicの運用規律を評価する。調達チームはアクセス制御、契約上の境界、再現性、障害対応を精査するだろう。
Anthropicにとって、この信頼を得ることは不可欠だ。ラボは製品を改善できるが、顧客データと社内の創薬への野心は、明確に分離された状態を維持しなければならない。
同じラボ能力はバイオセキュリティ上のリスクも高める
Claudeが治療研究を実行するのを助けるツールは、脆弱なアクセス制御や誤った自動化がもたらす結果も増幅し得る。
Anthropicは、高度な生物学支援を繰り返しデュアルユースとして説明してきた。研究者が治療用タンパク質を設計するのに役立つ同じ知識が、意図次第では有害な生物学的作業を支援し得る。
同社は、技術的な背景が限られた行為者に対する有意な支援をもはや否定できないと判断した際、より強力な保護策を有効化した。これらの保護策は、化学・生物・放射線・核のリスクに焦点を当てている。
Anthropicは、AIが実際のラボ作業の性能をどの程度改善するかについて不確実性を認めている。biorisk researchでは、基本的な生物学プロトコルを用いた8人の参加者による小規模な2024年試験について説明している。
この研究では、インターネットアクセスと比べてClaudeが参加者の成績を改善したことを示す証拠は見つからなかった。ただし、両グループとも予想以上に良好な成績を示し、実験で確立できる内容には限界があった。
Anthropicはその後、Sentinel BioとFrontier Model Forumによるより大規模な研究を支援した。この研究は、AIが非専門家による、専門家レベルの性能に関連するラボタスクの完了を支援できるかを検証することを目的としている。
社内施設は、物理的な実験におけるモデルの振る舞いについて、より多くのエビデンスを提供できる。Claudeが機器を誤解する場面、安全条件を見落とす場面、不必要な手順を推奨する場面を明らかにできる。
しかし、ラボは能力も拡張する。モデルをロボットハードウェアへ接続すると、情報と行動の間の距離が縮まる。まさにそのため、ラボの自動化には慎重な管理が必要となる。
人間によるレビューは依然として必要だが、この表現は複数の異なる運用形態を覆い隠し得る。科学者がすべての行動を承認する場合もあれば、計画されたプロトコルだけをレビューする場合や、自動モニターが異常な振る舞いを検知した後に介入する場合もある。
これらの方法が提供する保護水準は異なる。Anthropicは、Claudeがラボ内でどの判断を行えるのか、また人間の承認がどの頻度で必要なのかを公に詳述していない。
自動監視もまた不確実性をもたらす。安全システムは、通常の科学的変動と、不正利用、汚染、または安全でない実験の方向性を示す行動とを区別しなければならない。
偽陽性は正当な研究を中断させ得る。偽陰性は、個々には通常に見える行動からなる危険な一連の流れを進行させる可能性がある。
verification programは、セッションをまたぐパターンを監視することでこの問題を認識している。ソフトウェアのコマンドがチャットウィンドウではなくラボ機器を通る場合にも、同様の考え方が必要になる。
セキュリティはハードウェア層にも依存する。機器には、認証済みインターフェース、制限された権限、検証済みコマンド、そして密かに改変できないログが求められる。
もっともらしいプロトコルを生成できるというだけで、モデルに広範なラボへのアクセスを与えるべきではない。その権限は、各実験に必要な最小限のツールと材料に限定されるべきだ。
Anthropicは自動化バイアスにも備えなければならない。特に数百もの実験選択肢が手作業でのレビューを困難にする場合、科学者は体系的に見えるという理由でモデルの推奨を受け入れる可能性がある。
独立した確認はそのリスクを低減できる。チームは、影響の大きい判断を別のモデルや研究者にレビューさせ、停止条件を事前に定義し、再試験用のサンプルを保存することができる。
同社の公的な主張にも同様の慎重さが必要だ。Anthropicは、高度なAIが有益な科学を加速できる一方、その管理策によって危険なアクセスを減らせるとしている。
この主張のいずれの側面も、現実のラボで十分に確立されたわけではない。この施設は両方の主張を試すためのより良い環境を作るが、それらを自動的に解決するものではない。
これがAnthropic biology labをめぐる中心的なトレードオフだ。より直接的な実験は、より良いエビデンスとツールを生み出せる一方、安全システムが統治しなければならない能力も高める。
戦略が機能しているかを示す3つのシグナル
Anthropicのラボは、再現可能な結果、信頼できるガバナンス、そして顧客が拡大する同社の役割を受け入れているという証拠によって評価されるべきだ。
第1のシグナルは、独立して再現された実験プログラムだ。Anthropicは、外部の科学者がClaudeによる支援を受けた作業を適切な人間または計算上のベースラインと比較できるよう、十分な詳細を公表する必要がある。
有用な結果には、失敗した設計、リソース使用量、研究者の関与、事前に定めた成功基準が含まれる。選択的なデモンストレーションでは、システムが発見プロセス全体を改善するかどうかは示せない。
再現は、汎用AIが文献レビューやコード生成を超えて貢献できるというAnthropicの主張を強めるだろう。失敗が繰り返されれば、より速い実験サイクルに関する主張は弱まる。
第2のシグナルは、AI主導のラボ作業に関する具体的なガバナンスの枠組みだ。Anthropicは、承認の閾値、機器の権限、監査要件、インシデント対応、顧客プロジェクトと社内研究の分離について説明すべきだ。
この枠組みでは、自動実行と自律的な科学的意思決定を区別する必要がある。両者は異なる運用リスクを生むにもかかわらず、しばしばひとまとめに扱われる。
明確な管理策は、より大きな生物学的能力が責任ある展開と共存できるというAnthropicの主張を支える。不明確な保証では、顧客や安全性研究者はそのバランスを評価できないままとなる。
第3のシグナルは顧客の行動だ。新たな製薬企業との協業、導入の拡大、または独立して説明された本番利用は、買い手がAnthropicのデータと競合に関する境界を受け入れていることを示すだろう。
顧客のためらいも同様に示唆的だ。限定的なワークロードや厳格な除外条件は、製薬企業がAnthropicの社内プログラムを利益相反と見なしていることを示す可能性がある。
読者は、Anthropicが特定の希少疾患や創薬困難な標的に関するプログラムを明らかにするかどうかにも注目すべきだ。プログラム名が示されれば、科学の加速に関する包括的な声明ではなく、測定可能なマイルストーンに戦略が結び付くことになる。
最も重要なマイルストーンは、引き続き前臨床段階にある。再現可能な活性、許容可能な選択性、製造可能性、そして候補化合物をヒト試験へ進められるパートナーシップなどが含まれ得る。
これらの成果は、Claudeが研究室のツールを操作できるようになっただけで実現するものではない。生物学における進展は、実験設計、クリーンなデータ、領域専門知識、そして規律ある解釈に左右される。
開発者にとって、このプロジェクトはエージェントアーキテクチャに対する厳しい試験となる。研究室向けエージェントには、永続的な状態管理、制約された権限、例外処理、そしてモデルと人間による意思決定の完全な履歴が必要だ。
企業の導入担当者は、ガバナンスと証拠の所有権に注目すべきである。自動化されたすべての推奨は、それを生み出したデータ、プロトコル、承認、機器出力とのつながりを維持しなければならない。
この分野を追うナレッジワーカーも、同様の情報課題に直面する。主張、プロトコル、安全性報告、パートナー発表は、分断された情報源にまたがって蓄積していく。
構造化されたknowledge blendingワークフローは、あらゆる発表を同等の証拠として扱うことなく、チームがこうした資料を結び付ける助けとなる。ベンチマーク、研究室での結果、臨床的な証明の違いは、明確に保たれなければならない。
したがって、Anthropic biology labはAI創薬だけを試すものではない。誤りが物理的な影響につながる領域で、フロンティアモデル企業が安全に運用できるかを問う試験でもある。
Anthropicは、Claudeを実験の実行に近づけることで重要な境界を越えた。今後は、より速いサイクルが信頼できる科学、保護された顧客関係、実効性のある安全管理をもたらすことを示さなければならない。
今後数カ月の問いは具体的だ。Anthropicは再現可能な研究室の証拠と明確な運用ルールを公表するのか。それとも、最大級の生物学的主張は管理されたデモンストレーションの中にとどまるのか。



