top of page

中国の研究チームがこれまでで最大の超音波AIデータセットをオープンソース化した — 医療画像AIが二度と同じではないかもしれない

更新日:6月17日

人工知能は、X線、CTスキャン、MRIの画像診断を大きく変えました。しかし、世界で最も多くの人に利用されている画像診断モダリティである超音波検査は、取り残されてきました。

このギャップは偶然ではありません。世界最大のオープンソース医療画像データセットであるNIH ChestX-ray14、MIMIC-CXR、CheXpertは、すべてX線とCTに焦点を当てています。これらのデータセットが存在するのは、西洋の病院システムが胸部X線データを構造化された形式で生成、保存し、最終的に共有するため、匿名化と注釈付けが比較的容易だからです。超音波データは異なります。オペレーター依存であり、機器によって標準化されておらず、プローブを持っている人によって画像品質が大きく異なる臨床コンテキストで収集されます。

その結果、医療画像AIは、世界人口のほんの一部が利用できる画像ツールに最適化されてきましたが、大多数が使用する安価でポータブル、放射線フリーの超音波検査には、大規模なオープンなトレーニングデータがほとんどありませんでした。

浙江大学と香港浸会大学の研究チームが、今年最も重要な医療AIのオープンデータセットとなる可能性のあるUS-365Kを発表しました。このデータセットには、364,000件の超音波画像とテキストのペア、および11,676件の実際の臨床症例が含まれており、CVPR 2026で採択され、HuggingFaceとGitHubで直ちにオープンソース化されました。医療画像AIへの影響は、学術的なベンチマークをはるかに超えています。

何が起こったのか

論文のタイトルは「Ultrasound-CLIP: Ultrasound Image-Text Understandingのための意味論的注意を払った対照的事前学習」です。著者らは、Jiayun Jin、Haolong Chai、Xueying Huang、Xiaoqing Guo、Zengwei Zheng、およびZhejiang University City College、Hong Kong Baptist University、Zhejiang University、および関連臨床機関の研究者たちで構成され、中国全土の病院記録からUS-365Kを構築しました。

このデータセットには、364,000件の超音波画像とテキストのペアが含まれており、臨床レポートのテキストと関連付けられています。主要な解剖学的領域すべてを網羅しています。また、11,676件の完全な臨床症例も含まれています。データの有効性レートは90%を超えており、この規模の臨床データセットとしては異例に高い値であり、大量収集ではなく慎重なキュレーションを示唆しています。

主要なコンピュータビジョンカンファレンスであるCVPR 2026の採択率は約25%です。そこで医療データセットの論文が採択されることは、査読者がデータセットの品質と方法論的貢献の両方を、この分野への真に重要な貢献であると評価したことを示しています。

データセットに付属するモデルであるUltrasound-CLIPは、CLIP(Contrastive Language-Image Pre-training)フレームワークを超音波ドメインに適応させたものです。CLIPは、元々OpenAIによって自然画像用に開発され、一致したペアでのトレーニングを通じて視覚的およびテキスト的表現を整列させることを学習します。超音波に適用すると、スキャンの視覚的特徴とそれを説明するために使用される臨床言語を結びつけることを学習します。論文のベンチマークにおけるパフォーマンス:画像からテキストへの検索@10は37.45%を達成し、これはモデルが3分の1以上の確率でトップ10の結果の中に正しい臨床説明を返すことを意味します。テキストから画像への検索@50は80.22%を達成しました。

データセットとモデルコードの両方がすぐにダウンロード可能です。データ共有契約はありません。機関承認プロセスはありません。待機リストはありません。HuggingFaceから数時間でダウンロードできます。

なぜ医療画像AIはこれまで超音波を無視してきたのか

大規模な超音波トレーニングデータの欠如は、見落としではなく、超音波データを大規模に扱うことが本質的に困難であるという特性の結果です。

X線画像は病院間で似ています。X線生成の物理学は標準化されており、DICOMファイル形式は均一で、胸部X線読影は何十年も同じ方法で教えられてきました。NIHが2017年にChestX-ray14をリリースしたとき、それは実質的に標準化された製品をリリースしたことになります。それに訓練されたモデルは、画像が基本的な視覚的特性を共有しているため、他の病院からの胸部X線に対して合理的にうまく汎化するでしょう。

超音波画像はそのような特性を共有しません。同じ患者の同じ肝臓を、同じ日に異なるオペレーターが異なる機械で撮像した場合、劇的に異なる画像が生成される可能性があります。プローブの角度、圧力、周波数、ゲイン設定、患者の解剖学的構造、オペレーターの技術などがすべて最終的な画像に影響します。超音波で動作する医療画像AIは、X線やCTには存在しない変動を考慮する必要があります。

アノテーションの難しさも同様に深刻です。胸部X線写真のラベリングには放射線科医が必要です。超音波画像のラベリングには、リアルタイムのオペレーターアーティファクトを理解し、2次元断面から3次元解剖学の向きを把握し、プローブ依存のアーティファクトと真の病理を区別できる専門家が必要です。超音波アノテーションの専門家プールは、X線アノテーションの専門家プールのほんの一部です。

2024年に発表された以前の試みであるURFM(超音波表現財団モデル)は、マスク画像モデリングを使用して100万枚以上の超音波画像で事前学習されました。超音波の視覚パターンを認識できましたが、臨床テキストとのペアリングが不足していたため、見たものと臨床医が書くものを関連付けることができませんでした。US-365Kは、まさにその関連性を提供します。364,000枚の画像とテキストのペアは、視覚認識から臨床言語理解への架け橋であり、URFMおよびそれ以前のアプローチが大規模に解決できなかったギャップです。

CLIPの適応は技術的に簡単ではありません。CLIPの元のトレーニングには、インターネットからスクレイピングされたテキストの説明とペアになった自然画像(オブジェクト、シーン、人物の写真)が含まれていました。これらの画像は視覚忠実度が高く、被写体が明確で、画像を見ている人間が自然に言うであろうことを説明するテキストが付いています。超音波画像は粒子状でノイズが多く(スペックルアーティファクトと呼ばれる現象)、かなりの解剖学的専門知識を前提とした臨床言語で説明されています。CLIPスタイルのモデルにこれらの2つのドメインを整合させることを教えるには、単なる規模ではなく、真の方法論的革新が必要でした。

実用的なユースケースは、技術的な課題を具体化します。300ドルのハンドヘルド超音波デバイス(Butterfly iQや類似製品がこの価格帯で販売されています)とUS-365Kでトレーニングされたモデルを備えた、モザンビークの農村部のコミュニティヘルスワーカーは、現在、1日の移動範囲内に専門の放射線科医が存在しない可能性のある肝疾患、甲状腺結節、または胎児異常のスクリーニングを行うことができるかもしれません。利用可能な画像機器と利用可能な診断専門知識の間のそのギャップは、根本的なモデルが能力があり、アクセス可能であれば、まさにAIが埋めることができるものです。US-365Kのオープンソース化は、そのアプリケーションが存在するための前提条件です。

データセットが正しく捉えていること — そしてそうでないこと

US-365Kは、実際のギャップを実際の厳密さで埋めるものです。しかし、これを解決済みの問題として提示することは、データセットができることとできないことの両方を誤って伝えることになります。

US-365Kが優れている点は、その規模です。364,000の画像とテキストのペアを持つUS-365Kは、オープンソースの臨床画像とペアになったテキストの以前のベンチマークであるMIMIC-CXRの約3倍の大きさです。規模は事前学習において重要です。データセットが大きいほど、モデルはより汎化し、異常な入力に対してより穏やかに失敗し、実際の臨床展開を定義する変動に対してより堅牢になります。データセットがすべての解剖学的領域を網羅していること(以前の小規模な超音波データセットが行ったように単一の臓器系に焦点を当てるのではなく)は、2番目に重要な特性です。US-365Kで事前学習されたモデルは、原則として、トレーニングされた特定の臨床コンテキストだけでなく、あらゆる超音波アプリケーションに転送できます。

この規模で90%を超えるデータ有効性率は、別の理由で注目に値します。多くの大規模な医療データセットは、品質を犠牲にして規模を達成しています。つまり、音量の引き換えにノイズの多いラベル、不完全な記録、または曖昧な注釈を受け入れています。90%以上の有効性率は、チームが本物の品質基準を課したことを示唆しており、おそらくかなりの注釈コストがかかったでしょう。残りの10%(約36,000の潜在的にノイズの多いペア)は、事前学習の目的には許容範囲ですが、ラベルノイズが体系的なエラーに累積する可能性のある特定の臨床アプリケーションのファインチューニング時には注意が必要です。

地理的な制約が最も重要な注意点です。US-365Kのすべての臨床症例は、中国の病院からのものです。これは、実際の正当な制約を反映しています。研究チームは中国の病院データにアクセスでき、データ共有に関わる規制上の摩擦を考えると、この規模で中国の臨床データをオープンソース化することはすでに異例の寛大な決定です。しかし、それはデータセットが中国の患者の人口統計、機器のキャリブレーション基準、臨床文書の慣習、および疾患の有病率パターンを反映していることを意味します。US-365Kでトレーニングされたモデルは、中国の臨床コンテキストではうまく機能する可能性がありますが、サブサハラアフリカ、南アジア、またはラテンアメリカ(アクセス可能な診断AIを最も必要としている人口)で確実に機能するには、かなりのファインチューニングが必要になります。

リトリーバル対診断のギャップは、US-365Kを構築することを検討している人にとって最も重要な技術的制約です。公開されている指標はリトリーバルパフォーマンスを測定します。つまり、超音波画像が与えられたときに、モデルは候補セットから正しい臨床説明を特定できるかということです。これは有効で意味のあるベンチマークです。これは診断精度の測定ではありません。つまり、モデルが新しい、未知の症例の臨床的に正しい診断を生成できるかどうかです。リトリーバルパフォーマンスと診断精度の間のギャップは大きく、医療AIの文献で十分に文書化されており、データセットの規模だけでは解決されません。US-365Kの上に臨床アプリケーションを構築する研究者は、適切なアウトカムを測定する前向き検証研究を必要とするでしょう。

US-365Kの正直な特徴付けは、インフラストラクチャを可能にするものとしてです。ImageNet(2009)はコンピュータビジョンを解決しませんでした。それは、GPUを持つ誰もが真剣なコンピュータビジョン研究を可能にしました。US-365Kは超音波AIを解決しません。それは、HuggingFaceアカウントを持つ誰もが真剣な超音波AI研究を可能にします。

医療画像AIにおける既存のものとの比較

医療画像AIのデータセットの状況は、歴史的に西洋の病院システムからのX線およびCTデータに支配されてきました。NIH ChestX-ray14(112,000枚のX線、ペアのテキストなし)およびMIMIC-CXR(放射線レポート付き227,000枚の胸部X線)は、オープンな臨床画像データの規模の標準を設定しました。CheXpert(224,000枚の胸部X線、スタンフォード)は不確実性ラベリングを追加しました。これら3つすべてが胸部X線に焦点を当てています。どれも超音波には規模で及びません。

超音波向けの商用医療画像AI市場には、Caption Health(GEの子会社)、Butterfly Network、Sonioが含まれます。これらはすべて、外部の研究者が利用できない独自のデータセット上に診断モデルを構築してきました。US-365Kは、病院のデータアクセスを持たない学術研究室やスタートアップが、初めて競争力のある超音波AIを構築できるようにするオープンな代替手段を導入します。

Stanford AIMI(AI in Medicine and Imaging)は、公開から数日以内にUS-365Kを推奨リソースとしてカタログ化しました。これは、AIMIのデータセットインデックスを出発点として使用する研究コミュニティでの採用を加速させる機関による承認です。

WHOは、世界中で20億人が基本的な画像診断にアクセスできていないと推定しています。超音波は、現在の価格帯と携帯性において、低リソース環境での画像診断へのアクセスを拡大するための最も現実的な道です。これまで欠けていたのはAIレイヤーでした。これは、専門家ではないオペレーターをガイドし、所見を解釈し、放射線医がいなくても異常をフラグ付けできるモデルです。US-365Kは、その役割を担うモデルを訓練するのに十分な大きさを持つ最初のオープンデータセットです。

次は何が来るか

HuggingFaceの初期のダウンロードパターンは、US-365Kの影響が最初にどこに着地するかを示す最良の先行指標です。東南アジアとアフリカの研究者は、データセットをフォークした最初のグループに含まれています。これは、超音波AIが最も直接的な実用的価値を持つ人々の人口統計と一致しています。特定のアプリケーション(甲状腺スクリーニング、心臓評価、産科異常)を対象としたファインチューニングされたモデルの最初の波は、6か月以内に登場するはずです。超音波AIアプリケーションの進化する状況を追跡している研究者や臨床医は、構造化された「セカンドブレイン」を構築することから恩恵を受けます。セカンドブレインデータセットリリース、モデル公開、臨床的検証研究を、一貫した研究像に統合するため。

地理的偏りの問題は解決可能ですが、意図的な努力が必要です。低・中所得国の研究グループは、米国365Kベースのモデルをそれぞれの臨床的文脈に適応させるために、ローカルに注釈付けされたデータを提供する必要があります。これは技術的な障壁ではなく、調整とリソースの障壁です。浙江大学とアフリカまたは南アジアの臨床機関との提携は、グローバルヘルスエクイティの約束を現実にするために必要なローカライゼーションデータセットを生み出す可能性があります。

規制経路は、米国365Kの公開と規制市場での臨床展開との間の最も重要な障壁のままです。医療AIデータセットは、それらに基づいて構築された製品に対してFDAレビュー(米国)およびCEマーク認証(EU)に直面します。米国365Kでトレーニングされたモデルを、将来的な研究デザインで実際の患者に対してテストし、放射線科医のグラウンドトゥルースに対して感度と特異度を測定する、将来的な臨床的検証が、必要な証拠基準です。米国365Kはその研究を可能にしますが、それを完了させるものではありません。

資金調達の側面もここで重要です。医療AIの将来的な検証研究は高価です。患者の登録、放射線科医のグラウンドトゥルース注釈、IRBの承認、そして通常は公開前の12〜24ヶ月のデータ収集が必要です。米国365Kをダウンロードした学術ラボはトレーニングデータを持っていますが、将来的な検証を実行するための臨床的提携や資金を持っていない可能性があります。「米国365Kでモデルをトレーニングした」と「このモデルがスクリーニング使用に安全であるという臨床的証拠がある」との間のギャップは、助成金、病院の提携、およびデバイスメーカーとの商業関係によって埋められます。Butterfly Network、GE HealthCare、および同様の企業は、このギャップを埋めるための臨床研究インフラストラクチャと規制経験を持っていますが、それらは潜在的な競合相手でもあり、基盤となるモデル技術を専有のままにしておくことを好むかもしれません。

データセットの中国起源は、西側市場をターゲットとする開発者にとって規制上の疑問も提起します。医療機器としてのAI/ML(SaMD)に関するFDAのガイダンスでは、開発者はトレーニングデータの出所、データが収集された臨床的文脈を含むことを文書化する必要があります。米国病院でのスクリーニングのために展開された中国の臨床データでトレーニングされたモデルは、中国の疾患の有病率、機器のキャリブレーション基準、および臨床文書の実践が米国の患者集団を十分に代表しているかどうかについての疑問に直面するでしょう。これは決定的な問題ではありませんが、追加の検証証拠の要件ですが、開発者が計画を立てる必要がある考慮事項です。

より長期的な可能性が最も興味深いものです。もしUS-365Kでトレーニングされたモデルが、特定のスクリーニングタスクにおいて経験豊富な超音波検査士と同等の感度と特異度を示す臨床的有用性を実証した場合、それは世界中のヘルスケアシステムにポータブル超音波インフラへの投資を促すことになります。AI機能はハードウェア展開を可能にします。ハードウェア展開はアクセスを拡大します。アクセス拡大は新しいデータを生成します。新しいデータはモデルを改善します。このサイクルが始まるかどうかは、今後6ヶ月の研究が投資を動機づける結果を生み出すかどうかにかかっています。

US-365Kのリリースは、AI開発における繰り返されるパターンを反映しています。重要なインフラストラクチャがオープンでアクセス可能になると、下流のイノベーションのペースが急激に加速します。ImageNetは、コンピュータビジョンモデルの世代を可能にしました。MIMIC-CXRは、大規模な胸部X線AIを可能にしました。US-365Kも超音波で同様のことを行う可能性があります。

その結果に対する制約は技術的なものではありません。データセットと方法論は健全です。制約は、グローバルな研究コミュニティが、データセットのオープンソース化が可能にするものの、自動的に完了しないファインチューニング、検証、展開作業を行うためのリソースと臨床パートナーシップを持っているかどうかです。

AIとヘルスケアにおける急速な研究開発の動向を追跡することは、構造化されたアプローチが成果を上げる知識管理の課題にまさに該当します。研究者や実務者が、AIヘルスケアデータセットの開発に関する情報を収集、接続、および活用するのに役立つツールは、ブレークスルーに関する読み物から、それを利用することへの移行を容易にします。AIヘルスケアデータセットの開発は、ブレークスルーに関する読み物から、それを利用することへの移行を容易にします。

よくある質問

US-365Kとは何ですか?

US-365Kは、浙江大学と香港浸会大学の研究者によって構築された、364,000の画像とテキストのペアおよび11,676の完全な臨床症例を含むオープンソースの超音波AIデータセットです。これは、CVPR 2026で採択された、これまでで最大のオープンソース超音波データセットであり、HuggingFaceとGitHubでアクセス制限なしですぐに利用可能です。

Ultrasound-CLIPとは何ですか?

Ultrasound-CLIPは、US-365Kに付属するAIモデルです。OpenAIのCLIP(Contrastive Language-Image Pre-training)フレームワークを超音波ドメインに適応させ、超音波画像と病院レポートからの臨床テキスト説明を一致させることを学習します。本論文のベンチマークでは、37.45%の画像からテキストへの検索(@10)と80.22%のテキストから画像への検索(@50)を達成しています。

US-365Kは既存の医療画像データセットと比較してどうですか?

364,000の画像とテキストのペアを持つUS-365Kは、テキストとペアになった227,000枚の胸部X線画像を持つMIMIC-CXR(以前のオープンソース臨床画像とペアテキストのベンチマーク)の約3倍の大きさです。単一の臓器系に焦点を当てた以前のデータセットとは異なり、US-365Kは主要な解剖学的領域すべてをカバーしており、それに基づいて事前学習されたモデルは、あらゆる超音波アプリケーションに転移させることができます。

US-365Kは現在、臨床診断AIの構築に使用できますか?

直接的にはできません。このデータセットは、超音波画像と臨床言語を接続できるモデルの事前学習を可能にしますが、検索パフォーマンス(US-365Kが測定するもの)と診断精度(臨床展開に必要なもの)の間のギャップは大きいです。US-365Kに基づいて構築された製品は、FDAまたはCEマークの承認を得る前に、放射線科医のグラウンドトゥルースを測定する前向き臨床検証研究を必要とします。

医療画像AIの次のランドマークは、別のデータセットリリースではありません。それは、実際の臨床設定で、実際の患者を使用して、臨床医にとって重要な結果を測定し、US-365Kでトレーニングされたモデルの前向き検証が初めて公開されることです。その論文(いつか発表されるでしょう)は、2026年4月が超音波AIが真剣になった瞬間だったのか、それとも単に有望な始まりに過ぎなかったのかを教えてくれるでしょう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page