top of page

RETFound網膜年齢モデルは片眼画像から老化を読み取るが、まだ臨床的な時計ではない

9月18日
読了時間: 17分

RETFound網膜年齢モデルは、カラー眼底写真1枚から個人の年齢を推定し、平均誤差は2.85年だった。研究者らは、UK Biobankの参加者71,343人の画像を用いてこのシステムを訓練した。しかし、より重要な出力は年齢推定値そのものではない。推定値と本人の暦年齢との乖離である。

この網膜年齢ギャップは、心血管代謝特性、炎症、認知機能、死亡率、認知症、がん、心血管疾患と関連していた。査読済み研究では、男性と女性で異なる生物学的パターンも確認された。これらの知見により、眼は孤立した器官というより、全身的な老化を測定可能な形で記録するものとして捉えられる。

ただし、関連性は診断ではなく、3年程度の誤差が個人予測を臨床的に決定的なものにするわけでもない。中心となる論点は、手軽な画像バイオマーカーと、医療判断に求められる検証基準との間にある。研究者らは、写真1枚に驚くほど多くの健康情報が含まれることを示した。一方で、あらゆる診療所がその情報を安全に解釈できることは、まだ示されていない。

RETFound網膜年齢モデルは1枚の写真を老化シグナルへ変換する

この研究は、日常的な眼底画像をコンパクトな老化指標へ変換し、その指標が何を表すのかを検証している。

カラー眼底写真は、眼底にある網膜、視神経乳頭、黄斑、そして観察可能な血管を捉える。眼科ではすでに、糖尿病網膜症や黄斑変性症などの評価のためにこうした画像を収集している。この検査は非侵襲的で、通常の画像検査の予約内で実施できる。

研究チームは、網膜画像で事前学習された基盤モデルであるRETFoundを微調整し、暦年齢を予測させた。基盤モデルは、研究者がより狭い課題に適応させる前に、再利用可能な視覚パターンを学習する。この手法では、ゼロからモデルを構築する場合と比べて、課題固有の訓練データ量を削減できる可能性がある。

モデルは、UK Biobank参加者71,343人の眼底画像を分析した。研究のUK Biobank記録によると、予測の平均絶対誤差は2.85年だった。平均絶対誤差は、過大推定と過小推定を区別せず、予測年齢と記録年齢の平均的な差を表す。

この結果は、すべての推定が2.85年以内に収まったことを意味しない。より近い予測もあれば、より大きく外れた予測もある。この集計値は研究コホート全体の性能を要約したものであり、特定の患者に対する精度を保証するものではない。

年齢予測は、最終的な臨床的主張ではなく出発点としても機能した。研究者らは、モデル推定値から暦年齢を差し引くことで、各参加者の網膜年齢ギャップを計算した。正のギャップは、網膜が予想より高齢に見えることを、負のギャップは若く見えることを示した。

この差は重要である。暦年齢で訓練されたモデルであっても、健康状態、環境、遺伝の影響を受ける特徴を捉える可能性があるためだ。血管径、組織の見え方、視神経乳頭の構造、その他の微細なシグナルは、年齢とともに変化し得る。疾患や生活習慣の要因も、その一部の構造を変化させる可能性がある。

そこでチームは、予測誤差を潜在的な生物学的情報として扱った。網膜年齢ギャップを、臨床的特性、健康アウトカム、認知指標、遺伝データと比較した。このギャップは、暦年齢そのものを超えて、複数の老化関連特性や疾患と関連していた。

これにより、システムの目的は変わる。単純な年齢推定器であれば、印象的なコンピュータービジョンの実演にすぎない。再現性のある網膜年齢ギャップは、集団間の健康差を研究するために用いられる測定可能な特性、すなわち研究表現型になり得る。

単一画像という設計は、血液や組織のサンプルを必要とする生物学的時計ともこのモデルを区別する。眼底撮影は、眼科や糖尿病眼検診ですでに一般的だ。こうした既存インフラにより、別の侵襲的検査を追加せずに追加シグナルを収集する現実的な経路が生まれる。

それでも、この写真が個人の普遍的な生物学的年齢を直接示すわけではない。1つの撮影方式で、ある瞬間の1つの器官を記録しているにすぎない。モデルはその視覚的特徴を年齢のような出力へ圧縮する。この違いは、結果が何を裏付けられるのかを考える際に決定的となる。

なぜ網膜年齢ギャップは予測された誕生日より重要なのか

臨床的に興味深い問いは、AIが年齢を当てられるかではなく、その誤差が隠れた健康上の違いを一貫して明らかにするかどうかである。

60歳の人を64歳と予測したモデルは、暦年齢に対して4年の誤差を生じさせている。研究者は同時に、この結果をより高齢に見える網膜として解釈できる。同様のギャップが疾患や将来のアウトカムと繰り返し連動するなら、その誤差は単なる統計的ノイズではなく、候補バイオマーカーとなる。

新たな研究は、網膜年齢ギャップと心血管代謝特性、炎症、認知機能、全死因死亡率、認知症、がん、心血管疾患の新規発症との関連を報告している。新規発症疾患とは、初回評価後に記録された病態を指す。既存診断の一時点のスナップショットより多くの情報をもたらすが、それでも因果関係を立証するものではない。

網膜は、手術なしに神経組織と血管組織を観察できる珍しい窓である。そこに見られる変化は、血管、代謝、神経系に影響するプロセスを反映し得る。この生物学的な位置づけは、研究者が眼科以外のアウトカムに対して網膜画像の検証を続ける理由を説明する。

先行研究も同様の結論に達している。Googleの研究者らは、数十万枚の網膜画像を用いてeyeAgeモデルを開発し、別のデータで検証した。同社の網膜老化時計は、暦年齢と相関する推定値を生成し、より高齢の予測値を複数の健康指標と関連付けた。

この先行システムは、予測年齢と暦年齢の間でPearson相関係数0.87を報告した。また、その研究集団では、より高いeyeAge測定値が全死因死亡率と関連していた。Googleは、繰り返し撮影した写真から網膜変化の方向と速度を明らかにできるため、縦断的画像データが特に有用だと位置付けた。

RETFoundの研究は、大規模なUK Biobank解析と網膜基盤モデルを通じて、この研究の流れを拡張している。また、遺伝データと性別特異的な分析も統合している。結果は、単に予測誤差の最小化を競う別の競争ではない。

むしろ研究は、網膜老化が生物学的に意味のある表現型を形成するかを問うている。ゲノムワイド解析では、長寿、代謝、神経変性、加齢関連眼疾患に関係するシグナルが特定された。遺伝的関連は、どの生物学的経路が画像由来の測定値に寄与するのかを研究者が調べる助けとなる。

しかし、遺伝学はモデルを臨床検査として自動的に妥当化するものではない。統計的に関連する変異が説明できる変動は、ごく一部にとどまる可能性がある。また、全身の老化を表すのではなく、眼の構造に関連しているだけかもしれない。研究者は、有用な生物学的手がかりと臨床的に行動可能な効果を区別しなければならない。

同じ注意は疾患との関連にも当てはまる。糖尿病、高血圧、喫煙、服薬、社会経済的状況は、網膜の見え方に影響し得る。それらは心血管および認知アウトカムにも影響し得る。そのためモデルは、独立した老化メカニズムを発見するのではなく、視覚的な代理指標を通じて既知のリスク因子を捉えている可能性がある。

この可能性がシグナルを無用にするわけではない。容易に収集できる代理指標でも、既存の測定値に加えて情報をもたらすなら、スクリーニングや研究を支援できる。決定的な問いは、年齢、血圧、検査結果、病歴、既存のリスクスコアを考慮した後にも、網膜年齢が意思決定を改善するかどうかである。

現時点で最も強い解釈は、より限定的だ。RETFoundは、眼底写真1枚から年齢関連の表現を抽出できる。その表現内の差異は、集団レベルで複数の健康的・生物学的特性に対応している。

性別特異的な結果は、単一の生物学的時計という考えを複雑にする

男性と女性で異なる臨床的・解剖学的な関係が示されたため、モデルの出力は単一で普遍的な老化プロセスを表してはいなかった。

研究者らは、性別で層別化したモデル間で同程度の年齢予測性能を報告した。しかし、網膜年齢ギャップの背後にある生物学的シグネチャーは分岐していた。男性では、より高い網膜年齢がメタボリックシンドロームとより強く関連していた。女性では、モデルのアテンションと遺伝的証拠が網膜血管をより強く重視していた。

モデルのアテンションとは、予測に強く寄与する画像領域を特定する手法を指す。これらのマップは、システムが何を利用しているのかについて手がかりを与え得る。ただし、その推論を完全に因果的に説明するものではない。

研究ではさらに、女性の網膜老化パターンが閉経移行期をまたいで変化することも示された。閉経後の参加者は、より高い網膜年齢ギャップ値を示した。その臨床的関連は、男性で観察されたパターンにより近くなった。

これらの結果は、魅力的な製品ストーリーに疑問を投げかける。網膜年齢を、すべての人を横断して比較できる単一の数値として売り出すことは容易だろう。しかし研究は、同じ出力がグループごとに異なる生物学的要素の混合を反映し得ることを示唆している。

ある集団における4年のギャップは、主に代謝特性を反映しているかもしれない。別の集団では、血管構造やホルモン変化がより強く寄与する可能性がある。予測精度が同程度に見えても、モデルは異なるシグナルに依存している可能性がある。

この問題は性別を超えて広がる。民族性、カメラのハードウェア、撮影プロトコル、散瞳の有無、画像品質、疾患の有病率は、いずれも網膜モデルに影響し得る。眼科医療へのアクセスの違いも、訓練データセットにどの患者が含まれるかを左右し得る。

UK Biobankは価値ある縦断的リソースだが、世界人口の無作為標本ではない。そのボランティアは、英国の一般人口より健康的な傾向がある。年齢範囲、祖先集団の分布、臨床環境は、他地域の地域診療所で遭遇するものと異なる可能性がある。

RETFoundに関する別の調査は、この懸念を示している。研究者らは、健康なUK Biobank参加者9,668人を対象に、カラー写真、光干渉断層計、そして統合モデルを用いて網膜年齢予測を評価した。この人口統計学的バイアス研究では、バイアスが人口統計グループと画像モダリティの両方に依存することが判明した。

統合システムの平均絶対誤差は3.01年だった。写真のみのモデルは3.40年、光干渉断層計モデルは4.37年に達した。研究者らは、写真モデルで有意な性差を、断層撮影モデルで民族性による差を確認した。

両方の画像タイプを組み合わせることで、その分析では統計的に有意な性別および民族性の差が解消された。しかし、そのためにはより多くの機器とデータが必要となった。マルチモーダルモデルは、単純な写真1枚のスクリーニングツールとして提示しにくい。

この教訓は、性別固有のモデリングが必ず失敗するということではない。平均精度は、集団レベルの挙動を覆い隠し得るということだ。システムは全体として許容可能な誤差を示しながら、ある集団を一貫して過大評価し、別の集団を過小評価する可能性がある。

出力が加速した老化として解釈される場合、このようなキャリブレーションは重要になる。持続的な集団レベルの偏りは、健康な人を実年齢より高齢と見なしたり、別の人々における高いリスクを見えにくくしたりする可能性がある。それは統計的なアーティファクトを、見かけ上の生物学的結論へと変えてしまう。

開発者は、網膜年齢を個々の患者に提示する前に、サブグループ別の報告、キャリブレーション検証、外部検証を行う必要がある。臨床インターフェースも、文脈なしに正確な年齢を表示するのではなく、不確実性を示すべきだ。

メカニズムは効率的だが、その意味はなお議論の途上にある

RETFoundは特徴抽出を効率化する一方、得られる数値は暦年齢の予測、臓器の老化、全身的リスクの間に位置する。

このモデルはまず、網膜データから学習した視覚表現を用いる。研究者はその表現を年齢予測向けにファインチューニングする。これによりネットワークは、血管、組織の質感、視神経乳頭、その他の構造に関するパターンを再利用できる。

このプロセスは、既知の分子や解剖学的特徴を測定することとは異なる。たとえば検査室の検査では、定義された化学的手順によりグルコース濃度を定量できる。深層学習による年齢モデルは、人間が容易に切り分けられないパターンも含め、多数の視覚的特徴を組み合わせる。

研究者は注意マップを調べ、出力を健康記録と比較し、関連する遺伝的変異を研究できる。こうした手法は解釈を改善する。しかし、個々の推定において各ピクセルがどのように寄与するかを完全に説明するものではない。

ラベルにも別の複雑さがある。システムは、利用可能で客観的な情報である暦年齢から学習する。しかし生物学的年齢は、単一の受け入れられた定義を持つ直接観測可能なグラウンドトゥルースではない。

誕生日を再現するよう訓練されたモデルが生物学的時計となるのは、その乖離が再現可能な健康情報を持つ場合に限られる。この変換には、コホート、デバイス、人口統計学的集団、時間をまたぐ証拠が必要だ。また、より単純な臨床指標との比較も求められる。

公表済みの文献には、Retinal Age、eyeAge、RetiAGE、その他の畳み込みモデルを含む複数の網膜老化システムがすでに存在する。網膜年齢に関するレビューでは、データセット、検証手法、モデル定義、対象アウトカムに有意なばらつきがあることが示された。

これらのシステムは、必ずしも同一の現象を測定しているわけではない。あるモデルは血管パターンを重視し、別のモデルは視神経乳頭や組織の特徴により強く依存する可能性がある。画像前処理の選択によっても、どの情報が利用可能なまま残るかは変わり得る。

そのため、直接比較は難しい。両方のシステムが妥当な平均精度を示していても、同じ人が2つのシステムから異なる網膜年齢を受け取る可能性がある。調和されたベンチマークがなければ、どちらの出力にも普遍的な臨床的解釈はない。

「年齢」という言葉は、この測定を実際以上に確実なものに見せる可能性もある。患者は暦年齢を固定された事実として理解する。網膜推定値は、学習データ、画像品質、モデルアーキテクチャ、キャリブレーションによって形作られる確率的スコアである。

より安全な捉え方は、網膜年齢を画像バイオマーカーとして扱うことだ。これは加齢に関連する視覚情報を要約し、他の証拠と組み合わせればリスク層別化を支援する可能性がある。医療評価を置き換えたり、寿命の予測として単独で用いたりすべきではない。

縦断データは、その意味を明確にし得る。個人の網膜年齢ギャップが、血圧管理、禁煙、その他の介入後に変化した場合、研究者はその変化がアウトカム改善と連動するかを検証できる。安定した反復測定は、そのシグナルが通常の画像変動を上回るかどうかも示すだろう。

ただし、介入研究には高い基準が求められる。モデルスコアの変化が、必ずしも老化の減速を意味するわけではない。カメラ、前処理パイプライン、画像品質が変化しただけかもしれない。研究者は技術的な再現性と生物学的な応答性の両方を示す必要がある。

したがって、このモデルの短期的な最大の価値は研究にあるかもしれない。科学者が大規模コホートを網膜老化パターンで分類し、遺伝的経路を探り、仮説を生み出す助けになる。臨床利用には、意思決定と患者アウトカムに焦点を当てた別の証拠層が求められる。

網膜年齢の結果が立証していないこと

この研究が支持するのは集団レベルの関連であり、自律的な診断や、疾病・死亡に関する個別予測ではない。

第一の限界は一般化可能性だ。主な分析はUK Biobankのデータを用いており、そのコホートでの性能が他の環境で同等の結果を保証するわけではない。医療システムごとに、カメラ、ワークフロー、画像解像度、品質管理は異なる。

医療画像では、モデルがデバイス固有のシグナルを学習する可能性があるため、外部コホートが特に重要となる。色調バランスや視野の変化が予測を変える可能性がある。導入先の集団に学習群より多くの眼疾患がある場合、性能も低下し得る。

第二の限界は交絡だ。網膜の外観と加齢関連のアウトカムには、多くの共通する影響要因がある。喫煙、糖尿病、高血圧、肥満、薬剤使用、社会的剥奪はいずれにも影響し得る。統計的調整はこの問題を軽減するが、完全に取り除くことはほとんどない。

第三の限界は逆方向の解釈に関するものだ。より高齢に見える網膜は、将来の疾患を引き起こす根底プロセスではなく、既存の疾患による損傷を反映している可能性がある。画像は依然として有益な情報を持ち得るが、関係の方向性によって臨床家が導くべき結論は変わる。

第四の限界は測定の安定性だ。診療現場では、反復撮影、カメラモデル、技師、位置決めのわずかな違いをまたいでも、スコアが一貫するかを知る必要がある。日常的な技術的変動が大きな年齢シフトを生むなら、バイオマーカーはフォローアップの指針にならない。

第五の限界はコミュニケーションだ。網膜が8歳高く見えると伝えられた患者は、身体がさらに8年分老化したと受け取るかもしれない。この研究はそのような文字通りの結論を正当化しない。また、誰かがどれだけ長く生きるかを判断することもできない。

偽の安心感は反対のリスクをもたらす。網膜年齢が若く推定されても、高コレステロール、高血圧、家族歴、症状といった高いリスクは打ち消されない。単一の好ましいバイオマーカーが、確立された臨床的証拠を上回るべきではない。

プライバシーにも注意が必要だ。網膜画像は、スクリーニング対象の状態以上の情報を明らかにし得る。研究では、眼底写真から年齢、性別、喫煙関連シグナル、心血管系の特性、疾患情報が抽出されている。患者は、1枚の画像がこれほど多くの推論を支えるとは想定していないかもしれない。

医療機関が保存画像を新たな予測に再利用するなら、明確な同意およびガバナンスのルールが必要になる。アクセス制御は、写真の当初の目的だけでなく、推定される情報の機微性を反映すべきだ。

規制上の位置付けもまた境界線となる。査読済みの関連研究は、診断やスクリーニングのためのモデル利用を認可するものではない。臨床製品には、明確な使用目的、品質管理、検証エビデンス、モニタリング、適切な規制審査が必要となる。

前向き試験は決定的に重要となる。研究者は、過去の記録だけを分析するのではなく、実際の診療現場を受診する患者でモデルを評価すべきだ。この設計により、撮影失敗、ワークフローへの影響、臨床家の反応、患者への結果を測定できる。

関連する評価項目も、提案される用途と一致しなければならない。モデルが心血管スクリーニングの改善を目的とするなら、確立されたツールを超えてリスクを見いだせるかを試験で評価すべきだ。老化研究を目的とするなら、再現性と変化への感度が中心となる。

これらの限界は、この研究の貢献を消し去るものではない。情報価値のある研究シグナルと、信頼できる医療機器との距離を定義するものだ。網膜AIは、この距離を無視するのではなく測定できる段階まで進歩している。

網膜年齢が研究室を出られるかを示す3つのシグナル

外部検証、反復画像撮影、意思決定に焦点を当てた試験が、網膜年齢が研究コホートを超えて有用になるかを決める。

第一のシグナルは、集団とカメラシステムをまたぐ独立した検証だ。研究者は、新しい病院ごとに再学習することなく、同じ固定済みモデルを試験すべきである。祖先集団、年齢層、疾患、デバイスをまたいだ安定したキャリブレーションは、RETFoundが転用可能な生物学を捉えているという主張を強める。

性能低下は研究結果を無効にするものではない。それは、地域ごとのキャリブレーションやマルチモーダル入力が依然として必要であることを示す。開発者は、単一の総合精度指標だけでなく、サブグループ別の誤差と年齢ギャップ分布を公表すべきだ。

第二のシグナルは縦断的な信頼性である。同一人物は、同等の条件で近い時期に撮影された画像から、類似した結果を得るべきだ。より長い期間では、変化はランダムな画像変動ではなく、意味のある臨床的または生物学的変化に対応すべきである。

反復画像撮影は、網膜老化が静的なスコアではなく軌跡であるかどうかも明らかにし得る。これは、生活習慣の変化、治療、疾患進行に関する研究を支えるだろう。同時に、どの変化が可逆的で臨床的に重要なのかという、より難しい問いも生む。

第三のシグナルは、そのスコアが実際の意思決定を改善するという証拠である。有用な試験では、日常的な眼科画像撮影後に、網膜年齢が心血管評価を必要とする人の特定に役立つかを検証できる。別の試験では、認知検査や確立されたバイオマーカーと並行して、認知症リスク研究に価値を加えるかを調べられる。

成功には統計的有意性以上のものが必要だ。モデルは、追加の複雑さを正当化できるほど、検出、優先順位付け、またはアウトカムを改善すべきである。また、不均一な誤差率やアクセスを通じて格差を拡大しないことも求められる。

競争上の圧力は、他のAI企業よりも従来型のリスク評価に向けられる。既存ツールは、病歴、検査値、バイタルサイン、検証済みの臨床スコアを用いる。網膜AIは、その低摩擦な画像シグナルが、これらの入力を間接的に言い換えるだけでなく、新たな情報を加えることを示さなければならない。

臨床家、開発者、AI導入担当者にとって、適切な対応は慎重な注目だ。網膜年齢ギャップを個人の健康に関する確定的な判断として扱う前に、外部検証、サブグループ別キャリブレーション、前向き試験を追跡すべきである。急速に拡大するエビデンス基盤を整理する研究者にとっては、構造化されたAI knowledge baseが、モデルのバージョン、コホート、限界を結び付けて管理する助けになる。

1枚の眼底写真は今や、加齢に関連する網膜パターンについて信頼できる推定を支えている。未解決の問いは、そのパターンが安全に医療を改善できるかどうかだ。予測誤差の低下だけでなく、再現性と臨床的意思決定に関するエビデンスを注視すべきである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page