top of page

Shanghai Academy of AI for ScienceがShenZhenを公開、「大きいほど良い」モデルに挑戦

Shanghai Academy of AI for Scienceは、6種類の科学データを扱えるよう構築された約110億パラメータのモデルShenZhenを公開した。Shanghai Academy of AI for ScienceのShenZhenマルチモーダル基盤モデルは、DNA、RNA、タンパク質、低分子、地球システム、医用画像を網羅する。

この対象範囲が、中心的な緊張関係を生み出している。科学AIは通常、1つの領域、データ構造、または予測対象に特化して設計されたモデルによって進歩してきた。Monkey King BangまたはMKBとも呼ばれるShenZhenは、それとは異なり、1つの共有言語・視覚バックボーンの周囲に領域固有のコンポーネントを配置する。

同アカデミーによれば、この小規模な統合システムは、20の生物学的理解ベンチマークの半数で、約1兆パラメータの科学モデルと同等以上の性能を示した。また、分子、気象、医用画像でも競争力のある結果を報告している。これらの比較は、科学AIは主に、より大規模な汎用モデルによってスケールさせなければならないという前提に疑問を投げかける。

今回の公開によって、1つのモデルが特化型科学システムを置き換えられると立証されたわけではない。ベンチマークは開発チームによるものであり、報告された結果の多くは、独立した研究による検証がまだ行われていない。それでも、公開されたウェイトとコードにより、外部の研究者はこのより広範な主張を実際に検証できる。

ShenZhenマルチモーダル基盤モデルは6種類の科学データを接続する

ShenZhenが重要なのは、科学データを周縁では個別のものとして扱いながら、モデルの中心では相互に接続しているためだ。

このモデルは、Qwen3-VL-8B-Instructを共有バックボーンとして使用する。個別のエンコーダーとデコーダーが、情報がバックボーンに到達する前に、各科学モダリティの構造を保持する。同アカデミーによれば、システム全体には約110億のパラメータが含まれる。

この設計では、すべての入力を通常のテキストトークンに変換することを避けている。DNAとRNAには、配列順序を保持するモデルが必要だ。低分子には、原子と化学結合の表現が求められる。気象データには時間とともに変化する空間場が含まれ、医用画像は微細な局所構造に依存する。

ShenZhenは、こうした異なる入力を特化型コンポーネントに振り分ける。そのモデルドキュメントでは、タンパク質にESM-2、DNAとRNAに畳み込みTransformerコンポーネント、分子にグラフエンコーダーを使用していることが示されている。また、Swin-ViTの気象コンポーネントと、SAMベースの医用画像経路も備えている。

モダリティルーターは、タスクごとに適切な経路を選択する。特化型コンポーネントが入力を共有バックボーンで処理可能な表現に変換し、対応するデコーダーがテキスト、科学的配列、空間場、または画像マスクを生成する。

このアーキテクチャは理解と生成の両方に対応するが、すべてのモダリティで同程度に対応しているわけではない。このモデルは、タンパク質、RNA、DNA、分子、テキストの入力を分類または分析できる。また、RNA配列、分子のSMILES文字列、気象予報、医用画像セグメンテーション、テキストを生成できる。

SMILESは、分子構造をコンピューターで読み取れる形式で表現するためのテキスト表記法である。画像セグメンテーションは、指定された解剖学的構造や異常に属するピクセルを特定する。推論層が共有されていても、これらの出力には異なるデコーダーが必要となる。

したがって、今回の公開は、複数のファイルリーダーを備えた科学チャットボット以上のものを意味する。そのコンポーネントは、研究者が下流のソフトウェアに渡せるネイティブな科学出力を生成する。生成された気象場やセグメンテーションマスクは、同じデータを文章で説明したものとは異なる実用的価値を持つ。

このアプローチは、科学論文、グラフ、図表を従来型の視覚言語トレーニングパイプラインに組み込むモデルともShenZhenを区別する。そのようなシステムは、DNA塩基、分子結合、大気グリッドを直接モデル化せずに、科学的内容に関する質問へ回答できる。

同アカデミーは、モデルウェイト、推論コード、サンプルスクリプト、設定ファイル、入力ガイダンスを公開している。研究者はHugging FaceとGitHubから資料を入手でき、中国のNovaInspireプラットフォームでも追加のアクセス手段が提供されている。

モデルページには、ほとんどのコンポーネントについてApache 2.0ライセンスが記載されている。ただし、医用セグメンテーションのブランチには、Metaの別個のライセンスが適用されるSAM関連ウェイトが含まれる。完全なパッケージを導入する前に、ユーザーはこれらの制限を確認する必要がある。

今回の公開は、ShenZhenを、同アカデミーが2026年3月に発表した科学研究エージェントDashengとも結び付ける。Dashengは、自然言語による要求を通じてモデルとツールを連携させる。ShenZhenは現在、そのシステム内の複数の科学的操作に共通するモデリング層として機能している。

この背景から、同アカデミーにとって統合が重要である理由が分かる。すべてのタスクに無関係なモデル、環境、インターフェース、出力形式が必要になると、研究エージェントの運用は難しくなる。共有バックボーンは、各領域固有の構造を失うことなく、その断片化を軽減できる。

110億パラメータのモデルがスケール優先アプローチに圧力をかける

最も重大なベンチマークは、単一のスコアではない。ShenZhenが、自身のほぼ100倍の規模を持つモデルに対して示したと報告されている性能である。

同アカデミーは、DNA、RNA、タンパク質、生物学的配列間の関係に関する20のタスクで、生物学的理解を評価した。その結果、ShenZhenは9つのタスクで首位となり、17のタスクで上位2位以内に入ったと報告している。

80億パラメータのテキストトークン型ベースラインであるBiology-Instructionsに対し、ShenZhenは20タスク中16タスクでより高いスコアを記録したとされる。この比較は、バックボーンの規模が比較的近い場合に、科学エンコーダーが持つ価値を裏付ける。

より挑発的なのは、Intern-S1-Proとの比較である。その開発者は、Intern-S1-Proを約1兆パラメータのMixture-of-Experts科学モデルと説明している。Mixture-of-Expertsモデルは、各入力をネットワーク全体の一部だけに通すことで、各トークンに必要な計算量を削減する。

公開情報によると、生物学タスクではShenZhenとIntern-S1-Proがそれぞれ10タスクで相手を上回った。この結果は、両モデルが同等であることを意味しない。しかし、パラメータ数だけでは科学的能力を十分に測れないことを示唆している。

Intern-S1-Proは、より直接的にスケール優先の道をたどっている。その前身であるIntern-S1は、2410億パラメータのMixture-of-Expertsアーキテクチャを採用し、280億のアクティブパラメータを備えていた。チームは、2.5兆を超える科学トークンを含む、5兆のマルチモーダルトークンによる継続的な事前学習を報告している。

現在のIntern-S1リポジトリでは、Intern-S1-Proを科学的推論向けの1兆規模モデルとして紹介している。その対象範囲には科学テキストと画像が含まれており、重要な比較対象となる。そのアーキテクチャとトレーニング戦略は、ShenZhenの領域ルーティング設計とは大きく異なる。

生物学的比較を解釈する際には、こうした違いが重要となる。ShenZhenは科学的構造に合わせて選択されたエンコーダーを使用する一方、Intern-S1-Proははるかに大きな規模で、より広範な科学的推論を追求する。焦点を絞ったベンチマークでは、その入力形式により密接に適合したアーキテクチャが有利になる可能性がある。

ShenZhenが報告した生物学分野での最も優れた結果は、配列構造が中心となるタスクで多く見られる。300塩基対のDNA配列におけるプロモーター検出では、MCCスコア91.17を記録した。MCCは、クラスの不均衡を考慮しながら分類品質を測定する。

また、RNA修飾タスクで96.03のAUC、ノンコーディングRNA機能で91.46パーセントの精度を報告している。タンパク質安定性では、70.63のSpearman相関に達した。これらの指標は異なる能力を測定するものであり、1つの総合的な知能スコアにまとめるべきではない。

すべての結果で一様に優勢だったわけではない。Intern-S1-Proは、タンパク質蛍光、酵素分類、1つのRNAアイソフォームベンチマークなどのタスクでリードした。Biology-Instructionsも、エンハンサー活性と1つのクロスモーダル配列タスクでShenZhenをわずかに上回った。

このばらつきのある傾向は、全面的な優位性を主張するよりも、今回の発表に信頼性を与えている。アーキテクチャ上の特化によって一部のタスクでは大幅な向上が得られる一方、他の領域におけるスケールの優位性が失われるわけではないことを示している。

したがって、非常に大規模な科学基盤モデルを構築するチームには圧力がかかる。追加のパラメータによって、より優れた科学的表現を持つ小規模システムでは実現できない能力が得られることを示さなければならない。モデルの規模だけでなく、ベンチマークの幅、転移性能、研究上の有用性がより重要になる。

同じ圧力は、対象を狭く絞った特化型プロジェクトにも及ぶ。統合モデルが導入を簡素化しながらその精度に迫るなら、特化型モデルは運用の複雑さを正当化しなければならない。その最大の強みとなるのは、実験による検証、領域の深さ、実際の実験室環境における信頼性だろう。

ネイティブな科学エンコーダーこそが真のメカニズム

ShenZhenの中心的なアイデアは、普遍的なトークン化ではなく、アーキテクチャによる分業である。

汎用マルチモーダルモデルは通常、テキスト、画像、場合によっては音声を共有表現空間へ投影する。この戦略が機能するのは、それらのモダリティに、大規模なニューラルネットワークがスケールによって整合できるパターンが含まれているためだ。科学データは、より難しい問題をもたらす。

タンパク質配列は、単に異なるアルファベットで書かれた文章ではない。そのアミノ酸は、複数のスケールにまたがる関係を通じて、折り畳み、安定性、結合、機能に影響を及ぼす。分子もまた、記述されたSMILES表現以上のものであり、そのグラフ構造が化学的な接続関係を決定する。

気象には別の不整合がある。全球の大気状態には、緯度、経度、高度、時間にわたって分布する物理変数が含まれる。この場を汎用的な配列に平坦化すると、予報システムに必要な空間的関係が失われる恐れがある。

ShenZhenは、特化型フロントエンドを維持することで、この不整合に対処している。各エンコーダーはまず、その領域に固有の構造を捉える。その後、共有Qwenバックボーンが、自然言語による指示や他のモダリティと整合された表現を処理する。

デコーダーは、その逆の処理を行う。気象では、全球の大気状態の系列を生成する。医用画像では、テキストプロンプトと画像をセグメンテーションマスクに変換する。分子では、有効なSMILES表現を返すことができる。

この構成は、1人の調整役を介して専門家チームが連携する仕組みに似ている。調整役は、共通インターフェースと共有推論空間を提供する。専門家は、すべての問題を同じ形式に押し込めることで損なわれる細部を守る。

報告された分子テストは、その潜在的な利点を示している。6つのSMolInstruct物性タスクのうち、ShenZhenは4つで首位または同率首位だったとされる。血液脳関門透過性では96.95パーセント、HIV関連の分類タスクでは97パーセントの精度を達成した。

水溶解度を推定するベンチマークESOLでは、ShenZhenは二乗平均平方根誤差0.550を記録した。値が低いほど、予測が参照データに近いことを示す。比較対象として挙げられたLlaSMolベースラインは1.150だった。

これらはベンチマーク結果であり、生成された分子が安全な医薬品になることを示す証拠ではない。物性予測は通常、はるかに長い創薬プロセスにおける初期フィルターの1つにすぎない。実験室での合成、毒性試験、薬物動態、臨床評価は依然として必要である。

天気コンポーネントも、同じネイティブ出力の原則に従っています。1つの初期大気場が与えられると、ShenZhenは6時間ごとに新たな状態を生成し、最長10日先まで予測します。同院は、0.25度解像度の全球ERA5データを用いて、これらの予測を評価しました。

リリースによると、10日目の500ヘクトパスカル高度、地上2メートル気温、平均海面気圧において、ECMWF HRESよりも誤差が小さかったとされています。HRESは、欧州中期予報センターが運用する高解像度数値天気予報システムです。

モデルカードに記載された10日目のおおよその誤差は、高度について740対810です。気温誤差は約2.65ケルビン対2.90、気圧誤差は約680パスカル対745とされています。

これらの数値を、ShenZhenが運用中の気象予報サービスを上回る証拠と解釈すべきではありません。この比較は、オフラインのERA5評価と限定された変数群に基づいています。運用予報には、データ同化、アンサンブルによる不確実性評価、頻繁な更新、そして地域ごとの多様な性能要件が含まれます。

主張の範囲はもっと限定的ですが、それでも注目に値します。1つの共有モデルが、生物学や化学のタスクも学習しながら、妥当な10日間の大気予報を生成できるということです。専門化されたルーティングによって、競争力のあるオフライン結果を得るのに十分な気象構造が保持されているようです。

この仕組みこそが、本記事における主要な発想の転換です。科学AIは、ドメイン構造を取り除けば必ずしも汎用性が高まるわけではありません。ShenZhenは、その構造を維持したうえで共有バックボーンを通じて整合させることで、汎用性を獲得しようとしています。

医用画像が示す可能性と検証の隔たり

医用画像の結果は、ShenZhenの最も明確な実用的主張であると同時に、最も慎重に捉えるべき理由でもあります。

同院は、BiomedParseのテスト分割から得た102,855組の画像・プロンプトペアを対象に、テキストプロンプトによるセグメンテーションを検証しました。このデータ群は、CT、MRI、病理画像、X線、内視鏡、網膜画像を含む9種類の画像モダリティを網羅しています。

モデルカードによると、ShenZhenは平均Diceスコア91.20を達成しました。Diceは、予測領域と参照アノテーションの重なりを測定する指標です。割合が高いほど、両者がより一致していることを示します。

報告された比較には7つの手法が含まれていました。BiomedParseは90.73、MedSAMは83.55、オリジナルのSegment Anything Modelは71.29でした。ShenZhenは、統合されたテストセット全体で首位となりました。

性能はモダリティによって異なります。報告によると、X線画像で98.02、CT画像で93.36、MRIスキャンで85.29を達成しました。一方、MRI、光干渉断層撮影、X線、眼底画像では、BiomedParseがわずかに上回りました。

病理画像では、BiomedParseの81.57に対して、ShenZhenは87.29を報告しています。病理画像には複雑なテクスチャや組織境界が含まれることが多いため、この差は興味深いものです。しかし、1つのベンチマークだけでは臨床的な信頼性を証明できません。

このモデルは、セグメンテーションにSAMベースの経路を使用します。SAMとは、視覚的プロンプトをオブジェクトマスクに変換するMetaのSegment Anythingアーキテクチャを指します。ShenZhenは、この画像コンポーネントに科学分野向けのルーティングと自然言語による対話機能を追加しています。

研究者は、腫瘍、臓器、組織構造に対応する領域を指定できます。するとシステムは、画像を説明するだけでなくマスクを返します。この出力は、定量分析、アノテーション支援、別のモデル向けの前処理に利用できます。

しかし、医用セグメンテーションのスコアにはいくつかの限界があります。ベンチマーク画像は、別の病院、スキャナー、患者集団から収集されたデータとは異なる場合があります。撮像プロトコル、疾患の有病率、アノテーション方法、プロンプトの表現が変わると、性能が低下する可能性があります。

また、Diceが測定するのは重なりであり、臨床的な影響ではありません。平均スコアが高くても、病変境界付近の小さいながら重大な誤りが隠れる可能性があります。また、希少疾患や十分に代表されていない患者集団に対する性能の低さも覆い隠されることがあります。

このリリースでは、前向き臨床検証は示されていません。また、臨床医が厳格な監督なしにこのシステムを安全に使用できるかどうかも確立されていません。読者はShenZhenを診断製品ではなく、研究用モデルとして捉えるべきです。

ライセンスにも別の制約があります。このパッケージには、MetaのSAMライセンスおよび利用規定の制約が適用される、第三者提供のセグメンテーション用重みが含まれています。他の部分にApacheライセンスが存在しても、これらの義務が自動的に免除されるわけではありません。

したがって、直近の試金石となるのは独立した再現です。外部チームは、公開されたコードを未使用のデータセットで実行し、使用環境を報告する必要があります。また、キャリブレーション、失敗事例、プロンプト感度、施設間での性能も調査すべきです。

同じ基準は、医用画像以外にも当てはまります。生物学分野のスコアは、学習データとの重複を防いだデータセットで検証する必要があります。分子出力には化学的妥当性の確認が必要であり、天気予報には季節や地域をまたいだ運用上の比較が必要です。

オープンウェイトによってこうした検証は可能になりますが、公開されているからといって再現性が保証されるわけではありません。研究者には、正確な前処理手順、データ分割、評価スクリプト、適切なハードウェアが依然として必要です。詳細が欠けていると、ベンチマーク結果が大きく変わる可能性があります。

このモデルを導入する科学研究チームは、ナレッジ管理上の課題にも直面します。結果を再現するには、プロンプト、データセット、モデルのバージョン、ライセンス、失敗した実験を追跡する必要があります。検索可能な技術ナレッジベースは、研究グループ全体でこうした証拠を保存するのに役立ちます。

この検証の隔たりは、このリリースを退ける理由ではありません。むしろ、オープンなリリースが重要である最大の理由です。独立したユーザーが、統合アーキテクチャが機能する領域と専門モデルが引き続き必要な領域を明らかにするにつれ、ShenZhenの価値はより明確になるでしょう。

専門モデルは依然として科学分野の基準を確立している

ShenZhenが競合するのは、単一の汎用的なライバルではなく、専門化されたシステム群です。

ゲノミクス分野では、Google DeepMindのAlphaGenomeが、DNA変異が遺伝子制御に与える影響の予測に特化しています。最大100万塩基対の配列を処理し、数千種類の分子予測を生成します。この深さは、より広範なクロスドメイン目標を持つShenZhenとは異なります。

Googleは当初、非商用研究向けにAPIを通じてAlphaGenomeを提供しました。その後のNature論文では、制御変異予測における性能が説明され、研究用リソースが公開されました。AlphaGenomeの研究は、1つの科学分野の中にどれほど多くのドメイン固有のエンジニアリングを組み込めるかを示しています。

タンパク質科学では、ESM3が配列、構造、機能を同時にモデル化します。開発者は最大版を980億パラメータで学習させ、タンパク質設計のための生成モデルとして説明しています。このシステムは、引き続きタンパク質の生物学に特化しています。

ESM3の研究では、既知の例から大きく異なる蛍光タンパク質の生成が報告されました。この種の実験事例は、ベンチマーク予測を超えて物理的な成果につながるため重要です。

天気予報にも、Google DeepMind、Huawei、Nvidia、ECMWFなどが開発した専門システムがあります。これらのモデルは、特定の変数と予報期間において、数値天気予報との競争力を高めています。運用機関は、現在も複数のシステムと人間の専門知識を組み合わせています。

医用画像分野にも、多様な基盤モデルがあります。MedSAMはセグメンテーションに特化し、BiomedParseは生物医学の各モダリティにわたって画像とテキストプロンプトを結び付けます。臨床機関は、文書化と検証が特定のワークフローに適合している場合、こうした特化型システムを選ぶ可能性があります。

ShenZhenの利点は、これらの専門モデルに対する明白な優位性ではありません。その魅力は、それらの境界を越えられることにあります。研究プロジェクトでは、ゲノム配列、タンパク質機能、候補分子、医用画像、環境条件を結び付ける場合があります。

現在、このようなプロジェクトでは、互換性のない入力形式を持つ複数のモデルが必要になることがよくあります。研究者は個別の環境を維持し、ツール間で出力を変換しなければなりません。受け渡しのたびに技術的な作業が発生し、情報が失われる可能性があります。

共有された自然言語インターフェースは、こうした障壁を減らせます。さらに重要なのは、共有表現空間によって、あるモダリティで学習した情報が別のモダリティを改善できる可能性があることです。このクロスドメイン転移は、実験によって切り分けて測定されるまでは仮説にとどまります。

同院を取り巻くプラットフォームは、このシステム面の主張を補強しています。SAISは、研究タスクを分解し、モデルやツールを連携させるエージェントとしてDashengを発表しました。同院のNovaInspireプラットフォームは、科学モデル、データ、論文、特許記録を集約しています。

上海市の公式概要によると、SAISは上海市政府とFudan Universityによって2023年に設立されました。同研究所は、材料、創薬、気象、気候向けのモデルも開発しています。

ShenZhenは、従来の専門モデルをすべて不要にすることなく、これまでのポートフォリオの一部を統合しています。このモデル自体の設計にも、専門化されたエンコーダーとデコーダーが含まれています。統合は、完全なアーキテクチャの均一化ではなく、オーケストレーション層と表現層で行われます。

この違いを踏まえて比較すべきです。選択肢は、単に1つの汎用モデルか多数の専門モデルかというものではありません。より重要な競争軸は、連携した共有バックボーンと、緩やかにつながった独立システム群との比較です。

Intern-S1-Proのような大規模モデルは、別のアプローチを提示します。これらは、パラメータ規模、広範な科学分野の事前学習、マルチモーダル推論によって適用範囲の拡大を目指します。ShenZhenは、より小規模なバックボーンの周囲にドメインを意識したルーティングを配置することで、適用範囲を広げようとしています。

どちらのアプローチにも、専門ツールは依然として必要です。1兆パラメータの推論モデルであっても、外部のシミュレーターやデータベースを呼び出す可能性があります。ShenZhenは、パッケージ内部の専用コンポーネントに依存しています。実務上の問題は、スタック内のどこに専門性を配置すべきかということです。

ShenZhenがドメイン間で効果的に転移できれば、共有バックボーンというアプローチの有効性が高まります。独立した検証で、あるドメインの学習が別のドメインに悪影響を与える負の転移が明らかになれば、モジュール型の専門システムは重要な優位性を維持するでしょう。

ShenZhenが科学AIを変えるかどうかを決める3つの兆候

次の段階で重要なのは、新たな注目ベンチマークではなく、再現性、クロスドメイン転移、そして普及です。

第1の兆候は、独立したベンチマーク再現です。研究グループは、20の生物学タスク、6つの分子テスト、気象評価、医用セグメンテーションのベンチマークを再実行すべきです。一貫した結果が得られれば、同院が主張する規模効率性の根拠が強まります。

再現には、学習データの重複検査を含めるべきです。科学ベンチマークでは、事前学習コーパスに含まれ得る公開データセットが使用されることがよくあります。モデルが同一の配列、ラベル、画像、または非常に類似した例をすでに学習していた場合、高いスコアの意味は弱まります。

説得力のある独立研究では、時間的に分離されたデータや新たに収集されたサンプルを使用する必要があります。生物学では、最近登録された配列などが考えられます。気象では、学習時に利用できなかった期間の予報を検証できます。

第2の兆候は、真のクロスドメイン転移を示す証拠です。ShenZhenのアーキテクチャは、共有バックボーンが科学分野の各モダリティに有用な関係性を捉えることを前提としています。現在のベンチマーク群は主に、個々のドメイン内での性能を測定しています。

研究者は、統合モデルと、各モダリティで個別に学習したモデルを比較すべきです。共有モデルの性能が高い、またはより少ない事例から学習できるのであれば、同院の中心的な主張を裏付けることになります。同等または低い性能であれば、統合は主に導入を簡素化するものだと考えられます。

クロスモーダル研究は、さらに有益な情報をもたらすでしょう。あるテストでは、タンパク質表現がRNA・タンパク質相互作用予測を改善するかどうかを検証できます。別のテストでは、個別の特性ベンチマークを評価するのではなく、分子生成を生物学的標的情報と結び付けることができます。

3つ目のシグナルは、オープンリポジトリとNovaInspireを通じた継続的な採用です。ダウンロード数だけでは弱い指標にすぎませんが、外部からの貢献は、そのパッケージが実用に耐えるかどうかを示します。新しい評価スクリプト、ドメインアダプター、バグ報告、再現可能な実験は、機能している研究コミュニティの存在を示すでしょう。

採用は計算要件にも左右されます。110億パラメータのモデルはIntern-S1-Proより小さいものの、すべての研究室にとって軽量というわけではありません。このパッケージは複数の大規模な科学コンポーネントを組み合わせているため、メモリ使用量とデプロイが複雑になる可能性があります。

明確なハードウェアプロファイル、量子化版、モジュール式ローディングがあれば、利用の裾野が広がるでしょう。研究者は、1つのワークフローに必要なコンポーネントだけをロードできるべきです。そうでなければ、統合パッケージは、それが置き換えようとする個別のツールよりも非効率になりかねません。

専門家の反応にも注目すべきです。ゲノム、タンパク質、気象、またはイメージングモデルを開発するチームが、より強力なクロスドメインインターフェースを公開すれば、ShenZhenのオーケストレーション上の優位性は縮小するでしょう。各チームが孤立したままであれば、共有の科学基盤はより魅力的になります。

また、同アカデミーは、より完全な学習の詳細と統制されたアブレーション研究を公開すべきです。アブレーションとは、あるコンポーネントを取り除き、その寄与を測定することです。これらの研究により、性能向上がエンコーダー、共同学習、Qwenバックボーン、またはベンチマーク固有の適応のいずれによるものかを明らかにできます。

Shanghai Academy of AI for Science ShenZhenマルチモーダル基盤モデルは、すでに1つの有益な貢献を果たしています。それは、科学モデルの規模をめぐる議論を、検証可能なアーキテクチャ上の問いへと変えたことです。

より小さなバックボーンは、専門分野での精度を犠牲にすることなく、科学分野固有の表現を連携させられるのでしょうか。オープンリリースにより、研究チームはその問いを直接調査できます。

次に取るべき最善のステップは、報告されたすべてのスコアを鵜呑みにすることでも、検証が不完全だからといってモデルを退けることでもありません。研究者は、関連するタスクを1つ再現し、各依存関係を文書化し、成功例とともに失敗例も公開すべきです。その証拠によって、ShenZhenが共有インフラになるのか、それとも野心的なベンチマーク結果集にとどまるのかが決まるでしょう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page