top of page

データラボモデルが真価を問われるなか、Snorkel AIの資金調達額は3億5,000万ドルに

9月26日
読了時間: 20分

Snorkel AIの資金調達額は9月22日に3億5,000万ドルに達し、報道によれば年間成長率が18倍に及んだ後、同社の評価額は35億ドルとなった。このシリーズEにより、Snorkelはますます混雑するトレーニングデータ、評価、シミュレーション環境の市場で主要な競争者として位置づけられた。同時に、同社の研究主導アプローチには厳しい評価額という重みが加わった。

Snorkelによれば、年換算売上ランレートは3億7,500万ドルを超えた。この数値は監査済みの年間売上高ではなく、同社が公表した指標である。それでも、急成長と前回のほぼ3倍に当たる評価額の組み合わせは、投資家がAIデータを持続性のあるインフラカテゴリーと見なしていることを示唆する。

タイミングも重要だ。MetaによるScale AIへの投資は、2025年を通じてデータサプライチェーン全体の関係性を揺るがした。フロンティアラボも、より難しいタスク、より豊かな環境、より専門性の高い専門家を求め始めた。Snorkelは、研究、ソフトウェア、そして慎重に管理された人間の専門知識によって、より大規模な請負業者プールにラベリング作業を割り当てるだけという旧来モデルを置き換えられると賭けている。

Snorkel AIの資金調達ラウンドは新しいタイプのデータサプライヤーを後押しする

シリーズEは、Snorkelがデータソフトウェアの販売から、高度なAIシステム向けに完全なデータ製品を提供する企業へ移行するための資金となる。

Insight PartnersとS32がラウンドを共同主導し、既存投資家Additionも大きく参加した。Third Point、March Capital、Blumberg Capital、Allegis Capital、Standard VC、Frontline Ventures、Lightspeed Venture Partners、Greylock、GV、Prosperity7 Ventures、Wells Fargo、Walden Catalyst Ventures、Factoryも参加した。

SnorkelのシリーズE発表によると、同社は「agentic data factory」と呼ぶものを拡張する計画だ。この用語は、ソフトウェアエージェント、研究手法、ドメイン専門家、運用ワークフローを組み合わせ、トレーニングおよび評価データを生み出すシステムを指す。

同社によれば、新たな資金はこのファクトリーの処理能力を高める。また、垂直型AIとエンタープライズAIへの投資を進めるとともに、その技術を追加のデータ種別や応用領域へ拡張する計画だ。

これは従来のアノテーションより広い使命である。基本的なデータラベリングでは、画像に歩行者が写っているかどうかを示すように、既知のカテゴリーをサンプルに割り当てる。フロンティアモデルの開発では、正解の指定、評価、再現がより難しいタスクが必要となる。

たとえばコーディングエージェントは、リポジトリ、コマンドラインツール、設定ファイル、依存関係をまたいで作業しなければならない。法務エージェントには、根拠を見つけ、法域を区別し、追跡可能な回答を提供することが求められる場合がある。保険システムは、事実を捏造せずに保険契約や証拠について推論しなければならない。

こうした課題には、孤立したラベル以上のものが必要だ。サプライヤーはタスクを設計し、実行環境を構築し、失敗モードを特定し、採点基準を定め、成功が真の能力を反映しているかを見極めなければならない。

Snorkelは、そのアプローチをデータプログラミングを中心としたStanfordの研究プロジェクトにさかのぼる。この手法により、分野の専門家はラベリング関数、すなわち大規模にノイズを含むラベルを生成するルールやヒューリスティックを記述できる。その後、統計的プロセスがこれらの関数の信頼性を推定し、相互の競合を調整する。

オリジナルのSnorkel研究論文は、このアプローチが複数の応用分野で手作業によるラベル付きデータセットへの依存を減らせると報告した。現在のフロンティアデータ事業ははるかに広範だが、根底にある主張は依然として明確である。専門知識は、サンプルごとに適用するのではなく、再現可能なシステムへ組み込むべきだということだ。

Snorkelは当初、この考えをSnorkel Flowを通じて商用化した。これは企業が社内でデータとモデルを開発するために使えるプラットフォームである。その後、顧客が完成済みのデータセット、ベンチマーク、または環境を受け取るサービスとしてのデータへ拡張した。

この違いは収益と運用に影響する。ソフトウェアプラットフォームでは、顧客自身がシステムを学び、自らのプログラムを実行する必要がある。マネージドデータサービスでは、成果物を生み出す責任を担うため、より大きな契約につながり得る一方で、提供作業も増える。

Snorkelによると、そのデータ・アズ・ア・サービスの提供は資金調達発表のほぼ1年前に開始された。同社は18倍の成長と3億7,500万ドルの年換算売上ランレートを、その提供によるものだとしている。こうした主張により、サービスへの移行は新たな評価額を支える中心的な事実となる。

このラウンドは、2025年5月に評価額13億ドルで発表された1億ドルのシリーズDに続くものだ。したがって今回の資金調達では、約16カ月で3億5,000万ドルが追加され、提示された評価額は22億ドル上昇したことになる。

この急速な上昇は、このモデルの持続性を証明するものではない。投資家が現在の需要の継続を期待しており、市場が落ち着く前にSnorkelが能力を構築するための十分な資本を確保したことを示している。

高度なモデルになぜより難しいデータが必要なのか

AIラボが購入しているのは、もはやラベル付きサンプルだけではない。難問、現実的な環境、そしてモデルがそれらを解決したかを測る信頼できる指標である。

初期の機械学習システムは、開発者が単純明快なラベルを持つサンプルを追加すると改善することが多かった。現代の生成モデルは、事前学習の段階ですでに膨大な量のテキスト、コード、画像、動画を取り込んでいる。残された弱点は、多くの場合、限定的で文脈依存的であり、測定が難しい。

モデルは、存在しない判例を引用しながらもっともらしい法的文書を書くことができる。コーディングエージェントは、正しく見えるパッチを作成しても依存関係を壊すことがある。カスタマーサポートエージェントは通常の依頼を処理できても、例外的なポリシーを誤って扱う可能性がある。

こうした失敗に有用なデータを作るには、分野を理解する人材が必要となる。また、モデルが行動し、フィードバックを受け、その結果に直面できる環境も必要だ。

このため、強化学習環境が重要になっている。強化学習は、行動や出力に結び付いたフィードバックを通じてモデルを訓練する。エージェントにとって、その環境にはファイル、ツール、シミュレートされたユーザー、データベース、ソフトウェアサービスなどが含まれ得る。

報酬は意味のある成功を反映しなければならない。弱い報酬は、本来のタスクを見落としたまま表面的なチェックを満たすことをモデルに学習させかねない。答えを漏らす環境は、転用可能な能力を高めずに結果を水増しする可能性がある。

評価も関連する課題を生む。公開ベンチマークは研究者によるモデル比較を助けるが、繰り返し使われると価値が弱まることがある。モデルが訓練中にベンチマークの問題を取り込んだり、開発者が既知のテストに直接最適化したりする可能性があるためだ。

査読済みの汚染に関する調査は、訓練データとベンチマークデータの重複が、信頼性の低い評価を生み出し得ることを説明している。ベンチマークスコアが製品の主張、調達判断、研究の優先順位を左右する場合、この問題はより深刻になる。

Snorkelは、エージェント型コーディング、法務業務、保険などの専門的な領域に向けた評価の構築と支援で対応している。同社の公開コーディングベンチマークには、4つの難易度にまたがる100件のマルチステップタスクが含まれ、より大規模なコレクションは顧客に提供されている。

このベンチマークは商機を示している。ラボに必要なのは、単なるソースコードの追加バッチではない。エージェントがどこで失敗するかを明らかにするタスク、試行を安全に実行できるサンドボックス、そして動作する解決策と説得力はあるが誤った結果を区別する採点者が必要だ。

Snorkelは、オープンベンチマークの開発を引き続き支援するとしている。オープンベンチマークは検証の範囲を広げ、外部研究者がタスク設計を調査できるようにする。一方で、その解答がトレーニングパイプラインを通じて流通すれば、時間とともに有用性が低下する可能性もある。

したがって、同社の事業は避けられない循環の中にある。新しいモデルには新しいテストが必要だ。それらのテストが既知のものになると、研究者には更新されたタスクが必要になる。評価で見つかった失敗は、その後の新たなトレーニングデータの対象となる。

この循環は、特にAIが規制の厳しい業務や高付加価値の業務へ進出するにつれて、継続的な需要を支え得る。一方で、専門領域ごとに新たな専門知識、ツール、品質管理が求められるため、高コスト化する可能性もある。

2025年のAI Index reportは、ウェブサイトがAIスクレイピングを制限するなかで、データ利用に関する制約が増加したと指摘した。また、合成データ、ライセンス、透明性、再現性をめぐる未解決の問題も強調している。

合成データは、現実世界から直接収集するのではなく、モデルが生成した情報である。データセットを拡張し、まれなケースを対象にし、収集コストの一部を下げることができる。しかし、生成元のモデルの誤りを再現し、学習に利用できる多様性を狭める可能性もある。

正確性が事実、専門的判断、現実世界の手順に依存する場合、人間の専門家は依然として不可欠である。価値あるサービスは、単に専門家へアクセスできることではない。その判断を、モデルが学習し、評価者が検証できるデータへ変換する能力である。

この変化は、Snorkelが自社をフロンティアAIデータラボと表現する理由を説明している。この呼称は実験、測定、研究を強調する一方、従来型ラベリング市場というイメージから同社を距離づける。

ただし、この変化はブランディングだけではない。フロンティアデータが設計された研究成果物になるなら、ベンダーはタスク品質、再現性、測定可能なモデル改善で競争することになる。人員規模と納期も依然として重要だが、それだけで勝負は決まらなくなる。

Snorkelの研究モデルがScale AI時代に挑む

Snorkelの主たる競争は、研究主導のデータファクトリーと、大規模な人材オペレーションを中心に築かれた業界との間で繰り広げられる。

Scale AIは、大規模なラベリング業務を調整し、その周囲にツールを構築することで、トレーニングデータ分野で最も知られる企業となった。Surge AI、Mercor、Turing、Handshake、Invisible Technologies、その他のプロバイダーは、専門家の採用、マネージドプロジェクト、ソフトウェア、評価サービスを異なる組み合わせで展開している。

競争上の境界は明確ではない。主要ベンダーの大半は今や、技術インフラと人間の専門知識を何らかの形で組み合わせていると主張している。フロンティアラボも、機密性の高いすべてのプロジェクトを1社に委ねるのではなく、複数のサプライヤーを利用している。

それでも、戦略の出発点は異なる。労働市場型の企業は、採用、マッチング、運用を中核的な優位性と捉える。Snorkelの従来からの考え方では、プログラマティックなデータ開発と研究インフラが基盤となる。

市場は、Metaが2025年6月にScale AIへ約143億ドルを投資することで合意した後に変化した。この取引によりMetaは議決権のない49%の株式を取得し、Scaleの創業者Alexandr WangはMetaに加わり、新たなスーパーインテリジェンスの取り組みを主導することになった。

この連携は中立性の問題を生んだ。他のラボには、直接の競合企業と密接につながるサプライヤーと、機密性の高いトレーニングの優先事項を共有すべきかどうかを疑問視する理由があった。

data market shiftに関する報道は、この取引後に競合各社が需要の急増を見たと伝えている。報道によれば、OpenAIとGoogleはScaleとの取引を縮小し、代替サプライヤーは新たに利用可能となった契約の獲得を目指した。

これは通常の顧客離れを超える問題だった。最先端の研究所からのデータ要求は、モデルの弱点、今後の能力、評価手法、研究の方向性を明らかにし得る。戦略的に結び付いたサプライヤーとこうした詳細を共有することには、基本的な調達比較では見えてこないリスクが伴う。

SnorkelはMetaとの取引の直前に、すでにSeries Dを調達していた。その後のサービス拡張は、買い手がサプライヤーと必要とするデータの種類を見直していた時期に重なった。

この組み合わせは好条件を生んだ。より多くの契約が競争の対象となる一方、推論モデルとエージェントの台頭により、難易度が高く専門家が設計したタスクへの需要が高まった。Stanfordにルーツを持ち、技術プラットフォームを備えるSnorkelは、代替先を探す研究所に差別化された選択肢を提示した。

年間換算ランレート3億7,500万ドルという主張は、Snorkelがこの機会の一部を捉えたことを示唆する。ただし、この数字からは顧客集中度、契約期間、売上総利益率、再利用可能なソフトウェアではなく人手によって提供された業務の割合は分からない。

こうした詳細は重要だ。すべてのデータ収益がソフトウェアと同じ経済性を持つわけではない。プラットフォームであれば、追加顧客への提供コストは低く抑えられる。だが、専門的なエージェント向けのカスタム評価では、新たな専門家、インフラ、プロジェクト管理、検証が必要になる場合がある。

Snorkelのエージェント型データファクトリーは、反復可能な工程を自動化することで、この経済性の改善を目指している。ソフトウェアエージェントは、候補タスクの生成、出力の検査、ワークフロー管理、人間によるレビューが必要な例の特定を支援できる。

もっとも、自動化は自らを検証できない。生成されたタスクには曖昧さが含まれる可能性がある。自動採点器が不完全な回答を高く評価することもある。シミュレーション環境では、現実の業務を難しくしている制約が抜け落ちることもある。

Snorkelのモデルにおける最も強力な形は、自動化によって専門家の注意を集中させるものだ。専門家が重要な差異を定義し、不確実なケースをレビューし、結果を監査する。機械は反復作業を担い、異常を浮き彫りにする。

このアプローチは、適切に設計されたナレッジワークフローに似ている。価値は、単により多くの文書や事例を集めることではなく、文脈と専門家の判断を保持することから生まれる。

競合他社も同様の手法を採用できる。Mercorは、高度なスキルを持つ契約人材と研究所のマッチングを重視してきた。Surgeはデータ品質を軸に評判を築いている。Scaleはモデル評価へと事業を拡大しており、Metaとの関係により莫大な技術的・財務的リソースを利用できる。

したがってSnorkelが研究主導カテゴリーを独占しているわけではない。同社の優位性は、実行力、信頼される中立性、独自システム、そしてそのデータが顧客モデルを改善するという証拠から生まれなければならない。

Series Eは、同社にこの4領域すべてへ投資する余地を与える。同時に、労働集約的なサービスプロバイダーへと変質せずに、カスタム研究業務を拡大できるという期待も高める。

35億ドルの評価額には重要な疑問が残る

この資金調達は需要を裏付けるが、Snorkelの成長のどの程度が再現可能で、収益性があり、防御可能なのかを示すものではない。

最初の不確実性は収益の質に関するものだ。年間換算ランレートは、直近の実績を年間の数字に外挿したものである。必ずしも認識済み収益と同じではなく、直近の急増が続くかどうかも示さない。

Snorkelは、18倍超の成長を経て3億7,500万ドルのランレートを突破したとしている。これは、比較的小さな基盤からの非常に急激な拡大を意味する。こうした成長は、特に集中度の高い市場で、企業が複数の大型プログラムを獲得した場合に起こり得る。

最先端AI研究所は多額の支出が可能だが、その数は比較的少ない。幅広いエンタープライズソフトウェア市場で1社を失うよりも、主要顧客1社の喪失がサプライヤーに与える影響は大きくなり得る。

契約の持続性も依然として不明確だ。一部のデータプログラムはモデルのリリースを支援した後に終了する。他方、研究所が評価を更新し、失敗例を標的にし、新たな環境を構築する中で継続するものもある。

Snorkelの業務における継続的な部分は、現在の勢いがサブスクリプション型ソフトウェアに近いのか、それとも大規模な研究プロジェクトの連続に近いのかを左右する。同社は必要な内訳を公表していない。

2つ目の疑問は売上総利益率だ。Snorkelのソフトウェア分野での出自は、データ開発の重要な部分を自動化できる可能性を示している。一方で、完成済みデータセットや環境への進出は運用コストも加える。

法律、医療、科学、金融、ソフトウェアエンジニアリングの専門家は、単純な分類作業を行う労働者より高い報酬を求める。その業務は標準化やレビューもより難しい。

新たな領域ごとにほぼ新規のチームとワークフローが必要なら、ソフトウェア並みの利益率を生み出さずに収益だけが伸びる可能性がある。Snorkelが繰り返される専門家の判断を再利用可能なラベリング関数、採点器、環境へ転換できれば、規模の拡大とともに経済性は改善するはずだ。

投資家が実質的に賭けているのは後者の結果である。これがどれほど速く進んでいるのかを判断できるほど、公開情報はまだ詳細ではない。

3つ目の不確実性は測定に関するものだ。ベンチマークは、タスクが不明確であったり、環境が不安定であったり、採点システムが不完全だったりするために難しく見えることがある。難しいだけでは、評価が有用になるとは限らない。

Snorkelの公開ベンチマークに関する取り組みは、外部研究者に検証可能な材料を提供する。一方で、その商用プログラムは非公開であり、品質と効果の独立した評価には限界がある。

顧客は、データ利用前後のモデル性能を比較できるため、より強力な内部証拠を持っているかもしれない。しかし一般公開されている側は、資金調達発表からそうした非公開の結果を推測すべきではない。

4つ目のリスクは合成データへの依存だ。モデル生成の事例は特定の弱点を狙うのに役立つが、質の低い生成とフィルタリングは誤りを増幅しかねない。狭い合成パターンでの反復的な訓練は、多様性を低下させる可能性もある。

Snorkelの研究主導アプローチはデータ品質を管理するために設計されており、根底にあるリスクを排除するものではない。人間によるレビュー、来歴の追跡、敵対的テスト、独立した評価は依然として必要だ。

5つ目の論点は顧客に対する中立性である。Snorkelは、MetaによるScaleへの投資後、独立したサプライヤーとして自らを位置付けることで利益を得ている。この立場は、顧客が機密データ、スタッフのアクセス、顧客間情報に関する統制を信頼する場合にのみ成り立つ。

中立的なベンダーは、研究所に所有されていないだけでは不十分だ。ある顧客の機密性の高い業務が別の顧客のプログラムに影響を与えるのを防ぐ、技術的・組織的な境界が必要になる。

最後の不確実性は競合の対応である。Scaleには深い経験とリソースが残っている。Surgeは主要研究所との確立された関係を持つ。MercorとTuringは、新しいモデルが必要とする専門的なデータを作成できる専門人材を採用している。

研究所はデータ開発のさらなる内製化も可能だ。最大手企業には研究者、エンジニア、領域専門家へのアクセスがある。戦略的に重要な評価を社内に保持しつつ、外部プロバイダーを能力補完に用いる可能性がある。

そのためSnorkelは、人材供給を超える価値を示さなければならない。社内チームや他のマネージドサプライヤーよりも、データ開発を迅速化し、測定可能にし、再現しやすくする必要がある。

同社の過去の研究はこの方向性を裏付けるが、プログラマティック・ラベリングでの過去の成功が、エージェント環境における優位性を自動的に証明するわけではない。ワークロードはより対話的で、目標はより不安定であり、失敗の採点もより困難だ。

この違いこそが、Snorkel AIの資金調達ラウンドの背後にある真の試金石である。資本は能力を拡大できる。しかし、そのファクトリーが一貫してより優れたモデルと、より信頼性の高い評価を生み出すという証拠の代わりにはならない。

この賭けが成功しているかを示す3つのシグナル

顧客維持、測定可能なモデル改善、再現可能な領域拡大が、Snorkelが新たな評価額に値するかを決める。

最初のシグナルは、現在の最先端研究所との契約の波の後に何が起きるかだ。Snorkelが報告した成長は強い即時需要を反映しているが、更新契約は、その業務が顧客の継続的な開発サイクルの一部となるかどうかを明らかにする。

より長期的な関係は、研究所がSnorkelを一時的な能力ではなく研究インフラと見なしていることを示すだろう。公表された顧客名、継続的なベンチマーク共同研究、拡大するプログラムは、この解釈を強める。

顧客集中度は、総成長と同じくらい重要になる。最先端研究所、エンタープライズ顧客、政府機関、業界特化型AI企業にまたがるより幅広い構成は、少数の大口顧客への依存を減らす。

2つ目のシグナルは、Snorkelのデータが同社自身が設計していないテストで測定可能な改善を生むという証拠だ。内部の顧客結果は非公開のままである可能性があるが、研究パートナーシップはより強い公開検証を提供できる。

有用な証拠では、Snorkelが開発したデータで訓練する前後のモデルを比較する。また、改善が狭い最適化を反映している可能性を減らすため、別個のタスクでもモデルをテストする。

独立した再現は特に価値が高い。ベンチマークの作成と訓練データの生産は密接しているため、開発と評価を明確に分離することが信頼性の確立に役立つ。

Snorkelの公開ベンチマーク業務は出発点となる。同社は、コーディング、法務リサーチ、保険引受、継続学習に関わるエージェント評価を支援してきた。将来のリリースでは、モデルの改善に伴ってこれらのテストが識別力を維持するかを示すべきだ。

ベンチマークの保守も運用上の規律を示す。Snorkelが公開したTerminal-Benchの改訂は、89タスク中28件を修正し、継続的な検証を追加した。難しい評価において修正は通常のことだが、改訂の規模はタスク監査が重要である理由を示している。

信頼できるプロバイダーは誤りを特定し、開示し、採点を更新すべきだ。欠陥のあるタスクを隠せば、ベンチマークは安定しているように見える一方で、それに基づくあらゆる比較を弱めることになる。

3つ目のシグナルは、Snorkelが収益と同じ割合でコストを増やさずに新しい領域へ進出できるかどうかだ。これはエージェント型データファクトリーにとって中心的な経済的課題である。

再利用可能なインフラは、プロジェクト間の立ち上げ時間を短縮するはずだ。共通コンポーネントには、安全なサンドボックス、タスク生成ツール、品質チェック、専門家レビューキュー、評価ダッシュボードが含まれ得る。

領域知識は引き続き固有のものとなる。ソフトウェアエンジニアリング向けのシステムを、プロンプトを変えるだけで保険ベンチマークに変えることはできない。Snorkelは、共有インフラが十分な工程を担い、オペレーティングレバレッジを生み出せることを示す必要がある。

採用動向は手掛かりとなり得る。研究エンジニアリングとプラットフォーム職の急成長は、自動化の仮説を支えるだろう。プロジェクト運用の大幅な増加は、提供が依然として人手に大きく依存していることを示すかもしれない。

競合の行動も別の手掛かりになる。Scale、Surge、Mercor、Turingがベンチマーク設計と研究インフラをますます強調するなら、それはSnorkelが選んだ戦場を裏付ける。同時に、差別化はより難しくなる。

最先端研究所が複数のサプライヤーへ業務を分散し続けるなら、中立性と専門性が重要になる。最大規模のラウンドを調達しただけで、どのプロバイダーも万能なデータレイヤーにはなれない。

Snorkel AIの資金調達発表は、モデル、チップ、アプリケーション層が変化しても、データ開発が引き続きボトルネックになると投資家が見込んでいることを示している。モデルの進歩が新たな評価問題を生み出し続けるため、この見通しは妥当だ。

未解決の問いは、誰がその価値を獲得するかである。専門家マーケットプレイスは希少な人材を供給できる。大規模事業者は量を提供できる。社内チームは戦略的知識を守れる。研究主導のベンダーは、専門家の判断を再現可能なシステムへと転換できる。

Snorkelはいま、この市場全体で競争するために必要な資本と収益実績を手にしている。評価額35億ドルは、大手サプライヤー級の規模で事業を展開しながら、研究所ならではの強みを維持できるという前提に基づくものだ。

今後は、次回の顧客契約更新、独立した測定によるモデル性能の改善、新たな領域への進出コストに注目したい。これらのシグナルを総合すれば、今回の資金調達が持続的なAIデータプラットフォームを生み出したのか、それとも一時的な需要急増を支えただけなのかが見えてくる。

開発者や企業の購買担当者にとって、実務上の問いはもはや「誰が最も多くのデータにラベル付けできるか」ではない。最も難しく実用的なタスクを設計し、答えを検証し、一つひとつの失敗を信頼できる学習素材へと変換できるのは誰か、ということだ。Snorkelの次の段階では、品質、機密性、経済的な規律を犠牲にすることなく、その研究手法によってこのプロセスを顧客横断で再現可能にできるかが試される。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page