top of page

Vals AIの4,000万ドル調達、独立系AI評価市場を試す

Vals AIは評価額4億ドルで4,000万ドルを調達し、Techmemeが集約した資金調達ニュースを、独立したAI測定をめぐるより大きな試金石へと変えた。

Andreessen HorowitzがシリーズAを主導し、8VC、Bloomberg Beta、HRT Ventures、Next Ladder Venturesが参加した。Valsは2026年8月13日にこの資金調達を発表した。

同社によれば、売上高は2025年通年比で8倍に成長した。顧客基盤は倍増し、チーム規模は6カ月以内に3倍になったという。

これらの数値はいずれも同社による公表値であり、公開財務諸表から得られるような文脈は欠いている。それでも、それらは難しい問いを中心に市場が形成されつつあることを示している。AIモデルが有用な仕事を遂行できるかどうかを、誰が信頼に足る形で測定できるのか、という問いだ。

モデル開発企業はすでに、コーディング、数学、推論、安全性の各テストにおけるスコアを公表している。企業もまた、モデルを導入する前に社内テストを実施している。

Valsは、どちらの手法も独立性、新鮮さ、カバレッジの面で十分ではないと見ている。同社の主な競合相手は、別の評価スタートアップではない。AIベンダーが自社製品の主張を裏付けるためのテストを、自ら定義し、実施し、公表するという慣行そのものだ。

この利益相反こそが、このラウンドの重要性を説明する。今回の資金調達でValsが業界の審判役として確立されるわけではないが、その役割を競うための資源は増える。

資金調達は独立した審判役を後押しする

Valsは、汎用AIモデルをもう1つ作るためではなく、測定インフラを構築するために資金を調達している。

同社のシリーズA発表によると、a16zは評価額4億ドルでの4,000万ドルの投資を主導した。既存投資家である8VCとBloomberg Betaもこのラウンドに参加した。

HRT VenturesとNext Ladder Venturesは新規投資家として参加した。Valsは各社の出資額や監査済みの売上高を開示していない。

サンフランシスコに拠点を置く同社は、金融、法律、ソフトウェア、医療、数学、AI研究におけるタスク向けの評価とベンチマークを構築している。ベンチマークとは、定義された条件下でモデルの性能を比較するための構造化されたテストである。

Valsによれば、その結果はOpenAI、Anthropic、Google、Meta、xAIのモデルカードに掲載されている。モデルカードは、システムの能力、制約、評価結果を記録するものだ。

この採用実績は、単なる公開リーダーボード以上に重要である。研究所がベンチマークを引用し、買い手がモデル選定に使うようになって初めて、ベンチマークは商業的な意味を持つ。

Valsはまた、大規模なエンタープライズ導入で、モデル選定や製品測定の際に同社の評価が使われているとしている。同社は、AI政策に取り組む商務省および議会議員を支援してきた。

これらの説明は、いくつかの異なる市場を対象としている。モデル研究所は新リリースが改善されたという証拠を求め、企業は自社のワークフローに結び付いたテストを必要とする。一方、政府はリスクと国家的能力に関する測定を必要としている。

この3つのグループすべてにサービスを提供する単一の評価事業者は、潜在的な利益相反に直面する。しかし同時に、モデル開発、調達、政策の各サイクルをまたぐ可視性も得る。

Valsは資金調達の発表に合わせて、3つの製品リリースを公表した。Vals Smithは、GitHubリポジトリからカスタムのコーディング・ベンチマークを作成する機能として一般提供を開始した。

同社はまた、自律型AI研究、サイバーセキュリティ、メンタルヘルスを対象とするフロンティアリスクの取り組みを発表した。Vals 2.0には、刷新されたウェブサイトと拡張されたVals Indexが追加された。

Vals Indexは、経済的に重要な複数の領域にまたがる性能を組み合わせる。ツール、ファイル、コード、より長いタスク連鎖を伴う作業を含むため、単一の試験形式のベンチマークとは異なる。

したがって、この資金調達は相互に関連する2つの事業を支える。一方は信頼性と流通を確立する公開比較を生み出し、もう一方は非公開の意思決定を行う組織にカスタマイズされた評価インフラを販売する。

この組み合わせが、中心的な緊張を生む。公開ランキングは注目を集めるが、非公開評価の方が実際の導入を取り巻く条件を反映しやすい。

次の試練は、Valsがどちらへの信頼も損なわずに、この2つの事業を結び付けられるかどうかだ。

Techmemeベースの関心がAIベンチマークに向かった理由

この資金調達が注目を集めたのは、エンタープライズの支出判断がより重大になる一方で、モデル能力に関する主張の解釈が難しくなっているためだ。

多くの既存ベンチマークは、最先端のシステムを見分けるにはすでに馴染み深すぎる。モデルは上位スコアに近づけても、不完全な情報や複数の連携ツールを伴うタスクでは依然として失敗しうる。

公開テストの素材は、学習データに含まれる可能性もある。この汚染により、未知の作業に一般化できることを示さないまま、モデルが実際以上に優れて見えることがある。

非公開ベンチマーキングに関する研究も同じ問題を説明している。公開ベンチマークの漏洩は比較を弱めうる一方、非公開のホールドアウトは学習データへの露出を減らせる。

この問題は単なる学術的なものではない。財務分析向けにモデルを選ぶ企業が必要としているのは、一般的な雑学問題でもう1つスコアを得ることではない。

必要なのは、システムが関連文書を読めるか、必要なツールを使えるか、数値の正確性を維持できるか、不確実性を示せるかを知ることだ。また、導入環境に近い条件下で集められた証拠も必要となる。

AI製品がチャット・インターフェースからエージェントへ移行するにつれ、この圧力は強まっている。エージェントとは、モデル、ツール、メモリ、反復的な行動を用いてタスクを追求するシステムである。

エージェントの性能は、基盤モデルだけで決まるものではない。検索品質、ツール設計、プロンプト、権限境界、エラー回復はいずれも結果を変えうる。

制御された質問応答テストで高い性能を示すモデルが、スプレッドシート、ブラウザ、相反する複数の指示を与えられると失敗するかもしれない。別のモデルは、より優れたツール利用によって推論の弱さを補う可能性がある。

Valsは、単体モデルだけでなく、こうした複合システムにも焦点を当てている。その手法には、ツール利用、複数の入力形式、長いコンテキスト、継続的な作業を要するタスクが含まれる。

この変化は、モデル研究所に特有の圧力をかける。研究所が管理するベンチマークは、システムの最も強い構成を強調できる一方、不利な設定や失敗は見えにくくなりうる。

独立した評価者は、プロバイダー間で条件を標準化できる。また、モデルが開発中に遭遇していない非公開のテスト素材を維持することもできる。

この約束が投資家の関心を説明する一助となる。評価は、技術的進歩と商業的導入の間にある制御点に位置している。

すべてのモデル研究所には証拠が必要だ。真剣な買い手には受け入れ基準が必要であり、規制当局も能力とリスクを評価する手法をますます必要としている。

それでも、市場規模の大きさが1社による支配を保証するわけではない。大口顧客は、自社のデータ、ポリシー、失敗コストが固有であるため、しばしば社内評価を構築する。

研究所はまた、モデルの内部構造や未公開システムにより深くアクセスできる。独立した評価者は通常、公開インターフェースまたは特別に手配されたアクセスを通じてテストする。

したがってValsは、評価者の技術的アクセスがより限定的であることを上回るだけの追加的な信頼を、独立性が生み出すことを示さなければならない。また、モデルがテストのパターンを学習するより速くテストを更新する必要もある。

これがTechmemeベースの関心の真の意味である。この資金調達のニュースは、評価が補助的な研究機能ではなく、それ自体が独立した商業レイヤーになりつつあることを示している。

独立テストが研究所主導のスコアに挑む

Valsが販売しているのは、モデルを作る企業と、その性能を評価する組織の分離である。

この分離は、金融、医療、セキュリティ、会計におけるよく知られた制度に似ている。外部の当事者が一貫した条件下で主張を検証できるとき、その主張はより有用になる。

AIには、広く受け入れられた同等の仕組みがない。モデル企業は広範な技術報告書を公表しているが、各プロバイダーが異なるタスク、プロンプト、設定、比較基準を選んでいる。

こうした選択は合理的でありうるが、それでも直接比較を難しくする。プロンプト、ツールへのアクセス、推論設定の小さな違いが、性能に大きく影響する可能性がある。

Valsは、モデル開発が、コミュニティが厳しい新テストを作り出せる速度を上回っていると主張する。古いテストは飽和し、公開された例は将来の学習セットに入る可能性がある。

同社が提案する答えは、非公開で保持するテストセットと領域特化のタスクを用いることだ。Valsは対象分野の専門家とともにこれらのタスクを開発し、文脈のために選択した検証例を公開している。

同社の評価手法では、公開検証素材、非公開検証セット、機密のまま維持されるテストセットを分離している。公開されたベンチマークのスコアを決定するのは、非公開テストセットのみである。

この構造は、直接的な汚染リスクを低減する。ただし、モデルや開発者がベンチマークに適応するあらゆる経路を排除するものではない。

研究所は、公開された説明、過去の結果、関連タスクを基に最適化することができる。繰り返し提出すれば、スコアの変化を通じて隠されたテストに関する情報も明らかになりうる。

Valsは、正確性に加えて、コスト、レイテンシー、不確実性、定性的な失敗パターンを報告している。この幅広い視点は重要だ。最高スコアのモデルが自動的に最適な導入選択になるわけではないからである。

わずかに正確性が低いモデルでも、より高速に動作したり、失敗をより予測可能に扱えたりするかもしれない。別のモデルは、高価な推論予算を与えた場合にのみ、より強い結果を出す可能性がある。

現実世界のタスクは、多肢選択試験よりも整然としていない出力を生む。法律メモは、結論自体は正しくても、支配的な判例を欠く場合がある。

財務モデルは適切な構造を使っていても、数値上の誤りを複数のタブにわたって引き継ぐことがある。エージェントはコーディングタスクを完了しても、無関係なリグレッションを導入する可能性がある。

こうした出力を採点するには、多くの場合、詳細なルーブリック、決定論的な検査、あるいは判定役となる別のモデルが必要となる。各手法にはそれぞれ固有の前提がある。

厳密な検査は明確性を提供するが、客観的に検証可能な答えを持つ出力しか対象にできない。人によるレビューはニュアンスを提供するが、コストが高く、レビューアー間でばらつく可能性がある。

モデル審査はより容易にスケールするが、その選好や誤りが最終順位を形作る可能性がある。ベンチマーク提供者は、そうした審査モデルをどのように検証しているかを示さなければならない。

ここに、独立していることと無謬であることの重要な違いがある。独立性はベンダーとの利益相反を減らせるが、テストが正しい対象を測定していることを保証するものではない。

競合各社は異なる立場からこの問題に取り組んでいる。Patronus AIは、エンタープライズシステム向けに自動評価器、データセット、実験、プロダクション監視を提供している。

同社の評価器ドキュメントは、独自および公開データセットにわたって評価器の正確性を継続的にテストする方法を説明している。これは、製品開発と運用の中で評価を重視するアプローチだ。

METRは、AIシステムがAI研究を加速できるかどうかを含む、フロンティア能力とリスクに重点を置いている。Epoch AIは、汚染を抑えるため未公開の問題を含む難しいベンチマークを開発してきた。

Scale AIは、フロンティア研究所や企業向けの評価とデータサービスを組み合わせている。学術グループは引き続き、透明性と幅広い参加を提供する公開ベンチマークを作成している。

Valsはこれらのカテゴリーのいくつかにまたがっています。公開モデル比較を公表し、独自のテストを作成し、カスタムベンチマークを支援し、フロンティアリスク評価にも取り組んでいます。

この幅広さは、その手法が領域をまたいで応用できるなら強みになり得ます。一方で、一つの組織があらゆる分野で専門性を維持できるのかと顧客に疑問視されれば、弱点にもなり得ます。

同社の資金調達は、モデル非依存のスコアリングが持続的な事業になり得ることを証明する時間を与えます。しかし、どの評価モデルが標準になるのかという問題を解決するものではありません。

非公開テストは一つの問題を解決する一方、別の問題を生む

テストセットを非公開にすることで汚染は抑えられるが、ユーザーは十分に検証できない主張を信頼するよう求められる。

透明性とテストの完全性は、相反する方向に働きます。すべての問題を公開すれば、研究者はベンチマークを監査し、結果を再現し、誤りを特定できます。

しかし同時に、モデル開発者はその教材に直接アクセスできるようになります。そのアクセスにより、意図的な学習、偶発的な汚染、反復的な最適化が起こりやすくなります。

非公開テストは問題を守る一方で、外部からの検証を制限します。ユーザーは、ベンチマーク作成者によるサンプリング、ラベル、評価基準、スコアリング実装を信頼しなければなりません。

Valsは、公開された検証例と非公開のスコアリングデータを通じて、こうした要請の均衡を図ろうとしています。また、評価インフラの一部をオープンソース化しています。

オープンなインフラは再現性を高める可能性があります。研究者は、モデルがどのように呼び出されるか、実行がどのように分散されるか、共通インターフェースが異なるプロバイダーをどう扱うかを調べられます。

ただし、基盤となる非公開の問題は利用できないままです。つまり外部の人間は、Valsからアクセスを得ずに公開スコアを完全に再現することはできません。

このトレードオフはValsに固有のものではありません。FrontierMathなどの新しいベンチマークは、有能なモデルが学習時に公開問題に遭遇する可能性があるため、大半の問題を非公開にしています。

より広範なAI Index reportも、開発者が報告する性能と独立テストの違いを指摘しています。同報告書は、結果を過大に見せる要因として汚染を挙げています。

したがって、非公開データは記録された弱点に対する合理的な対応です。しかし秘密主義は、強い問題を守るのと同じくらい容易に、弱い問題を隠すこともできます。

ベンチマークの設計は、スコアが何を意味するかも決定します。標準化文書に基づく金融評価は、企業固有の報告システムや承認ルールを代表していない可能性があります。

リポジトリから作られたコーディングベンチマークは、問題解決を捉えられても、セキュリティレビュー、アーキテクチャ上の判断、長期的な保守を見落とすかもしれません。

同社はVals Smithを通じて、この隔たりの一部に対応しています。この製品は、選択したGitHubリポジトリをカスタムのコーディングベンチマークへと変換します。

このアプローチでは、購入者の実際の環境により近いコードを対象にモデルをテストできます。同時に、リポジトリの権限、機密コード、生成されたタスクの品質に関する疑問も生じます。

カスタムベンチマークが有用になるのは、そのタスクが人々が実際に完了する必要のある仕事を反映している場合に限られます。簡単すぎる、あるいは人工的な問題は、本番導入の成功を予測せずに安心感のあるスコアを生み出しかねません。

同じ問題はコーディング以外にも当てはまります。評価者には、代表的なケース、明確な成功基準、高コストな失敗の記録が必要です。

組織はすでに、バグ報告、却下された分析、顧客からの苦情、レビューコメントの中に、こうした資料の一部を蓄積しています。それらの記録をテストへ変換するには、慎重なキュレーションが必要です。

独自のエビデンス基盤を構築するチームにとって、検索可能なengineering knowledge baseは、仕様書、インシデントメモ、過去の意思決定を整理する助けになります。これは正式なモデル評価の代替にはなりません。

懐疑的な見方は明快です。Valsはベンダーが選んだテストより信頼性の高い比較を生み出すかもしれませんが、それでも本番環境での成果を予測するには不十分である可能性があります。

ベンチマークが測るのは、選ばれた枠組みの中での性能です。本番システムは、その枠組みの外で変化するデータ、敵対的な入力、権限エラー、人間の行動に直面します。

どのリーダーボードも、こうした条件を一つの決定的な数字に圧縮することはできません。購入者はランキングを自動的な調達判断ではなく、調査のための証拠として扱うべきです。

Valsは、専門家がその結論に異議を唱えられるだけの方法論的な詳細を公表する必要があります。同時に、各テストを保護する教材を露出させずにそれを実現しなければなりません。

このバランスを取る取り組みが、独立したAIモデル評価が信頼されるインフラになるのか、それとも競合する主張の一層にとどまるのかを左右します。

事業の成否はスコアを意思決定へ変えられるかにかかっている

Valsにとって最も強い論拠はモデルを順位付けできることではなく、組織が何を導入すべきかを決める助けになれることだ。

公開リーダーボードは、モデルのリリースが即座の比較を呼ぶため注目を集めます。企業契約は、直接的な業務上の結果をもたらす、より限定的な問いに依存します。

法務チームが重視するのは、エージェントが支配的な法的根拠を見つけ、正確に引用できるかどうかです。銀行には、一貫した計算、追跡可能な前提、統制されたデータアクセスが必要です。

ソフトウェア組織には、自社のリポジトリ、ツール、レビュー基準に基づくテストが必要です。政府の評価担当者には、サイバー能力、自律性、悪用に関する証拠が求められます。

これらの顧客は、成功の定義を共有していません。Valsは再利用可能なインフラを構築しつつ、各購入者が地域固有の要件を定義できるようにする必要があります。

これは難しい製品上の境界です。標準化が強すぎれば関連性が損なわれ、カスタマイズが多すぎれば事業は労働集約的なコンサルティングへと変わってしまいます。

Vals Smithは一つの可能な仕組みを提供します。リポジトリ固有のタスクを生成し、共通の評価プラットフォームで実行できます。

システムがタスク作成と検証の大部分を自動化できれば、Valsは顧客ごとにプロセスを作り直すことなくカスタムの証拠を提供できます。専門家によるレビューが依然として広範に必要であれば、スケーリングはより困難になります。

同社が掲げる売上8倍という主張は初期需要を示唆しますが、持続性についてはほとんど明らかにしていません。Valsは年間経常収益、顧客集中度、継続率、契約期間を開示していません。

また、従来型の前年比成長率を示すのではなく、現在の売上を2025年通年と比較しています。そのため、この発言を正確に解釈するのは難しくなっています。

顧客数が2倍になったという点にも、同様の限界があります。顧客基盤の拡大は心強いものの、アカウント数だけよりも契約価値と拡大のほうが重要です。

チーム規模が3倍になったことは、Valsが予想される需要に先行して投資していることを示します。同時に、継続的なベンチマーク開発を支えるために必要な売上額も増えます。

新しい評価には、分野の専門家、エンジニア、レビュー担当者、インフラ、多数のモデルAPIへのアクセスが必要です。長期的なエージェントテストは、大きな計算資源とレビュー時間を消費する可能性があります。

Valsは、モデルがベンチマークを飽和させたり、スコアリングの弱点を利用したり、新たなインターフェースを獲得したりするたびに、ベンチマークを更新しなければなりません。能力が数か月単位で変化する市場では、静的なテストは価値を失います。

同社の新しいRSI Indexは、そこに伴うコストと野心を示しています。これは、固定された時間と計算予算の下で、モデルがAI研究を実施できるかを評価します。

同社のRSI benchmarkによると、テストされたシステムは実際の実験を完了したものの、先端を走る人間の水準には達しませんでした。また、モデルは開発時の測定値が示唆したよりも、非公開の確認テストでは低い性能を示しました。

この差は、ホールドアウトテストが重要である理由を示しています。実験中に有望だった結果も、未知のデータや統制されたシードに対して繰り返し検証すると弱まる可能性があります。

また、これは見出しになるスコアの限界も示しています。テストされたエージェントは、研究戦略、コスト、実験の頻度、実行の徹底度で異なっていました。

企業が本番導入に向けてモデルを評価する際にも、同じ深さが必要です。単一の割合では、なぜ失敗が起きるのか、あるいは安全策でそれを封じ込められるのかを示せません。

Valsは、スコアを導入上の選択へ結び付けることで価値を生み出せます。特定のリスク許容度に合うモデル、構成、ツール設定を特定しなければなりません。

この立場は、社内評価チームと競合プラットフォームに圧力をかけます。購入者は外部評価者のコストを、自らテストを構築するコストと比較するでしょう。

大手AIラボも、顧客向け評価製品を拡大できます。クラウドプロバイダーはすでに、モデルホスティング、監視、セキュリティ、調達関係を管理しています。

独立プロバイダーは流通力では劣る一方、モデル販売からより距離を置けます。顧客がその分離に対して支払うだけの価値を認めるかどうかが、商業上の問いとして残ります。

4億ドルの評価額は、Valsがこの意思決定レイヤーで意味のあるシェアを獲得できるという前提に立っています。売上成長だけでは、その仮説を証明できません。

証明するのは反復利用です。顧客は新しいリリースのたびに戻り、非公開ベンチマークを更新し、実際の購買や導入レビューで結果を活用しなければなりません。

Techmemeに基づく仮説を試す三つのシグナル

次の段階は、資金調達の見出しだけでなく、導入、方法論への検証、競争上の反応によって評価されるべきだ。

第一のシグナルは、企業による反復利用です。Valsは、顧客が複数のモデルリリースにわたって評価を実行し、その結果を導入判断へ結び付けていることを示すべきです。

一度限りのベンチマークプロジェクトは、サービス依存の強い市場を示唆します。継続的な利用は、評価が恒久的なインフラになりつつあるという考えを裏付けます。

証拠には、更新パターン、ベンチマーク対象範囲の拡大、スコアがモデル選定をどう変えたかを説明する顧客アカウントなどが含まれ得ます。具体的なケーススタディは、集計された成長主張より有用でしょう。

第二のシグナルは、Vals AIベンチマークに対する外部からの検証です。独立研究者は、タスク設計、スコアリングの信頼性、誤差範囲、判定者の挙動を検証できるべきです。

すべての非公開問題にアクセスする必要はありません。しかし、公表されたランキングが合理的な変更の下でも安定しているかを判断するには、十分な証拠が必要です。

Valsが修正、バージョニング、透明性のある方法論更新で対応すれば、異議申し立ては同社を強くします。未解決の不整合は、中立的な権威であるという主張を弱めるでしょう。

第三のシグナルは、モデルラボと競合評価者の反応です。モデルカードでの引用が増えれば、特に結果が引用するラボに不利な場合、Valsの影響力は高まります。

一方、競合する非公開ベンチマークは市場を分断する可能性があります。購入者は、それぞれ異なるルールで作られた、互換性のない複数のスコアに直面するかもしれません。

市場は複数の評価者を支えられますが、意思決定者には依然として共通の報告基準が必要です。スコアには、モデルのバージョン、設定、ツール、コスト、サンプル数、不確実性を明示すべきです。

Valsには拡大する資本があるため、これらのシグナルは今後数か月で重要になります。資金調達は一つの制約を取り除く一方、実行に対する期待を高めます。

同社は公開リーダーボードを更新し、カスタム評価製品を成長させ、ラボ、企業、政策立案者の信頼を維持しなければなりません。これらの集団に同時にサービスを提供することは、その中立性を試すことになります。

読者もまた、どのベンチマークも自らの受け入れテストの代替とみなすべきではありません。独立した証拠は、導入固有の評価と組み合わせることで最も価値を持ちます。

これは、実際の文書、ツール、エッジケース、失敗のコストをテストすることを意味します。また、モデル、プロンプト、検索システム、エージェントのワークフローが変わるたびに評価を再実行することも意味します。

Valsは実際に存在する測定上の隔たりを特定しました。汚染に関する研究と、古いテストが急速に飽和する事実は、その診断を支持しています。

なお不確かなのは、誰がその解決策を担うのかという点です。Valsは重要な独立レイヤーになるかもしれませんし、評価はラボ、顧客、非営利組織、専門ベンダーに分散したままかもしれません。

したがって、Techmemeを基にした資金調達の記事は、あくまで最初の成果にすぎない。資金、安全性、モデル選定がそのスコアに左右される場面で、組織がValsを繰り返し信頼するかどうかを注視したい。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page