top of page

Mantic AI Forecasting、すべての人間参加者を上回り2500万ドルを調達

5 日前
読了時間: 22分

Mantic AI forecastingは、最近の予測トーナメントでシステムがすべての人間参加者を上回ったことを受け、2500万ドルを調達した。この結果はロンドンのスタートアップに強力な実績を与える一方、人間の判断力に対する全面的な勝利を意味するものではない。

シードラウンドはRadical Venturesが主導し、MicrosoftのM12、Thinking Machines Lab、Balderton Capitalなどの投資家が支援した。Manticは現在、トーナメントでの成果を企業、政府、金融機関向けの製品へと転換するための資金を得ている。

その移行こそが本質的な緊張を生む。予測コンテストでは、明確に定義された問いに対して確率を適切に調整する能力が評価される。一方で組織は、不完全な情報、変化する目標、そしてランキング表では測れない結果の中で、コストの高い意思決定を下さなければならない。

したがってManticにとって最も近い競合相手は、別のスタートアップではない。アナリスト、領域専門家、経営陣の判断、そして場合によっては予測市場を組み合わせる、既存の人間による予測ワークフローである。

Mantic AI Forecasting、トーナメントでの勝利を2500万ドルの資金調達へ

Manticは、測定可能な予測結果を、自動化された判断に対するこれまでで最も明確な商業的賭けの一つへと変えた。

同社は2026年9月18日にシードラウンドを発表した。Radical Venturesが資金調達を主導し、M12、Thinking Machines Lab、Balderton Capitalなどの投資家が参加した。

Reutersが報じた発表において、同社は評価額を開示していない。以前の報道では想定評価額は約9000万ドルとされたが、この数字は匿名の情報源によるものだった。

Manticは2024年、CEOのToby ShevlaneとCTOのBen Dayによってロンドンで設立された。Shevlaneは以前、Google DeepMindのリサーチサイエンティストとして勤務し、AI能力と地政学的展開に関連する研究にも携わっていた。

DayはUniversity of Cambridgeで機械学習の博士号を取得している。Manticが公開したチーム情報によると、以前は産業最適化や創薬におけるAI活用に取り組んでいた。

同社はこれまでにプレシード資金として400万ドルを調達している。このラウンドはEpisode 1が主導し、トレーディング企業DRWと、大手AI研究所に関係するエンジェル投資家が参加した。

今回の資金調達は、ManticがSummer 2026 Metaculus Cupで示した成績に続くものだ。Metaculusは、参加者が政治、経済、技術、文化に関する結果へ確率を付与するトーナメントを運営している。

報じられたシード資金調達の詳細によると、Manticはすべての人間参加者を上回った。より高い結果を記録した自動参加者は、laertesと呼ばれる一つだけだった。

この違いは重要だ。Manticは考え得るすべての人間予測者を打ち負かしたわけではなく、あらゆる状況で機械がより優れた判断力を持つかどうかを決着させたわけでもない。

同社が上回ったのは、そのコンテストの問い、日程、採点システムの下で、一つの構造化された競技に参加した人々である。これは依然として重要な結果だが、その限界にも同様の注意を払うべきである。

問いは、トーナメント期間中に答えが観測可能となった出来事を扱っていた。参加者には、後から再解釈できる曖昧な予測ではなく、確率を示すことが求められた。

一例はコロンビアの大統領選挙に関するものだった。ShevlaneはReutersに対し、Manticがトーナメント初期にAbelardo De La Espriellaの勝利確率をおよそ40%と見積もったと語った。

主流の予測は30%に近く、最終的にDe La Espriellaが勝利した。この例は、同システムが単に群衆のコンセンサスを再現していたわけではないことを示唆する。

別の問いは、Shakiraの「Dai Dai」がBillboard Hot 100で「Waka Waka」を上回るかどうかに関するものだった。人間参加者は一方の結果を強く支持していたが、Manticはそのコンセンサスに対してより低い確信を置いた。

より支持されなかった結果が起きた。Shevlaneはこの結果を、システムが群集行動に抗した証拠として示したが、一つの例だけで一般的な傾向を確立することはできない。

資金調達は、こうした結果をより大きな提案へと変える。投資家は、Manticがより多くの問いでその成績を再現し、確率を重大な意思決定につなげられることに賭けている。

だからこそ、これは通常のシード発表以上の意味を持つ。予測はAIシステムの現実世界における推論を、異例なほど直接的に検証できるため、Manticは資金を得た。

予測はやがて結論に至る。システムは採点され、人間の判断と比較され、予測時点では未知だった結果を用いて改善できる。

より難しい問いは、その採点の後に始まる。Manticは、正確な確率が、インセンティブ、タイミング、説明責任が複雑な組織内での意思決定を改善できることを示さなければならない。

なぜ今、予測がAI投資の対象になったのか

AI予測が資金を集めているのは、新しいシステムが人間チームでは維持できない規模で、予測を調査・更新・採点できるためだ。

従来の機械学習は、組織が豊富な構造化データを持ち、入力と結果の関係が安定している場合に優れた性能を発揮する。判断を要する予測は、異なる問題を提示する。

判断を要する予測には、反復的な測定だけでなく文脈的な推論を必要とする出来事が含まれる。選挙、規制上の決定、武力紛争、経営幹部の退任、製品発売はこのカテゴリーに当てはまる。

こうした出来事が明確な過去のパターンに従うことは稀だ。関連する証拠は、報道記事、公的発言、経済指標、社会的行動、類似事例にまたがって現れる。

人間の予測者は、こうしたシグナルを組み合わせられる。しかし、優れた予測者は希少であり、その注意力を継続的に変化する数千の問いへ広げることはできない。

大規模言語モデルは、規模における優位性をもたらす可能性がある。情報を収集し、過去の事例を比較し、競合する議論を生成し、新たな証拠が届くたびに数値的確率を更新できる。

この能力がAIを自動的に正確にするわけではない。だが、検証と反復の経済性を変えるため、投資家の関心を説明する助けとなる。

人間の予測者は、手法が機能したかを知るまでに数カ月待つことがある。自動化システムは、すでに結論が出た多数の問いにわたって評価できる。

Manticによると、そのシステムは1週間先から1年先までの予測を扱う。掲げる対象領域には、地政学、ビジネス、政策、技術、文化が含まれる。

これらは、組織がすでにアナリストに弱いシグナルの解釈を依頼している領域だ。同時に、誤った想定が資本、人員、在庫、政策の配分を変え得る領域でもある。

同社の公開予測システムは、金融アナリスト、企業戦略担当者、リスクチーム、研究者、政策立案者を対象としている。例として、金利、制裁、訴訟、経営陣の交代、供給の混乱を挙げている。

ヘッジファンドにとって、改善された確率は取引判断に役立つ可能性がある。製造業者にとっては、混乱が明白になる前に在庫や調達の判断に影響を与え得る。

政府は予測を用いて緊急対応計画の優先順位を決められる可能性がある。企業戦略チームは、競合他社が定められた期間内に製品を発売する確率を追跡できる。

Radical Venturesのパートナー、Aaron RosenbergはReutersに対し、企業や政府機関が関心を示していると語った。また、一部の組織はManticのAIを統合しているとも述べたが、同社は顧客名の公表を拒んだ。

実名の顧客がいないことは、独立した評価を制約する。それでも、関心を持つ買い手の幅広さは、予測が商業的なAIカテゴリーになり得る理由を示している。

この製品は、ユーザーが適切な質問をするのを待つ、別の会話型インターフェースではない。リスクと機会を監視できる、持続的な確率レイヤーを提供すると約束している。

この約束は、汎用モデルの調査能力と多段階推論能力が向上する中でもたらされた。システムは現在、最新の証拠を取得し、情報源を比較し、絶え間ない人間の指示なしにワークフローを繰り返せる。

以前の証拠は、機械にとってはるかに不利だった。実世界の予測研究では、GPT-4はライブトーナメントにおいて人間集団の予測より有意に精度が低いことが示された。

重要なのは「ライブ」という言葉だ。答えが未知のままである場合、モデルは既知のベンチマーク資料に記憶された解答へ依存できない。

今回のManticの結果は、特化型システムがその差を縮める、あるいは超えられる可能性を示唆している。改善は、単独で動作する一つの基盤モデルではなく、予測パイプライン全体から生じているように見える。

この違いは、資金調達の論拠も説明する。最先端モデルは入力要素になりつつあり、スタートアップは調査のオーケストレーション、評価データ、更新方針、較正、顧客統合を通じて競争する。

これらのレイヤーが一貫してより良い予測を生み出せるなら、基盤となるモデルが広く利用可能になっても、その価値は持続し得る。

したがって投資対象は、見世物としての予測ではない。組織がすでに下す必要のある意思決定を取り巻く不確実性を継続的に測定するためのオペレーティングシステムである。

真の競合相手は人間の予測ワークフロー

Manticが競争しているのは、抽象的な意味での人間の知能ではなく、遅く断片化された意思決定プロセスである。

組織が一人の予測者だけに依存することはほとんどない。レポート、会議、スプレッドシート、外部コンサルタント、専門家の意見、経営陣の直感を組み合わせている。

各入力には価値ある知識が含まれ得る。弱点は、それらの入力を、時間とともに追跡・採点できる一貫した確率へ変換することにある。

あるアナリストは規制承認が有力だと表現するかもしれない。別のアナリストは可能性があると述べるかもしれない。3人目は確率を示さずに待つことを勧めるかもしれない。

こうした表現は比較が難しい。また、結果が判明した後に、人々が以前の確信を再解釈する余地も与える。

予測プラットフォームには、より明確なコミットメントが求められる。70%の予測は、比較可能な10件のうちおよそ7件で起きるべきだ。

この性質は較正と呼ばれ、表明された確率が、多数の予測における観測頻度と一致すべきことを意味する。較正は確信を、組織が監査できるものへ変える。

人間の予測チームも、これをうまく実行できる。Good Judgment Projectに関連する研究では、訓練を受けたジェネラリストが、地政学上の問いにおいて従来の専門家プロセスを上回り得ることが示された。

最も優れた予測者は問題を分解し、比較対象を用い、頻繁に更新し、イデオロギー的な確信を避けた。こうした習慣は教えられるが、企業全体で維持するには規律が必要となる。

Manticの優位性は再現性にある。ソフトウェアは、追跡するすべての問いに同じプロセスを適用し、予定に従って更新し、各確率変更の記録を保持できる。

このシステムは、小規模なアナリスト集団より多くの問いも扱える。この規模は重要だ。なぜなら、意思決定者は、どの問題により深い注意を向けるべきかを知る前に、幅広い監視を必要とすることが多いためだ。

たとえば企業は、市場全体にわたる経営陣の交代を追跡できる。そして、確率が社内の閾値を超えた場合にのみ、人間のアナリストを割り当てられる。

この分業は、アナリストを完全に置き換えるよりも、より信頼できる商業的な道筋を生む。機械が広範なカバー範囲と継続的な更新を提供し、人間が結果を調査して、その後に取るべき行動を決める。

それでもManticは、集約された人間の群衆という強力な既存勢力に直面している。群衆は独立した情報を組み合わせ、個々の偏りの一部を相殺できる。

過去の競争分析では、Metaculusコミュニティの予測が同プラットフォームで最も安定した成果を上げる存在の一つであり続けたことが示された。この集約予測は以前、四半期イベントでManticを上回った。

予測市場は別の手段を提供する。KalshiやPolymarketなどのプラットフォームは、金銭的インセンティブと市場価格を用いて、分散した信念を集約する。

参加者が新たな情報に接すると、市場は迅速に更新できる。十分な取引活動があれば、透明性のある確率も提供する。

その弱点は、カバレッジの偏りにある。トレーダーは、組織が回答を必要とするあらゆる問いではなく、注目、流動性、あるいは娯楽性を集める問いに集中する。

企業は、特定のサプライヤーに関する規制を深刻に懸念するかもしれない。その問いは、有意な市場価格を形成するほどの外部参加を集めない可能性がある。

人間の専門家は対照的なトレードオフを示す。深い文脈を提供し、組織固有の詳細を理解できる一方、その仕事は依然として高コストで、拡張も難しい。

Manticの中核的な賭けは、自動化システムがこれらのアプローチの間に位置できるというものだ。ある程度の調査の深さと確率的な規律を保ちながら、個別に合わせたカバレッジを提供できる。

この主張は、システムが世界最高の人間予測者を上回る前から、商業的に有用になり得る。数千に及ぶ専門的な問いで優れた群衆に匹敵するだけでも、ワークフローは変わる。

したがって企業の購入者は、導入を人間対機械として捉えるべきではない。より適切な検証は、同じ条件下で完全な意思決定プロセスを比較することだ。

一方のグループは従来の分析を使う。もう一方は、説明と更新を伴うManticの確率を受け取る。両グループは、測定可能な結果を伴う同等の意思決定に直面する。

この比較により、システムがタイミング、確信度、資源配分を改善するかどうかが明らかになる。また、数値予測を超えて人間の専門家が価値を加える場面も示される。

最も強い圧力がかかるのは、予測を保存せず、過去のパフォーマンスを評価もしない調査プロセスだ。Manticは、測定されない判断を擁護しにくくする。

また、分析担当者には二つの業務を分ける圧力もかかる。何が起きるかを推定することと、組織としてそれにどう対応すべきかを決めることは別である。

完全に校正された予測であっても、組織のリスク許容度を選ぶことはできない。結果が深刻であるため、低確率の事象に備えるべきかどうかも決められない。

Manticは予測の層に挑戦できる。行動への責任は、依然として人と組織に属する。

Manticが予測システムを訓練する方法

Manticの仕組みは、最先端モデル、過去データのバックテスト、反復的なスコアリング、そして最終的に判明した結果に基づく訓練を組み合わせている。

同社は、基盤モデルを完全にゼロから構築したとは主張していない。ShevlaneはReutersに対し、Manticは予測タスク向けに他のAI研究所のモデルを特化させていると語った。

プロセスは、明確な判定基準を持つ問いから始まる。経済が健全に見えるかを問うのではなく、問いは測定可能な事象と期限を特定しなければならない。

システムはその後、利用可能な証拠を調査し、起こり得る結果に確率を割り当てる。新たな情報が入れば、それらの確率を見直すことができる。

事象が確定すると、予測にはスコアが与えられる。確率的スコアリングでは、慎重な不確実性よりも、誤った結果に対する強い確信が重くペナルティを受ける。

代表例はBrierスコアで、予測確率と実際の結果との差の二乗を測定する。スコアが低いほど予測は優れている。

反復的なスコアリングは訓練信号を提供する。システムは、より良い結果と相関する調査手法、証拠の種類、推論パターン、更新ルールを学習できる。

Manticによると、シミュレーション対象日の時点で利用可能だった資料に情報を限定しながら、過去の期間を再現できるという。これにより開発者は、新たな事象を何カ月も待たずに戦略を検証できる。

同社は、2024年と2025年の予測質問1万件超を含むデータセットを構築したと報告している。また、2025年第2四半期の348件の質問でバックテストを行ったとも報告している。

これらの数値は、Mantic自身の技術的説明によるものだ。本記事のために確認した資料では、独立監査は行われていない。

バックテストは大きな速度上の利点を生む。開発者はシステムを変更し、過去の質問を再実行し、すべての事象が再び確定するのを待たずにスコアを比較できる。

Manticは、予測結果から得られる報酬を使って行動を調整する強化学習も用いるとしている。目的は流麗な文章ではなく、より高い確率的精度だ。

これにより、言語モデルの推論の評価方法が変わる。もっともらしい説明であっても、それに対応する確率の成績が悪ければ特別な評価は得られない。

システムは異なる構成要素を個別に検証することもできる。一つのモデルが証拠を集め、別のモデルが前提を検証し、集約ステップが複数の推定を組み合わせる場合がある。

Manticは、現在の本番アーキテクチャのすべての構成要素を公表していない。外部の読者は、一つのモデルが各最終確率を独立して生成していると想定すべきではない。

Shevlaneは、より広範なアプローチを最先端モデルの特化と説明している。したがって同社の防御可能な優位性は、オーケストレーション、独自の評価データ、訓練手法にある可能性がある。

このプロセスには、投資家にとって魅力的な性質が三つある。測定可能な結果を生み、迅速な反復を支え、多数の問いへ拡張できる。

また、珍しいフィードバックループもある。確定した問いのすべてが、システムの校正と意思決定ルールに関する証拠を追加する。

ただし、バックテストには慎重な管理が求められる。モデルが元の訓練中に、その結果または関連報道に接していた可能性がある。

過去の回答がテストに漏れ込めば、得られるスコアは予測能力とともに記憶も測ることになる。基盤モデルの訓練データが非開示のままであれば、この問題はさらに難しくなる。

最近のリーケージ研究は、バックテストのスコアだけでは、どの程度の隠れた情報が結果に影響したかを判断できないと論じている。研究者には外部の参照点と明示的な前提が必要だ。

ライブトーナメントでは、予測時点で結果が未知であるため、この特定のリスクは軽減される。そのため、Manticの2026年夏の結果は、非公開の回顧的ベンチマークよりも有益な情報を提供する。

ライブ評価には別の複雑さがある。質問の選定、更新頻度、参加ルール、スコアリングの計算式はいずれも順位に影響し得る。

ニュースを継続的に監視するシステムは、限られた時間に予測する人間よりも、当然ながらカバレッジ上の優位性を持つ。この優位性は、科学的な比較を複雑にするとしても、商業的には有用である。

この違いを欠点として扱うべきではない。企業が常時稼働のシステムを求めるのは、多くの場合、人間が毎時何百もの確率を更新できないからにほかならない。

重要な要件は、透明性のある評価だ。購入者には、精度、校正、カバレッジ、適時性、意思決定への影響をそれぞれ分けた測定が必要である。

単一のトーナメント順位は、これらの次元を一つの結果に圧縮する。製品導入では、それらを再び分解する必要がある。

「超人的」というラベルが証明しないこと

「超人的」という表現は、一つのコンテスト結果を正確に表しているが、Manticの能力全般に関する主張としては依然として広すぎる。

最も強く検証された主張は限定的だ。Manticは2026年夏のMetaculus Cupで人間の全参加者を上回り、別の自動化システム一つに次ぐ順位で終えた。

問いがライブだったため、この結果には意味がある。しかし、あらゆる領域、時間軸、ユーザー群、意思決定環境での優位性を確立するものではない。

トーナメント参加者には、経験や活動量の違いもある。人間の中には、自動化された参加者より少ない質問に答えたり、更新頻度が低かったりする者もいる。

予測コンテストに関する過去の報道では、スコアリングがカバレッジを評価する場合があることが指摘されている。システムは早期に回答し、より多くの問いを扱い、定期的に更新することで利益を得る。

これらの行動は実務上価値がある。しかし、カバレッジと精度を組み合わせる順位付けでは、対応するすべての予測において機械がより良い判断を下したかどうかは分からない。

比較対象の範囲も重要だ。トーナメント参加者全員に勝つことは、慎重に選抜されたプロのスーパーフォーキャスターのチームに勝つことと同じではない。

システムは一般的な問いでは優位でも、ニッチな地域政治、技術規制、または非公開情報に左右される意思決定では苦戦する可能性がある。

組織が問う内容も、公開トーナメントとは異なる。社内予測は、機密の製品スケジュール、交渉、顧客行動、業務上の障害に関わることがある。

Manticは、公開ウェブでの調査が証拠の一部しか提供しない場合にも、その手法が移転できることを示さなければならない。エンタープライズ導入では、社内文書や構造化された企業データへの安全なアクセスが必要になる可能性がある。

この統合はガバナンス上の問いを生む。確率は採用、資本配分、保険、取引、公共政策、あるいはセキュリティ計画に影響し得る。

ユーザーは、証拠が欠けているとき、情報源が矛盾するとき、不確実な報道が一つシステムに入ったことで予測が変わるときに、それを知る必要がある。

説明は役立つが、流暢な説明は誤った確信を生み得る。もっともらしい物語は、基礎となる確率が校正されていることを保証しない。

予測は、それが記述する事象自体にも影響を与え得る。銀行、選挙、紛争に関する公開予測は行動に影響し、結果を変える可能性がある。

非公開の予測は別の懸念ももたらす。顧客が外部の研究者には検証できない予測に基づいて行動する可能性があり、独立したパフォーマンス評価が難しくなる。

非開示の顧客リストは、いくつかの重要な問いを未解決のままにしている。読者は、組織がManticをどのように使っているのか、またシステムが意思決定を改善したのかを、まだ検証できない。

精度それ自体は有用性と同義ではない。予測は行動を変えられるほど早く届く必要があり、潜在的な便益は実装コストを上回らなければならない。

新たな輸出制限が導入される確率が20%だとするサプライチェーンチームを考えてみよう。この確率が意味を持つのは、対応策とそのコストが組み合わされた場合だけだ。

組織はサプライヤーを多様化する、在庫を増やす、あるいは待つという選択をし得る。Manticはこの選択に情報を与えられるが、企業のリスク選好を提供することはできない。

自動化バイアスの危険もある。モデルに不可欠な文脈が欠けていても、意思決定者は数値予測が客観的に見えるため、それに従う可能性がある。

逆の問題も残る。予測が直感や組織内の政治と衝突するたびに、経営陣が校正された予測を無視する可能性がある。

どちらの失敗も、主として技術的な問題ではない。これらは、組織がいかに権限を割り当て、意思決定を記録し、誤りを見直すかに関わる。

Mantic自身の例も、慎重な解釈を支持している。その有用な貢献は未来に関する確実性ではなく、証拠に応じて更新される規律ある確率だ。

70%の予測は、正しく校正されていても10回中3回は外れる。この数値を保証として扱うユーザーは、製品を誤解することになる。

同じ原則はまれな事象にも当てはまる。システムは低い確率を責任を持って割り当てられるが、それでも事象は発生し、広範な損害をもたらす可能性がある。

購入者は、領域、予測期間、質問の種類、情報の利用可能性ごとに分解されたパフォーマンスを求めるべきだ。集約スコアは、弱いカテゴリーを隠す可能性がある。

凍結された予測と継続的に更新される予測も比較すべきです。直前の正確な更新と、数か月前に出される早期警告では、果たす目的が異なります。

信頼区間とサンプルサイズも重要です。予測が連続して的中したことは、能力、有利な設問選択、あるいは偶然を反映している可能性があります。

Manticの資金調達により、より幅広い証拠を生み出すためのリソースが得られました。そうした証拠が示されるまでは、「超人的な予測」は検証可能な製品上の主張として扱うべきです。

Manticの賭けを試す3つのシグナル

Manticの次の段階は、実運用でのパフォーマンス、公開される導入実績、そして予測がトーナメントの外で意思決定を改善することを示す証拠によって評価されるでしょう。

最初のシグナルは、将来を対象とするコンペティションでの継続的な成果です。ここでいう将来を対象とするとは、すべての予測が記録された時点で結果がまだ分かっていないことを意味します。

Manticは、複数のトーナメント、設問セット、時間軸にわたって好成績を収める必要があります。1度の勝利は注目を集められますが、信頼性を確立するのは繰り返し得られる結果です。

最も有用な開示には、生の正確性、キャリブレーション、カバレッジ、更新頻度、同一の人間による予測との比較が含まれるでしょう。分野別の結果は、システムがどこで苦戦するのかを明らかにします。

現在のMetaculus tournamentは、継続的な観察の場を1つ提供しています。今後の結果は、夏のパフォーマンスが再現可能だったという主張を強めることも弱めることもあり得ます。

再び上位で終えれば、Manticの技術的な論拠を支持することになるでしょう。大幅な順位低下は、設問選択、競合相手、またはトーナメント条件への感度を示唆します。

2つ目のシグナルは、測定可能なワークフローを伴う、実名の顧客導入です。Manticとその投資家は、企業や政府機関が関心を示していると述べています。

関心は導入と同義ではありません。意味のある事例では、顧客がどのような問いを追跡し、予測がどのように意思決定に組み込まれ、何が変化したのかが説明されるはずです。

確率の改善を測定可能なリターンに結び付けられるため、金融機関は明白な初期市場です。一方で、独自の戦略を開示する可能性は低いでしょう。

企業のリスクチームは、より可視性の高い証拠を提供するかもしれません。機密性の高い意思決定を明かさずに、警告までの時間の改善、より広いカバレッジ、見逃した事象の減少を報告できる可能性があります。

政府での導入は、地政学や政策に対する関連性を示すでしょう。同時に、監査可能性、調達、セキュリティ、説明責任に関するより厳しい要件も生じます。

収益を明らかにしなくても、実名での導入は商業面の根拠を強めます。秘密主義が続けば、外部の人々は投資家の発言に依存せざるを得ません。

3つ目のシグナルは、予測の品質と意思決定の品質を分けて示す製品上の証拠です。Manticは、単なる確率の流れ以上のものを示さなければなりません。

有用な製品は、予測履歴を保持し、大きな更新を説明し、影響力のある証拠を特定し、比較可能な問いにわたるキャリブレーションを示すべきです。

また、意思決定の閾値も支援すべきです。顧客は、リスクが30%、50%、70%を上回ったときにどのような行動を取るかを指定できるかもしれません。

このつながりにより、予測は装飾的なものではなく、実務で機能するものになります。また、組織は利用者が一貫して行動したかどうかを監査できるようになります。

Manticのシステムは、注意配分の手段として最も価値を発揮する可能性があります。数百の問いをスキャンし、意味のある変化にフラグを立て、新たなリスクへ専門家の注意を向けることができるでしょう。

このモデルは、人間の専門知識の役割を維持します。人々が影響を評価し、不足している文脈に異議を唱え、行動を選択する一方、ソフトウェアは広範な確率的カバレッジを維持します。

同社の2,500万ドルのラウンドにより、そのモデルを検証する余地が生まれました。この資本は、自動化された予測が長期的な組織の信頼を獲得できるかどうかを解決するものではありません。

Mantic AI forecastingには現在、検証済みのトーナメント結果、著名な投資家、そして迅速な改善を目指して設計された仕組みがあります。次に必要な証拠は、繰り返される実運用テストと実際の意思決定から得られなければなりません。

開発者にとっての教訓は、検索、キャリブレーション、更新、リーク防止策を含む予測パイプライン全体を評価することです。高性能なベースモデルは、あくまで1つの構成要素にすぎません。

エンタープライズの購入者は、広範な自動化ではなく、記録を残すパイロットから始めるべきです。明確に定義した問いを選び、人間のベースラインを保存し、意思決定の閾値を設定し、解決したすべての結果を評価してください。

ナレッジワーカーは、確率を指示ではなく構造化された証拠として扱うべきです。裏付けとなる情報源と前提は、検索可能なknowledge baseを通じて利用できる状態に保ってください。

決定的な問いは、AIが予測コンテストで勝てるかどうかではありません。組織がその予測を検証し、適切に行動し、あらゆる結果から学べるかどうかです。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page