top of page

Mantic AI 预测在击败所有人类参赛者后获得 2500 万美元融资

6天前
讀畢需時 16 分鐘

Mantic 的 AI 预测业务在其系统于近期一场预测锦标赛中表现优于所有人类参赛者后,获得了 2500 万美元融资。这一结果让这家伦敦初创公司拥有了极具说服力的优势主张,但并不意味着它已在所有方面战胜人类判断。

本轮种子融资由 Radical Ventures 领投,Microsoft 的 M12、Thinking Machines Lab、Balderton Capital 及其他投资者参与支持。Mantic 现在拥有了资金,可将锦标赛成绩转化为面向企业、政府和金融机构的产品。

这一转变才是真正的关键张力所在。预测竞赛奖励的是对明确问题给出校准良好的概率判断,而组织必须在信息不完整、目标不断变化,以及排行榜无法衡量的后果面前作出代价高昂的决策。

因此,Mantic 最接近的对手并非另一家初创公司,而是现有的人类预测工作流程——它结合了分析师、领域专家、高管判断,有时还包括预测市场。

Mantic AI 预测将锦标赛胜利转化为 2500 万美元融资

Mantic 将可量化的预测成果,转化为迄今对自动化判断最明确的商业押注之一。

该公司于 2026 年 9 月 18 日宣布完成种子轮融资。Radical Ventures 领投,M12、Thinking Machines Lab、Balderton Capital 及其他投资者参投。

在 Reuters 报道的公告中,该公司没有披露估值。此前一篇报道曾称其预期估值接近 9000 万美元,但该数字引述的是一位未具名消息人士。

Mantic 于 2024 年由 CEO Toby Shevlane 和 CTO Ben Day 在伦敦创立。Shevlane 此前曾担任 Google DeepMind 的研究科学家,研究领域包括与 AI 能力及地缘政治发展相关的课题。

根据 Mantic 已公布的团队信息,Day 拥有剑桥大学机器学习博士学位。他此前的工作涵盖工业优化以及 AI 在药物研发中的应用。

该公司此前已获得 400 万美元的种子前融资。Episode 1 领投该轮融资,交易公司 DRW 及与主要 AI 实验室有关联的天使投资人参与其中。

这笔新融资紧随 Mantic 在 2026 年夏季 Metaculus Cup 中的表现之后。Metaculus 举办的锦标赛要求参与者为政治、经济、技术和文化事件的结果赋予概率。

据报道的种子融资详情,Mantic 的成绩超过了每一位人类参赛者。只有一个名为 laertes 的自动化参赛者取得了更高成绩。

这一区别很重要。Mantic 并没有击败所有可能的人类预测者,也没有解决机器是否在所有情境下都拥有更佳判断力的问题。

它击败的是在该竞赛的问题、赛程和评分体系下参加这场结构化竞赛的人类。这仍是一项重要成果,但其边界也同样值得关注。

竞赛问题涵盖了答案会在赛事期间变得可观察的事件。参与者必须给出概率,而不是提出日后可以被重新解读的模糊预测。

其中一个例子涉及哥伦比亚总统选举。Shevlane 向 Reuters 表示,Mantic 在赛事早期赋予 Abelardo De La Espriella 约 40% 的胜选概率。

当时的主流预测更接近 30%,而 De La Espriella 最终获胜。这一例子表明,该系统并非只是复现群体共识。

另一个问题是,Shakira 的《Dai Dai》是否会在 Billboard Hot 100 上超过《Waka Waka》。人类参与者强烈倾向于其中一种结果,而 Mantic 对这一共识的信心较低。

较不受欢迎的结果发生了。Shevlane 将此结果视为该系统能够抵抗从众行为的证据,但单一案例无法确立普遍规律。

这笔融资将这些结果转化为更大的命题。投资者押注 Mantic 能够在更多问题上复现其表现,并将概率与影响重大的决策连接起来。

因此,这不只是一则常规种子轮融资公告。Mantic 获得融资,是因为预测为检验 AI 系统现实世界推理能力提供了一种异常直接的方式。

预测最终会得到答案。系统可以被评分、与人类判断进行比较,并利用作出预测时尚未知的结果加以改进。

更棘手的问题始于评分之后。Mantic 必须证明,准确的概率能够改善组织内部的决策——在这些组织中,激励机制、时机和问责仍然复杂。

为什么预测如今成为 AI 投资目标

AI 预测正在吸引资金,因为更新一代的系统能以人类团队无法长期维持的规模开展研究、更新和评分预测。

当组织拥有大量结构化数据,且输入与结果之间的关系稳定时,传统机器学习表现良好。判断型预测则是另一类问题。

判断型预测涉及需要情境推理、而不只是重复测量的事件。选举、监管决策、武装冲突、高管离职和产品发布都属于这一类别。

这些事件很少遵循清晰的历史模式。相关证据分散在新闻报道、公开声明、经济数据发布、社会行为和类似案例中。

人类预测者可以整合这些信号。然而,优秀预测者稀缺,而且他们的注意力无法扩展到数千个持续变化的问题上。

大语言模型带来了潜在的规模优势。它们可以收集信息、比较历史案例、生成相互竞争的论点,并在新证据出现时更新数值概率。

这种能力并不会自动使 AI 变得准确。它改变的是测试和迭代的经济性,这有助于解释投资者的兴趣。

人类预测者可能要等上数月,才能知道某种方法是否有效。自动化系统则可以在大量已有结果的问题集合上接受评估。

Mantic 表示,其系统处理的预测时间跨度从一周到一年。其所列领域包括地缘政治、商业、政策、技术和文化。

这些领域本就是组织付费请分析师解读微弱信号的地方。它们也是错误假设可能重新配置资本、人手、库存或政策的领域。

该公司公开的预测系统面向金融分析师、企业战略人员、风险团队、研究人员和政策制定者。其示例包括利率、制裁、诉讼、领导层变动和供应中断。

对于对冲基金而言,更准确的概率可以为交易提供参考。对于制造商而言,它可以在供应中断变得明显之前影响库存或采购决策。

政府可以利用预测来确定应急规划的优先级。企业战略团队则可以追踪竞争对手在特定期限内推出产品的概率。

Radical Ventures 合伙人 Aaron Rosenberg 向 Reuters 表示,企业和政府机构已表达兴趣。他还称,一些组织已集成 Mantic 的 AI,但该公司拒绝透露客户身份。

缺少具名客户限制了独立评估。不过,感兴趣买家的范围仍说明了预测为何可能成为一个商业 AI 类别。

该产品并不是又一个等待用户提出正确问题的对话界面。它承诺提供一个持续运行的概率层,用于监测风险和机会。

随着通用模型在研究和多步骤推理方面不断提升,这一承诺也随之出现。系统如今可以检索当前证据、比较来源,并在无需持续人工提示的情况下重复执行工作流程。

早期证据对机器则远没有如此有利。一项真实世界预测研究发现,在一场实时锦标赛中,GPT-4 的准确性显著低于人类群体预测。

关键在于“实时”。当答案仍然未知时,模型无法依赖从熟悉的基准材料中记忆的解法。

Mantic 的新结果表明,专门化系统可以缩小甚至跨越这一差距。这种提升似乎来自完整的预测流程,而非单独运行的某个基础模型。

这一区别也解释了融资逻辑。前沿模型正成为投入要素,而初创公司则通过研究编排、评估数据、更新策略、校准能力和客户集成展开竞争。

如果这些层面能够持续产出更优预测,那么即使底层模型广泛可用,它们的价值也能够延续。

因此,投资目标并非将预测当作一种表演,而是打造一个操作系统,持续衡量组织本就需要作出决策时所面临的不确定性。

真正的对手是人类预测工作流程

Mantic 所竞争的是一个缓慢且碎片化的决策过程,而不是抽象意义上的人类智能。

组织很少依赖单一预测者。它们会综合报告、会议、电子表格、外部顾问、专家意见和高管直觉。

每一种输入都可能包含有价值的知识。其弱点在于,难以将这些输入转化为能够随时间追踪和评分的一致概率。

一名分析师可能将某项监管批准描述为很可能发生。另一名分析师可能认为它有可能发生。第三名分析师可能建议等待,却不说明任何概率。

这些表述难以比较。它们也使人们能够在结果揭晓后重新诠释自己此前的信心程度。

预测平台要求作出更明确的承诺。一个 70% 的预测,在十个可比案例中应大约发生七次。

这一特性被称为校准,即所陈述的概率应与大量预测中观察到的频率相匹配。校准让信心成为组织可以审计的对象。

人类预测团队也能在这方面做得很好。与 Good Judgment Project 相关的研究表明,经过训练的通才能够在地缘政治问题上优于传统专家流程。

最优秀的预测者会拆解问题、运用比较类别、频繁更新,并抵制意识形态式的确定性。这些习惯可以培养,但要在整个企业中保持它们需要纪律。

Mantic 的优势在于可重复性。软件可以将相同流程应用于每一个被追踪的问题,按计划更新,并保留每次概率变化的记录。

该系统也能覆盖比小型分析师团队更多的问题。这种规模很重要,因为决策者往往需要广泛监测,才能知道哪个议题值得投入更深入的关注。

例如,一家公司可以追踪整个市场的领导层变动。随后,只有当某项概率跨越内部阈值时,它才需要指派人类分析师介入。

这种分工比完全取代分析师形成了更可信的商业路径。机器提供广度和持续更新,而人们负责调查后果,并决定接下来应采取何种行动。

尽管如此,Mantic 仍要面对汇聚人类群体智慧这一强劲既有竞争者。群体能够整合独立信息,并抵消一部分个体偏见。

此前的竞争分析发现,Metaculus 社区预测依然是该平台表现最稳定的参与者之一。该汇总预测此前曾在一个季度赛事中排名高于 Mantic。

预测市场提供了另一条路径。Kalshi 和 Polymarket 等平台利用金融激励和市场价格来汇集分散的信念。

当参与者获得新信息时,市场能够快速更新。在交易活动充足时,它们也能提供透明的概率。

其弱点在于覆盖范围不均衡。交易者会集中关注那些能够吸引注意力、流动性或娱乐价值的问题,而不是组织需要获得解答的每一个问题。

一家公司可能极为关心某项狭窄的供应商监管规定。这个问题或许永远无法吸引足够的外部参与者,从而形成有意义的市场价格。

人类专家则呈现相反的权衡。他们拥有深厚的背景知识,能够理解机构层面的细节,但其工作依然成本高昂且难以规模化。

Mantic 的核心押注是,自动化系统能够占据这两种方法之间的空间。它可以提供定制化覆盖,同时保留一定的研究深度和概率纪律。

即使该系统尚未击败全球最顶尖的人类预测者,这一主张也已具备商业价值。若能在数千个专业问题上匹配优秀群体的表现,就足以改变工作流程。

因此,企业买家不应将采用该系统简单框定为人类与机器的对决。更好的测试方式,是在相同条件下比较完整的决策流程。

一组可能采用传统分析。另一组则可能获得附带解释和更新的 Mantic 概率预测。两组都将面对等价的决策,并产生可衡量的结果。

这种比较将揭示该系统是否改善了时机把握、信心和资源配置。它也将显示,人类专家在数值预测之外何时能够创造价值。

压力最直接地落在那些既不保存预测、也不评估过往表现的研究流程上。Mantic 让未经衡量的判断更难以辩护。

它还促使分析师区分两项任务。估计会发生什么,与决定组织应如何应对,是不同的事情。

即使是校准完美的预测,也无法替组织选择其风险承受能力。它无法决定某个低概率结果是否值得提前准备,因为其后果可能极为严重。

Mantic 可以挑战预测层面。行动责任仍属于个人和机构。

Mantic 如何训练预测系统

Mantic 的机制结合了前沿模型、历史回测、重复评分,以及针对最终已知结果的训练。

该公司并未声称完全从零开始构建基础模型。Shevlane 告诉 Reuters,Mantic 会将其他 AI 实验室的模型专门化,用于预测任务。

这一过程始于具有明确判定标准的问题。与其询问某个经济体看起来是否健康,一个问题必须明确可衡量的事件及截止日期。

随后,系统研究可获得的证据,并为可能的结果分配概率。随着新信息到来,它可以重新审视这些概率。

事件尘埃落定后,预测将获得评分。概率评分会对错误结果中的过度自信施加比谨慎不确定性更重的惩罚。

一个常见例子是 Brier score,它衡量预测概率与实际结果之间的平方差。分数越低,预测越好。

重复评分提供了训练信号。系统可以学习哪些研究方法、证据类型、推理模式和更新规则与更好的结果相关。

Mantic 表示,它可以重放历史时期,同时将信息限制在模拟日期当时可获得的材料范围内。这使开发者能够测试策略,而无需等待数月让新事件发生。

该公司称,其已构建一个包含 2024 年和 2025 年逾 10,000 个预测问题的数据集。它还称,已对 2025 年第二季度的 348 个问题进行了回测。

这些数字来自 Mantic 自己的技术说明。在为本文审阅的材料中,它们尚未经过独立审计。

回测带来了显著的速度优势。开发者可以修改系统、重新运行历史问题并比较分数,而无需等待每个事件再次得到解决。

Mantic 还表示,它使用了强化学习,即根据由预测结果产生的奖励来调整行为。其目标不是写出华丽的文字,而是获得更好的概率准确性。

这改变了对语言模型推理的评估方式。如果相关概率表现不佳,再有说服力的解释也不会获得额外认可。

系统还可以分别测试不同组件。一个模型可能负责收集证据,另一个负责质疑假设,而汇总步骤则可能整合多个估计结果。

Mantic 尚未公开披露其当前生产架构的每个组件。外部读者不应假定每个最终概率都由单一模型独立生成。

Shevlane 将这一更广泛的方法描述为对前沿模型进行专门化。因此,该公司的可防御优势可能体现在编排能力、专有评估数据和训练方法上。

这一过程对投资者有三个吸引人的特性。它能产生可衡量的结果,支持快速迭代,并可扩展至大量问题。

它还拥有一个不同寻常的反馈回路。每个已判定的问题都会为系统的校准和决策规则增加证据。

然而,回测需要谨慎的控制。模型可能已在其最初训练期间接触过结果或相关报道。

如果历史答案泄漏到测试中,所得分数衡量的便不只是预测能力,还包括记忆能力。当基础模型的训练数据仍未披露时,这个问题会更加棘手。

近期的泄漏研究认为,仅凭回测分数无法确定隐藏信息在多大程度上影响了结果。研究人员需要外部参照点和明确假设。

实时竞赛降低了这种特定风险,因为在预测时结果尚属未知。这使 Mantic 在 2026 年夏季的结果比私人的回顾性基准更具参考价值。

实时评估会带来不同的复杂因素。问题选择、更新频率、参与规则和评分公式都可能影响排名。

持续监控新闻的系统,相较于只能在有限时段进行预测的人类,天然具有覆盖优势。即使这会使科学比较更复杂,这种优势仍具有商业价值。

不应将这种区别视为缺陷。企业往往正是希望采用始终在线的系统,因为人类无法每小时更新数百个概率。

关键要求是透明的评估。买家需要对准确性、校准性、覆盖范围、及时性和决策影响进行分别衡量。

单一赛事排名将这些维度压缩为一个结果。产品采用则需要重新将它们拆开审视。

“超人类”标签无法证明什么

“超人类”准确描述了一项竞赛结果,但作为对 Mantic 能力的总体主张,它仍然过于宽泛。

最有力的已验证表述是有限的。Mantic 在 2026 年夏季 Metaculus Cup 中超过了每一位人类参赛者,但排在另一套自动化系统之后。

这一结果之所以重要,是因为问题是实时的。但它并不能证明其在所有领域、时间跨度、用户群体或决策环境中都具有优势。

赛事参与者在经验和活跃程度上也存在差异。一些人类参赛者回答的问题可能更少,或更新频率低于自动化参赛者。

此前有关预测竞赛的报道指出,评分可能会奖励覆盖范围。系统若能更早回答、覆盖更多问题并定期更新,便会受益。

这些行为在实践中具有价值。然而,将覆盖范围与准确性结合的排名,无法揭示机器是否在每一个对应预测上都作出了更好的判断。

比较对象也很重要。击败所有赛事参与者,并不等同于击败一支经过严格筛选的职业超级预测者团队。

一个系统可能主导一般性问题,却难以应对偏僻的地区政治、技术监管,或受私有信息影响的决策。

组织提出的问题也不同于公开赛事。内部预测可能涉及机密产品时间表、谈判、客户行为或运营故障。

当公开网络研究只能提供部分证据时,Mantic 必须证明其方法仍能迁移适用。企业部署可能需要安全访问内部文档和结构化公司数据。

这种整合带来了治理问题。一个概率可能影响招聘、资本配置、保险、交易、公共政策或安全规划。

用户需要知道何时缺少证据、何时来源相互冲突,以及何时预测因一条不确定报告进入系统而发生变化。

解释有所帮助,但流畅的解释可能产生虚假的信心。看似合理的叙述,并不能保证底层概率经过校准。

预测还可能影响其所描述的事件。有关银行、选举或冲突的公开预测,可能影响行为并改变结果。

私人预测引入了另一项担忧。客户可能根据外部研究人员无法审查的预测采取行动,使独立的性能评估变得困难。

未披露的客户名单留下了若干重要问题尚未解答。读者目前尚无法考察各组织如何使用 Mantic,或该系统是否改善了其决策。

准确性本身并不等于实用性。预测必须足够早地到达,以改变一项行动,而且潜在收益必须超过实施成本。

设想一个供应链团队面临新增出口限制的 20% 概率。只有将该概率与应对选项及其成本结合起来,它才有意义。

该组织可能会分散供应商、增加库存,或选择等待。Mantic 可以为这一选择提供信息,但无法替公司提供其风险偏好。

自动化偏见同样存在风险。决策者可能因数值预测看似客观而依赖它,即使模型缺少必要背景。

相反的问题也依然可能出现。每当校准后的预测与直觉或组织政治相冲突时,高管可能选择忽视它。

这两种失败主要都不是技术问题。它们关乎机构如何分配权威、记录决策并复盘错误。

Mantic 自己的案例支持一种审慎的解读。它的有用贡献不是对未来的确定性,而是随证据更新的、严谨的概率。

校准正确的 70% 预测,十次中仍会失败三次。将这一数字视为保证的用户,将误解该产品。

同样的原则也适用于罕见事件。一个系统可以负责任地赋予低概率,但该事件仍可能发生并造成广泛损害。

买家应要求按领域、时间跨度、问题类型和信息可得性细分的表现数据。汇总分数可能掩盖薄弱类别。

他们还应比较冻结后的预测与持续更新的预测。准确的最后时刻更新,与提前数月发出的早期预警,服务于不同目的。

置信区间和样本量同样重要。一连串正确预测可能反映出能力、问题选择有利,或仅仅是偶然。

Mantic 的融资为其产出更广泛的证据提供了资源。在这些证据出现之前,“超人类预测”仍应被视为一项可检验的产品主张。

将检验 Mantic 押注的三大信号

Mantic 的下一阶段将取决于其实时表现、公开披露的采用情况,以及预测能否改善竞赛之外决策的证据。

第一个信号是其在前瞻性竞赛中的持续表现。所谓前瞻性,是指每项预测被记录时,结果仍然未知。

Mantic 需要在多个竞赛、问题集和时间跨度中表现出色。一次胜利可以带来关注,但重复的结果才能确立可靠性。

最有价值的披露应包括原始准确率、校准度、覆盖范围、更新频率,以及与同一批人类预测的对比。按领域划分的结果将揭示该系统在哪些方面存在困难。

当前的 Metaculus 锦标赛为持续观察提供了一个场所。未来的结果可能加强或削弱这样一种说法:夏季的表现具有可重复性。

再次位居前列将支持 Mantic 的技术论点。若成绩大幅下滑,则可能表明其对问题选择、竞争对手或竞赛条件较为敏感。

第二个信号是具名客户采用,并拥有可衡量的工作流程。Mantic 及其投资者表示,企业和政府机构已展现出兴趣。

兴趣并不等于部署。有意义的案例应说明客户跟踪了哪些问题、预测如何进入决策流程,以及带来了哪些变化。

金融机构显然是早期市场,因为概率预测的改进可能与可衡量的回报相联系。但它们也不太可能披露专有策略。

企业风险团队或许能提供更直观的证据。它们可以在不披露机密决策的情况下,报告更早的预警时间、更广的覆盖范围或更少遗漏的重要进展。

政府采用将证明其与地缘政治和政策的相关性。但这也会对可审计性、采购、安全性和问责提出更高要求。

即使不披露收入,具名部署也会强化商业论据。持续保密则会让外部人士只能依赖投资者的说法。

第三个信号是能够区分预测质量与决策质量的产品证据。Mantic 必须展示的不只是持续输出的一连串概率。

有用的产品应保留预测历史、解释重大更新、识别具有影响力的证据,并展示在可比问题上的校准情况。

它们还应支持决策阈值。客户可以规定,当某项风险升至 30%、50% 或 70% 以上时,应采取何种行动。

这种关联会让预测变得可执行,而非仅作装饰。它还使组织能够审计用户是否采取了一致的行动。

Mantic 的系统最有价值的定位,或许是作为注意力分配器。它可以扫描数百个问题,标记具有意义的变化,并将专家引导至新出现的风险。

这一模式保留了人类专业知识的角色。人们评估后果、质疑缺失的背景信息并选择行动,而软件则维持广泛的概率覆盖。

该公司 2,500 万美元的融资为测试这一模式提供了空间。但这笔资金并不能解决自动化预测能否赢得持久机构信任的问题。

Mantic AI forecasting 如今拥有一项经验证的竞赛结果、知名投资者,以及一套旨在快速改进的机制。其下一批证据必须来自重复的实时测试和真实决策。

对开发者而言,启示是评估整个预测流水线,包括检索、校准、更新和信息泄漏控制。强大的基础模型只是其中一个组成部分。

企业买家应从有记录的试点开始,而不是大规模自动化。选择明确的问题,保留人类基准,设定决策阈值,并为每个已揭晓结果评分。

知识工作者应将概率视为结构化证据,而非指令。应通过可搜索的知识库保留支撑来源和假设。

决定性的问题并非 AI 能否赢得一场预测竞赛,而是你的组织能否检验其预测、采取恰当行动,并从每一个结果中学习。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page