Vals AI 的 4,000 万美元融资考验独立 AI 评估市场
- Sophie Larsen

- 4天前
- 讀畢需時 14 分鐘
Vals AI 以 4 亿美元估值融资 4,000 万美元,将由 Techmeme 汇总的一则融资新闻,转化为对独立 AI 衡量机制的更大考验。
Andreessen Horowitz 领投这轮 A 轮融资,8VC、Bloomberg Beta、HRT Ventures 和 Next Ladder Ventures 参投。Vals 于 2026 年 8 月 13 日宣布完成融资。
该公司称,其营收较 2025 年全年增长了八倍。客户数量翻倍,团队规模则在六个月内增至三倍。
这些数据均由公司自行披露,缺乏公开财务报表所能提供的背景信息。不过,它们指向了一个正在形成的市场,核心问题颇为棘手:谁能够可信地衡量 AI 模型是否真正完成了有用的工作?
模型开发商已发布涵盖编程、数学、推理和安全测试的各类分数。企业也会在部署模型前进行内部测试。
Vals 押注于,这两种方式在独立性、时效性或覆盖范围上都还不够。其主要对手并非另一家评估初创公司,而是允许 AI 供应商自行定义、运行并公开用于支撑自身产品主张的测试这一惯例。
这场利益冲突解释了本轮融资为何重要。这笔资金并未确立 Vals 作为行业裁判的地位,但为公司争取这一角色提供了更多资源。
本轮融资押注独立裁判
Vals 融资是为了建设衡量基础设施,而非打造又一个通用型 AI 模型。
根据公司发布的 A 轮融资公告,a16z 以 4 亿美元估值领投了这笔 4,000 万美元投资。现有投资者 8VC 和 Bloomberg Beta 也参与了本轮融资。
HRT Ventures 和 Next Ladder Ventures 则作为新投资者参投。Vals 未披露各机构的具体出资额,也未提供经审计的营收数据。
这家总部位于旧金山的公司为金融、法律、软件、医疗、数学和 AI 研究等领域构建评估与基准测试。基准测试是用于在既定条件下比较模型性能的结构化测试。
Vals 表示,其结果已出现在 OpenAI、Anthropic、Google、Meta 和 xAI 的模型卡中。模型卡记录系统的能力、局限性和评估结果。
这种被采用的说法,比单纯的公开排行榜更重要。只有当实验室引用某项基准测试、买家据此选择模型时,它才具有商业相关性。
Vals 还表示,大型企业部署项目会在选择模型和衡量产品时使用其评估服务。该公司曾为美国商务部以及参与制定 AI 政策的国会议员提供支持。
这些表述涵盖了几个彼此不同的市场。模型实验室希望获得新版本有所提升的证据。企业需要与自身工作流挂钩的测试,而政府则需要与风险和国家能力相关的衡量方法。
为这三类群体提供服务的单一评估机构会面临潜在利益冲突。不过,它也能够在模型开发、采购和政策周期中获得更高的可见度。
Vals 在宣布融资的同时发布了三项产品。Vals Smith 正式全面上线,可根据 GitHub 仓库创建定制化编程基准测试。
该公司还宣布开展涵盖自主 AI 研究、网络安全和心理健康的前沿风险工作。Vals 2.0 则新增了重建的网站和扩展后的 Vals Index。
Vals Index 汇总多个具有经济相关性的领域表现。它不同于单一的考试式基准测试,因为其中纳入了涉及工具、文件、代码和更长任务序列的工作。
因此,这笔融资支持两项相互关联的业务。一项产出公开比较结果,以建立可信度和分发渠道;另一项则向进行私密决策的机构销售定制化评估基础设施。
这种组合形成了核心张力。公开排名能吸引关注,但私有评估更有可能反映真实部署所处的条件。
接下来的考验在于,Vals 能否在不削弱任何一方可信度的前提下,将这两项业务连接起来。
为何基于 Techmeme 的关注延伸至 AI 基准测试
融资之所以引发关注,是因为模型能力主张愈发难以解读,而企业的支出决策正变得更为重要。
许多成熟基准测试如今已过于熟悉,难以区分领先系统。模型即使接近最高分,面对信息不完整或需要多个相连工具的任务时,仍可能失败。
公开测试材料也可能出现在训练数据中。这种污染会让模型看起来表现更佳,却无法证明它能够泛化到未见过的工作。
关于私有基准测试的研究描述了同样的问题。公开基准测试泄露会削弱比较的有效性,而私有保留集可以减少训练数据暴露。
这并不只是学术问题。为金融分析选择模型的企业,并不需要另一个通用知识问答分数。
它需要知道,系统能否读取相关文件、使用所需工具、维持数值准确性并标记不确定性。它还需要在接近部署环境的条件下收集的证据。
随着 AI 产品从聊天界面转向智能体,这种压力进一步增加。智能体是指利用模型、工具、记忆和重复行动来完成任务的系统。
智能体表现不只取决于底层模型。搜索质量、工具设计、提示词、权限边界和错误恢复都会改变结果。
在受控问答测试中表现良好的模型,在接收到电子表格、浏览器以及多条相互冲突的指令后,可能会失败。另一个模型则可能借助更好的工具使用能力,弥补推理能力较弱的问题。
Vals 聚焦于这些组合系统,也评估独立模型。其方法论涵盖工具使用、多种输入格式、长上下文,以及需要持续工作的任务。
这种转变以特定方式给模型实验室带来压力。由实验室控制的基准测试可以突出系统最强的配置,同时让不利设置或失败情况不那么显眼。
独立评估方可以在不同供应商之间标准化测试条件,也可以保留模型在开发过程中未曾接触过的私有测试材料。
这一承诺有助于解释投资者的兴趣。评估处于技术进步与商业采用之间的关键节点。
每家模型实验室都需要证据。每个严肃买家都需要验收标准,而监管机构也越来越需要评估能力和风险的方法。
不过,这些市场的规模并不保证某一家公司会主导其中任何一个。大型客户往往会构建内部评估,因为其数据、政策和失败成本具有高度特定性。
实验室也拥有更深入的模型内部信息和未发布系统访问权限。独立评估机构通常通过公开接口或特别安排的访问权限进行测试。
因此,Vals 必须证明,独立性能带来足够的额外信任,以抵消评估方较为有限的技术访问能力。它还必须比模型学习其测试模式的速度更快地更新测试。
这才是基于 Techmeme 的关注背后的真正含义。这则融资故事表明,评估正在成为独立的商业层,而不再只是辅助性研究功能。
独立测试挑战实验室主导的评分
Vals 销售的是模型开发公司与评判其表现的机构之间的分离。
这种分离类似于金融、医学、安全和会计领域的熟悉制度。当外部机构能够在一致条件下检验某项主张时,该主张就更具价值。
AI 尚未形成获得普遍认可的对应机制。模型公司会发布详尽的技术报告,但每家供应商选择的任务、提示词、设置和比较基准各不相同。
这些选择可以是合理的,但仍会使直接比较变得困难。提示词、工具访问或推理设置的细微差异,都可能实质性影响表现。
Vals 认为,模型开发的速度已超过社区创建高难度新测试的速度。较旧的测试逐渐饱和,公开示例则可能进入未来的训练集。
其拟议的解决方案是使用私有测试集和特定领域任务。Vals 与领域专家共同开发这些任务,并公开选定的验证示例以提供背景。
该公司的评估方法论将公开验证材料、私有验证集和仍保持机密的测试集区分开来。只有私有测试集决定已发布的基准测试分数。
这种结构降低了直接污染风险,但无法消除模型或开发商适应某项基准测试的所有途径。
实验室仍可能针对公开描述、既有结果或相关任务进行优化。重复提交也可能通过分数变化泄露隐藏测试的信息。
Vals 除准确率外,还报告成本、延迟、不确定性和定性失败模式。更广泛的视角很重要,因为得分最高的模型并不必然是最佳部署选择。
准确率略低的模型可能运行更快,或能以更可预测的方式处理失败。另一个模型可能只有在获得昂贵的推理预算时才能产生更强结果。
现实任务的输出也不像选择题考试那样规整。法律备忘录可能得出正确结论,却遗漏具有决定性的判例。
财务模型可能采用正确结构,却将一个数值错误带过多个标签页。智能体可能完成编程任务,却引入无关的回归问题。
为这些输出评分通常需要详细的评分量表、确定性检查,或让另一模型担任裁判。每种方法都会引入自身的假设。
精确检查提供清晰度,但只覆盖答案能够被客观验证的输出。人工审查更具细致性,但成本更高,也可能因审查者不同而有所差异。
模型裁判更容易扩展,但其偏好和错误可能塑造最终排名。基准测试提供方必须展示如何验证这些裁判。
这带来了独立与绝对无误之间的重要区别。独立性可以减少供应商利益冲突,但并不保证测试衡量了正确的事物。
竞争对手从不同位置切入这一问题。Patronus AI 为企业系统提供自动化评估器、数据集、实验和生产监控。
其评估器文档介绍了如何在专有和公开数据集上持续测试评估器准确性。这强调了产品开发和运营过程中的评估。
METR 高度关注前沿能力与风险,包括 AI 系统是否能够加速 AI 研究。Epoch AI 开发了含有未发布问题的高难度基准测试,以限制污染。
Scale AI 将数据服务与面向前沿实验室和企业的评估结合起来。学术团体则继续创建公开基准测试,以提供透明度和广泛参与。
Vals 横跨其中多个类别。它发布公开的模型对比,创建专有测试,支持定制基准测试,并参与前沿风险评估。
如果其方法能够跨领域迁移,这种广度可能成为优势;但如果客户质疑一家机构能否维持所有领域的专业能力,它也可能成为负担。
公司的融资为其证明模型无关评分是一项可持续业务提供了时间。但这并未解决哪种评估模式将成为标准的问题。
私有测试解决一个问题,也带来另一个问题
将测试集保持私有可以限制污染,但这也要求用户信任那些他们无法完全审查的结论。
透明度与测试完整性之间存在拉扯。公开每一道题目,能让研究人员审查基准测试、复现结果并发现错误。
但这也会让模型开发者直接获得相关材料。这种访问便利会使刻意训练、意外污染和反复优化变得更容易。
私有测试保护了题目,但也限制了外部审查。用户必须信任基准测试创建者的抽样、标注、评分标准和评分实现。
Vals 试图通过公开验证示例和私有评分数据来平衡这些需求。它还开源了部分评估基础设施。
开放基础设施可以提升可复现性。它让研究人员能够审查模型如何被调用、运行如何分配,以及通用接口如何处理不同提供商。
底层私有题目仍然不可获取。这意味着外部人士若未获得 Vals 的访问权限,便无法完全复现已发布的分数。
这种权衡并非 Vals 独有。FrontierMath 和其他较新的基准测试大多未公开问题,因为能力较强的模型可能会在训练期间接触到公开题目。
更广泛的 AI Index report 也强调了开发者自报性能与独立测试之间的差异。该报告将污染视为结果虚高的来源之一。
因此,私有数据是对已被记录的问题作出的理性回应。但保密既可能保护高质量题目,也可能掩盖薄弱题目。
基准测试的设计同样决定了分数的含义。基于标准化文档的金融评估,可能无法代表一家公司的特殊报告系统或审批规则。
从代码仓库构建的编程基准测试,可能能够衡量问题解决能力,却会遗漏安全审查、架构决策或长期维护。
公司通过 Vals Smith 弥补了部分缺口。该产品可将选定的 GitHub 仓库转化为定制编程基准测试。
这种方法可以让模型接受更接近买方实际环境的代码测试。但它也带来了关于仓库权限、敏感代码和生成任务质量的问题。
定制基准测试只有在任务反映人们真正需要完成的工作时才有价值。简单或人为设计的问题,可能产生令人安心的分数,却无法预测部署是否成功。
同样的问题也存在于编程之外。评估者需要具有代表性的案例、明确的成功标准,以及对高代价失败的记录。
企业已经在 bug 报告、被否决的分析、客户投诉和审查意见中保留了部分这类材料。将这些记录转化为测试,需要谨慎策划。
对于构建自身证据基础的团队而言,可搜索的工程知识库有助于整理规范、事故记录和过往决策。但它不能替代正式的模型评估。
怀疑者的观点很直接:Vals 或许能给出比厂商自行挑选测试更可信的比较,但仍不足以预测生产环境的结果。
基准测试衡量的是模型在其选定框架内的表现。生产系统则会面对不断变化的数据、对抗性输入、权限错误,以及该框架之外的人类行为。
没有任何排行榜能将这些条件压缩成一个决定性数字。买方应将排名视为进一步调查的证据,而不是自动采购决策的依据。
Vals 需要公开足够的方法论细节,让专家能够质疑其结论。同时,它必须避免暴露保护每项测试的材料。
这种平衡将决定独立 AI 模型评估会成为值得信赖的基础设施,还是又一层相互竞争的主张。
这项业务取决于将分数转化为决策
Vals 最有力的价值主张并不在于它能够给模型排名,而在于它能帮助组织决定应部署什么。
公开排行榜因模型发布会立即引发对比而获得关注。企业合同则取决于更狭窄、且具有直接运营后果的问题。
法务团队关心智能体能否找到具有约束力的权威依据,并准确引用。银行需要一致的计算、可追溯的假设和受控的数据访问。
软件组织需要基于自身代码仓库、工具和审查标准的测试。政府评估者则需要有关网络能力、自主性和滥用风险的证据。
这些客户并没有统一的成功定义。Vals 必须建立可复用的基础设施,同时允许每位买方定义本地需求。
这是一个困难的产品边界。标准化过多会削弱相关性,而定制化过多则会让业务变成劳动密集型咨询。
Vals Smith 提供了一种可能的机制。针对特定仓库的任务可以生成,并通过一个通用评估平台运行。
如果系统能够自动化大部分任务创建与验证,Vals 就能在无需为每位客户重建流程的情况下提供定制化证据。如果仍需大量专家审查,扩张将更困难。
公司声称收入增长八倍,表明早期存在需求,但对其持久性透露不多。Vals 没有披露年度经常性收入、客户集中度、留存率或合同期限。
它还将当前收入与整个 2025 年相比,而非提供常规的同比增长率。这使该表述难以被精确解读。
客户数量翻倍也有类似局限。更大的客户基础令人鼓舞,但合同价值和扩张程度比账户数量本身更重要。
团队规模增至三倍,显示 Vals 正在为预期需求提前投入。这也提高了支撑持续基准测试开发所需的收入规模。
新的评估需要领域专家、工程师、审查人员、基础设施,以及对众多模型 API 的访问。长期智能体测试可能消耗大量算力和审查时间。
每当模型在基准测试上饱和、利用评分弱点或获得新接口时,Vals 都必须更新基准测试。在能力数月内就会变化的市场中,静态测试会失去价值。
公司的新 RSI Index 展示了其中涉及的成本与雄心。它评估模型能否在固定时间和算力预算下开展 AI 研究。
其 RSI benchmark 报告称,受测系统完成了真实实验,但尚未达到领先人类的前沿水平。这些模型在隐藏确认阶段的表现,也比开发阶段测量所显示的更差。
这一差距说明了留出测试为何重要。实验阶段看似有前景的结果,在面对未见数据或受控随机种子重复测试时可能会减弱。
它也展现了头条分数的局限。受测智能体在研究策略、成本、实验频率和后续执行方面各不相同。
企业在审查用于生产环境的模型时,也需要同样的深度。单一百分比无法说明失败为何发生,或安全措施能否控制这些失败。
Vals 可以通过将分数与部署选择关联起来创造价值。它必须识别何种模型、配置和工具组合符合特定的风险容忍度。
这一定位会给内部评估团队和竞争平台带来压力。买方会比较使用外部评估方的成本与自行构建测试的成本。
大型 AI 实验室也可以扩展面向客户的评估产品。云服务提供商已经掌控模型托管、监控、安全和采购关系。
独立提供商的分销能力较弱,但与模型销售之间的分离度更高。客户是否足够重视这种分离,并愿意为其付费,仍是商业问题。
4 亿美元估值假设 Vals 能够占据这一决策层的重要份额。仅靠收入增长无法证明这一论点。
重复使用才能证明。客户必须针对新版本再次回来,更新其私有基准测试,并在实际采购或部署审查中使用结果。
三个信号将检验基于 Techmeme 的论点
下一阶段应通过采用情况、方法论审查和竞争反应来评判,而不应只看融资新闻。
第一个信号是企业的重复使用。Vals 应证明客户会在多个模型版本中运行评估,并将结果与部署决策相连接。
一次性的基准测试项目可能表明这是一个服务占比较重的市场。持续使用则会支持这样一种观点:评估正在成为永久性基础设施。
证据可以包括续约模式、不断扩大的基准覆盖范围,或客户账户对分数如何改变模型选择的说明。具体案例研究会比汇总增长声明更有用。
第二个信号是外界对 Vals AI 基准测试的验证。独立研究人员应能够审查任务设计、评分可靠性、误差范围和评审器行为。
他们不需要接触每一道隐藏题目。但他们需要足够的证据,以判断已发布的排名在合理调整下是否仍然稳定。
如果 Vals 通过修正、版本管理和透明的方法论更新来回应挑战,这些挑战将增强公司的实力。未解决的不一致性则会削弱其作为中立权威的主张。
第三个信号是模型实验室和竞争评估方的反应。模型卡中更多的引用将提升 Vals 的影响力,尤其是当结果对引用它的实验室不利时。
相反,竞争性的私有基准测试可能会让市场碎片化。买方可能面临多个互不兼容的分数,每一个都在不同规则下产生。
市场可以容纳多个评估方,但决策者仍需要通用的报告标准。分数应标明模型版本、设置、工具、成本、样本量和不确定性。
这些信号在未来数月尤为重要,因为 Vals 现在拥有了扩张所需的资本。融资消除了一个约束,同时也提高了对执行力的预期。
公司必须更新公开排行榜,发展定制评估产品,并维持实验室、企业和政策制定者的信心。同时服务这些群体,将考验其独立性。
读者也不应将任何基准测试视为自身验收测试的替代品。独立证据在与特定部署场景的评估结合时最具价值。
这意味着要测试真实文档、工具、边缘案例和失败成本。它也意味着每当模型、提示词、检索系统或智能体工作流发生变化时,都应重新运行评估。
Vals 发现了一个真实的测量缺口。有关污染以及旧测试迅速饱和的研究支持其诊断。
仍不确定的是谁将拥有解决方案。Vals 可能成为重要的独立层,评估也可能继续分散在实验室、客户、非营利组织和专业供应商之间。
因此,这则基于 Techmeme 的融资报道只是初步成果。接下来要观察的是:当资金、安全性和模型选择都取决于该评分时,各机构是否会持续信任 Vals。


