top of page

NIST 推出 AITE 测试平台,挑战公开 AI 模型评分

NIST 推出了一个包含三项初始用例的测试平台,挑战开发者如何证实其通过公开基准测试提出的 AI 性能主张。这项名为 Artificial Intelligence Technology Evaluation 的计划,简称 AITE,将使用参与者无法查看或用于训练的数据来测试提交的模型。

这一设计直指 AI 评估中长期存在的可信度问题。公开测试集可能泄漏到训练数据中,而模型开发者也可围绕熟悉的问题调优系统。如此一来,高分反映的可能是对基准测试的准备程度,而非模型在真正未知材料上的表现。

AITE 以隔离环境、统一数据集、明确指标和集中评分取代了这种安排。NIST 表示,初始测试涵盖量子点控制、人类基因组变异注释以及公共安全事件的视觉识别。这些任务将评估争论从聊天机器人的常识问答延伸到专业工作领域,在这些领域中,错误输出可能带来实际后果。

该计划尚未给出领先商业模型的权威排名。其公开模型列表目前仅显示一个示例条目,而现有测试计划也仍处于初始阶段。更重要的发展在于评估机制本身。

NIST 正将一个独立机构置于模型提供商与其发布的性能主张之间。如果研究人员贡献有价值的私有数据集,开发者提交具备竞争力的系统,AITE 就能揭示公开排行榜很少捕捉到的差距。若参与度始终有限,该测试平台则可能在技术上可信,却在商业上处于边缘地位。

NIST 将 AI 评估置于闭门环境中

AITE 通过将评估数据置于模型提供商触及范围之外,改变了测试条件。

AITE 测试平台中,数据提供方提交原创数据集及其领域内具有实际意义的任务。模型提供方则分别提交待测系统。随后,NIST 在其受控环境中应用统一指标和评分方法。

这种分离至关重要,因为开发者无法获得评估数据用于训练。他们可以了解模型在参与任务中的表现,以及这些结果在一致条件下的相对比较。数据提供方则会获得有关已提交系统如何处理其专业材料的测量结果。

NIST 指出,该计划有三项目标。AITE 将作为中立第三方,支持使用非公开数据进行测试,并衡量当前技术水平。提交系统的测试结果将连同参与组织的身份一并发布。

NIST 还表示,至少每年更新一次综合分析报告。这一安排使该计划承担持续测量的角色,而非将每次评估视为孤立竞赛。

初始目录包含三项不同的测试。Quantum Dot Control 测试使用 641 次试验,并以均方误差衡量结果。其输入结合文本和图像,预期输出为文本。

Human Genome Variant Curation 测试包含 10,000 次试验。它使用平均错误率评估文本和图像输入。Public Safety Visual Event Recognition 测试包含 3,000 次试验,并采用检测代价函数。

这些衡量标准并不可互换。均方误差评估预测值与预期值之间的距离。平均错误率衡量基因组学任务中的错误结果。检测代价函数则根据测试设计赋予的后果权重,对不同错误进行加权。

这种差异是 AITE 的特性,而非不一致之处。单一的通用评分无法充分描述模型在科学控制、基因组解读和事件检测等不同领域中的表现。

这些任务还将模型置于语境至关重要的场景中。量子点调节历来需要专家判断和反复测量。基因组变异注释支持临床检测和生物信息学研究。公共安全图像可能影响应急人员如何评估正在发生的事件。

NIST 计划在更广泛的主题下新增任务,包括量子应用、视频和自然语言处理。每项任务都将拥有独立的评估规范和提交协议。

因此,眼前的变化主要是程序性的。习惯于自行选择基准测试的模型提供商,可以自愿接受不由其控制规则的测试。这也构成 AITE 的核心张力:独立性提升可信度,但唯有参与才能让结果产生影响力。

为何公开 AI 基准测试不断失去可信度

当基准测试中的问题成为开发流程的一部分时,它便不再衡量通用能力。

训练—测试污染发生于评估材料或高度相关内容进入模型训练数据时。模型随后可能复现测试中的模式,却无法证明其能够泛化到未知情境。

污染并不总是源于故意作弊。被广泛讨论的基准测试问题可能出现在代码库、研究论文、教程和网页中。接受大规模互联网数据训练的模型,可能吸收这些材料,而其开发者无法追踪每一处重叠。

开发者也可以间接围绕某个基准进行优化。团队会分析失败案例、修改提示词、加入工具、调整推理设置,并发布更新后的系统。这些变化可能提高分数,同时仍无法确定模型在陌生任务上的表现。

公开排行榜进一步强化了这种动机。微小的提升即可支撑营销主张、吸引关注或影响采购决策。然而,报告中的数字往往掩盖了提示词格式、采样设置、工具访问权限、评分规则以及结果的不确定性。

NIST 在 2026 年 2 月通过其关于评估统计方法的工作,处理了另一项弱点。该机构区分了基准准确率与泛化准确率。

基准准确率描述模型在测试所包含的具体问题上的表现。泛化准确率则估计模型在更广泛、相似问题群体中的表现。即使评论者将两者视作同一主张,这两个数值也可能不同。

NIST 在这项工作中分析了 22 个前沿大型语言模型在三项既有基准测试中的表现。该机构借此说明,评估者必须明确分数代表什么,并恰当地量化不确定性。

AITE 则在评估流程更早阶段处理相关问题。统计方法无法完全挽救已泄漏到训练中的测试集。在评分开始前将数据隔离,可以降低这一风险。

盲测数据也改变了开发者的目标。团队无法仅针对已知示例进行优化,而必须构建能够将其能力迁移到未见任务上的系统。

这一原则在生成式 AI 之外已有悠久历史。医学研究使用盲法以减少偏差。安全团队保留对抗样本以测试防御能力。学术竞赛维护隐藏测试集,以防参与者针对最终答案定制提交内容。

AI 让这一做法变得更困难,因为现代模型吸收的数据集规模极大,并可能复现早在评估之前就接触过的信息。使基准易于采用的公开可用性,也让其完整性更难维护。

AITE 并不能消除所有形式的污染。私有数据集可能与公开训练材料相似,模型也可能接触过相关示例。NIST 仍需记录数据集来源、任务构建方式以及访问控制措施。

不过,该计划改变了证据标准的默认设定。NIST 不再要求模型提供商自行证明其分数具有意义,而是能够直接控制评估材料和评分流程。

这种压力也延伸至实验室之外。政府采购方、企业和研究人员经常依据供应商报告和公开排行榜比较模型。可信的第三方结果可以揭示,这些比较在转向盲测、领域特定任务后是否依然成立。

因此,该测试平台挑战了单一数字排名的便利性。某个在通用知识方面领先的模型,可能难以处理专业图像。另一个模型可能在基因组变异注释上表现良好,却在公共安全代价函数下表现不佳。

这些结果不会产生一个简单的冠军。它们将带来更有用的东西:有关模型在哪些领域有效、在何种条件下有效,以及其错误模式如何的证据。

NIST 的 AI 模型测试向供应商和采购方施压

核心竞争并非 NIST 与某一家公司之间的较量,而是独立测量与供应商主导证据之间的较量。

模型提供商有充分理由以有利方式呈现其系统。他们可以选择符合模型优势的基准测试,选取有利的提示词,并突出多次运行中的最佳结果。这些选择不会自动使分数失效,但会限制可比性。

AITE 对其中一部分流程进行了标准化。模型在每项评估中面对相同的数据、任务和指标。NIST 控制测试环境,并发布参与组织及其结果。

这种安排迫使供应商决定,独立测试是有助于还是威胁其市场地位。强劲的结果将在更可信的条件下支持其主张。较弱的结果则会成为公开记录的一部分。

一旦某项计划变得有影响力,不参与也会带来成本。采购方可以追问,为何供应商宣传公开排行榜分数,却拒绝接受盲测。当预期部署涉及健康、公共安全、基础设施或科学研究时,这个问题会更加尖锐。

采购方承受的压力则不同。采购团队必须停止将基准排名视为使用场景评估的替代品。AITE 的三项初始任务表明,指标必须服从于运营目标。

例如,在公共安全检测中,误报和漏报可能带来不同后果。平均准确率可能掩盖这种差异。检测代价函数则可以反映分配给每种错误的相对权重。

基因组注释带来了另一项评估问题。系统或许能流畅地描述图像,却错误识别具有临床意义的变异。语言质量无法弥补底层任务中升高的错误率。

量子点控制测试的是另一种能力形式。模型必须解读多模态输入,并生成能够支持技术要求很高的控制流程的输出。熟悉的问答基准测试只能为这种表现提供有限证据。

这些例子强化了 NIST 的更广泛立场,即 AI 评估取决于具体语境。该机构的 TEVV program 涵盖测试、评估、验证和核查,涉及准确性、隐私、可靠性、稳健性、安全性、安保性和有害偏见等特征。

NIST 表示,数十年来已开展数百项评估,涉及数千个 AI 系统。AITE 将这一机构角色应用于如今由快速变化的基础模型和供应商发布的比较结果主导的市场。

该计划还为拥有高价值数据集的机构创造了激励。医院、实验室、大学和公共机构可能拥有可支持有意义评估的数据,但无法将其公开分发。

隔离测试平台提供了另一条路径。数据可以继续受到管控,同时对获批准的模型进行评估。这将可用测试材料扩展到组织愿意公开发布的数据集之外。

模型提供商获得的是测量结果,而非底层评估集。数据提供商则能了解竞争系统在其领域中的表现。NIST 充当中介机构,负责制定并执行相关规则。

对这一中介机构的信任将需要透明度。参与者需要明确的提交要求、数据处理保护措施、指标定义以及争议结果的解决程序。买方则需要足够的方法细节,以便在无法访问受保护数据的情况下解读已发布的分数。

AITE 早期公开材料描述了这一结构,但尚未回答所有运营层面的问题。当前网站尚未展示主要商业系统的完整对比,也未表明领先供应商已承诺参与。

这一缺口限制了该计划的即时市场影响。只有当模型池涵盖买方正在考虑的系统时,中立测试平台才有意义。否则,由供应商控制的基准测试仍将是更显眼的参考点。

不过,压力已经开始显现。NIST 创造了一个让模型主张接受隐藏数据和统一评分检验的场所。供应商、研究人员和买方如今必须决定,这些证据是否比熟悉的公开排行榜更值得重视。

盲测解决了一个问题,而非整个评估问题

隔离数据可以减少污染,但无法让设计不佳的任务具备代表性或达到可部署标准。

AITE 最强大的机制也很容易被夸大。隐藏评估数据可以防止测试内容被直接暴露,但无法保证数据集能够反映模型实际运行的环境。

数据集选择依然至关重要。基因组数据集可能未充分覆盖相关人群或罕见变异。公共安全图像可能反映特定的摄像系统、地点、天气条件和事件定义。

指标选择又增加了一层复杂性。平均错误率会将各类结果合并为一个数值。这种汇总可能掩盖这样一种情况:失败集中发生在实际后果更严重的案例中。

同样的问题也出现在模型比较中。某个固定基准上的统计可测差异,并不总能支持关于通用能力的广泛主张。NIST 2026 年的统计工作强调,评估者必须界定评估目标并说明不确定性。

因此,AITE 需要发布的不只是排名。有价值的报告应解释任务边界、模型配置、试验次数、指标表现以及可泛化性的限制。初步测试计划提供了基础,但解读仍然不可或缺。

模型配置同样会改变结果。使用外部工具的系统,可能会胜过未使用这些工具的同一底层模型。提示方式、推理预算、图像分辨率、检索系统和后处理都会影响结果。

NIST 必须决定它究竟在评估什么。一种方法是在标准化条件下衡量基础模型;另一种方法则评估开发者计划部署的完整系统。两者回答的都是合理问题,但并非同一个问题。

版本管理带来了进一步挑战。商业模型可能在未获得新公开名称的情况下发生变化。如果提供商更新服务或调整其推理栈,评估结果就可能过时。

当测试集必须保持机密时,可复现性就很困难。独立研究人员无法检查每个项目,也无法自行重新运行评估。他们必须信任 NIST 的控制措施和围绕该流程的文档。

这种权衡无法避免。发布完整数据集会改善外部审查,但也会重新引入污染风险。保持数据私密能够维护测试完整性,却也将责任集中于评估方。

参与数据的质量与数据集数量同样重要。私有数据集并不天然就是好的基准。NIST 必须审查其标签、采样方法、任务定义和预期输出是否能够支持可靠结论。

参与机制还会引入潜在的选择偏差。对某项特定任务有信心的开发者可能会提交模型,而能力较弱的提供商则可能缺席。届时,公开结果描述的将是自愿参与者,而非整个竞争市场。

AITE 明确指出参与是自愿的。这种方式降低了监管方面的顾虑,也可以促进协作,但它无法迫使测试平台实现全面覆盖。

初始结果页面进一步强化了这种不确定性。其可见模型列表目前包含的是示例模型,而非由众多具名系统构成的广泛阵容。读者不应将该计划的推出解读为 NIST 已经建立了权威排行榜的证据。

AITE 还专注于模型在定义任务中的表现。它并不能替代对社会影响、人机交互、隐私、安全或组织控制措施的评估。

NIST 的 ARIA evaluations 涵盖了这一更广泛领域的一部分。ARIA 考察 AI 系统在真实环境中的运行方式,以及人们在日常使用过程中如何与其互动。

这一区别很重要。模型可以在盲测数据上表现准确,却可能在设计不佳的工作流程中产生有害结果。它也可能避免数据污染,却依然容易受到对抗性操纵或不当依赖的影响。

NIST 的评估体系正越来越多地将这些问题区分开来,而非强行压缩为一个分数。AITE 衡量受控任务上的表现。ARIA 考察技术和情境层面的稳健性。其他工作则关注风险管理、安全和智能体行为。

这不如一个通用排行榜方便,却也更诚实。负责任的模型选择需要多种类型的证据,每一种都应与预期部署场景相对应。

AITE 扩展了 NIST 更广泛的 AI 测量战略

该测试平台是从自愿治理语言转向运营证据这一更大趋势的一部分。

NIST 于 2023 年 1 月发布了 AI 风险管理框架。该框架为组织治理、映射、衡量和管理 AI 风险提供了共同结构。

框架很有用,但本身不会产生证据。组织可以记录相关政策,却未必知道已部署系统在陌生输入上的表现是否可靠。

AITE 将部分测量职能转化为一个运营环境。研究人员提交数据和任务,开发者提交模型,NIST 在受控条件下运行评估并发布结果。

这项工作补充了 NIST 的生成式 AI 评估计划,后者已评估生成文本、图像、代码和内容检测。它也与 ARIA 对社会风险和真实人机交互的关注并行。

NIST 信息技术实验室将测试、评估、验证和确认列为 AI 四大影响领域之一。其 AI testing strategy 将测量科学与采用、标准和知情决策联系起来。

这一方向反映了 AI 治理中的一个现实问题。政策往往要求组织评估系统,但团队缺乏共享方法、代表性数据和可信基线。于是,供应商便以自己的证据填补这一空白。

中立测试平台无法评估每一种部署情况,但可以建立供其他组织调整采用的参考流程。其测试计划可以展示如何定义任务、选择指标、控制数据并报告限制。

三个初始用例很有启发性,因为它们无法套用单一评估模板。量子控制使用回归式误差测量。基因组整理使用大型数据集和平均错误指标。公共安全检测则采用成本敏感型度量。

这种多样性使 AITE 比又一场通用聊天机器人考试更贴近企业评估。组织很少购买 AI 来回答基准问题;它们部署 AI 是为了分类文档、解读图像、识别异常、辅助决策或控制专业流程。

采购团队无需复制 NIST 的基础设施,也可以应用同样的逻辑。它可以保留内部测试集,在选择供应商前定义运营错误,并在一致的配置下评估系统。

团队还应保存用于这些决策的证据。可搜索的技术知识库可以连接测试计划、模型版本、结果和部署要求。当模型或运行条件发生变化时,这些记录将变得重要。

AITE 可以通过发布可复用的规范来强化这一实践。即使无法提交模型的组织,也能从具备可辩护性的具体测试构建示例中受益。

该计划还提供了一条跨机构协作的路径。科研团队可以贡献有意义的数据集,而无需将其公开发布。随后,多个提供商可以在同一任务上接受测量。

这种结构可以揭示通用模型何时能够成功迁移到专业领域,也可以显示领域专用系统何时仍然更具优势,尽管它们在公开排行榜上获得的关注较少。

这两种结果都不应被预设。AITE 尚未发布足够多的完整对比来确立趋势。它的价值在于让这些问题能够在更严格的控制下接受检验。

该计划的年度报告承诺将是衡量成熟度的另一项指标。报告应展示任务和参与者的增长,解释方法变化,并区分现行系统与已退役版本。

如果 NIST 保持这种严谨性,AITE 可以成为循证 AI 采购和研究的基础设施。如果它发布的结果稀少且更新不及时,组织仍将继续依赖更新更快的供应商基准测试。

NIST 建设 AITE 测试平台时值得关注的事项

三个信号将决定 AITE 是成为具有影响力的评估层,还是停留在前景可期的试点阶段。

第一个信号是可识别模型提供商的参与。AITE 表示结果将列出提交机构,但其当前公开列表尚未显示广泛的竞争阵容。

主要参与者的加入将增强该计划的核心主张。当买方能够比较他们实际可能部署的系统时,盲测才具有商业相关性。若列表主要由实验性提交构成,这种联系就会被削弱。

参与质量比单纯的数量更重要。NIST 需要当前模型版本、清晰的配置记录,以及在系统变化时的重复提交。否则,其对比结果的老化速度将快于市场。

第二个信号是扩展到三个初始用例之外。NIST 表示 AITE 将增加包括视频和自然语言处理在内的主题。新任务应保持同样的核心原则:受保护的数据、有意义的工作,以及与后果相匹配的指标。

强有力的扩展将纳入公共训练语料库中无法获得的数据集,以及由可信领域专家提供的任务。它还应明确记录人口统计、地域、时间和技术边界。

薄弱的扩展则只是通过新界面复刻那些人们早已熟悉的公开基准。当底层任务本身已经主导模型开发时,隔离带来的价值就相当有限。

第三个信号是 NIST 已发布分析的深度。年度报告应说明不确定性、模型版本、任务局限,以及特定基准结论与普遍性结论之间的差异。

如果 NIST 将 AITE 结果与其统计评估工作结合起来,结果将更具参考价值。置信区间和明确的性能目标可以避免微小的分数差距被夸大为排名高低。

报告还应明确测试未能衡量的内容。模型在盲测科学数据上的表现,并不能证明其在完整部署中的安全性、公平性、隐私性或可靠性。

这三个信号相互强化。获得认可的提供方会吸引数据贡献者。更好的数据集会让参与变得更有价值。审慎的报告会让买家有理由信任这些结果。

对开发者而言,实际问题在于:AITE 是否能在客户发现之前暴露模型的弱点。对受保护数据进行测试,能够识别脆弱的泛化能力、模态失效,以及对陌生任务格式的敏感性。

对企业买家而言,问题在于独立结果是否与内部试验相符。即使模型在 NIST 条件下表现良好,仍需根据买方的工作流程、用户、数据和可接受的错误阈值进行验证。

对研究人员而言,机会在于构建在发布后仍具参考价值的评估体系。公开基准往往会因模型围绕其进行训练而失去价值。持续运行的隔离测试平台可以轮换测试材料,并保留有意义的留出集。

NIST 并未通过推出 AITE 解决 AI 评估问题。它创造了一个更好的场所,让模型在看不到答案的情况下完成任务。

未来几个月将显示,模型提供方是否接受这一挑战,数据所有者是否贡献具有重要意义的任务,以及 NIST 是否发布了足够背景信息的结果来指导决策。

关注 AI 报道的读者不应只盯着下一项最高分。请关注谁提交了结果、什么内容仍被隐藏,以及 NIST 如何解释不确定性。这些细节将揭示,AITE 是否改变了 AI 性能声明背后的证据,还是仅仅增添了另一张排行榜。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page