美国数据供应商因服务中国 AI 与五角大楼客户而面临审查
Google News 近日呈现了一场尖锐冲突:据报道,四家美国数据公司一边服务中国 AI 实验室,一边寻求或持有美国政府业务。
这四家公司分别是 Surge AI、Mercor、AfterQuery 和 Turing。Forbes 的一项调查将它们与腾讯、蚂蚁集团、阿里巴巴和字节跳动等客户联系起来。其中部分合作关系通过内部通讯、项目记录以及业内人士访谈得到佐证。
报道并未证明这些供应商转移了机密信息、军事数据,或属于美国模型开发商的专有数据集。它提出的是另一个问题:为美国政府机构构建专业训练数据的公司,是否也应向华盛顿视为安全风险的组织提供专业能力?
来自得克萨斯州的共和党众议员、长期对华强硬派 Michael McCaul 认为,获得政府业务应伴随限制条件。他告诉 New York Post,供应商在寻求美国合同的同时,不应帮助一家被五角大楼认定的中国军方公司提升其 AI 能力。
这一立场将一个鲜为人知的供应链问题转化为采购政策辩论。多年来,华盛顿一直在限制先进芯片、制造设备和投资,但专业训练数据跨境流动所受的审查仍少得多。
因此,核心冲突并不只是美国与中国之间的对立,而是全球数据市场的商业前景与政府业务附带的安全责任之间的矛盾。
据报道,这些数据供应商出售了什么
争议涉及的是打包的人类专业能力,而非据称转移了五角大楼文件或美国模型的秘密权重。
现代 AI 系统所需的不只是从网站收集的原始文本。开发者还会购买经过精心设计的示例、专家评估、评分说明和修正内容,以教会模型完成高难度任务。
这一过程通常被称为后训练。它通过展示更优答案、识别错误并奖励目标行为,在模型完成大规模初始训练后进一步提升其表现。
数据供应商会招募软件工程师、科学家、会计师、律师和其他专业人士从事这项工作,随后将专家产出组织成 AI 实验室可以反复使用的数据集。
最新调查描述了一个同时提供定制项目和现成数据集的市场。定制数据是为特定客户或模型目标创建的;现成数据则经过标准化,可出售给多位买家。
这一区别很重要,因为可复用数据集传播的可能不只是孤立事实。它们还可能包含通过早期项目形成的任务设计、评估方法、质量控制和推理模式。
根据这项基础性的训练数据调查,中国买家寻求覆盖金融、网络安全、编程和模型自我改进等领域的材料。该媒体审阅了多家数据平台买家和工作人员之间的通讯记录。
Forbes 报道称,腾讯高管表示依赖 Surge AI 提供数据。报道还将 Mercor 与腾讯、AfterQuery 与蚂蚁集团和阿里巴巴、Turing 与字节跳动联系起来。
这些发现需要谨慎归因。该媒体表示审阅了内部消息、访谈记录和项目文件,但大多数基础记录并未完整公开。读者无法独立查阅支撑每一项商业关联的全部文件。
这些公司公开回应也较为有限。Mercor 拒绝置评;AfterQuery 和 Surge 表示不披露客户信息。Turing 则称其同时服务专有模型和开源模型的开发。
报告中提到的中国公司未就该调查作出回应。它们的沉默既不能证实,也不能否定所报道的合作关系。
规模估计同样来自业内人士,而非公开财务披露。据报道,两名数据行业创业者估计,六家领先中国 AI 实验室每年在美国数据标注公司上的支出约为 5 亿美元。
同一报道还称,AfterQuery 至少有 5,000 万美元的经常性中国收入。报道援引一位知情人士称,中国实验室占 Mercor 第二季度收入的 2%。
如果这些数字准确,它们说明了为何这项业务会吸引供应商。市场规模足以影响销售策略,但其私密性也使客户和项目仍然难以追踪。
报道并未指控这四家供应商违反现有出口规定。专业数据集通常并不面临适用于先进处理器或半导体设备的同等管制。
这一法律缺口是事件的核心。在现行规则下,一项交易可能完全符合商业惯例,却仍会引发负责国家安全政策的立法者审查。
公开证据支持一个有限的结论:据报道,美国供应商正向中国商业组织提供结构化 AI 训练材料。它并不支持有关这些公司交出美国军事情报,或复制特定客户数据集的说法。
这条界限应当保持清晰。否则,围绕采购和出口管制的合理讨论可能演变为缺乏依据的间谍指控。
为什么 Google News 正在放大五角大楼采购问题
政治压力来自这些供应商重叠的客户名单,而非单纯的数据标注工作。
Surge AI 有获得小额国防部合同的记录。一份联邦小企业创新研究记录列出了一个 2023 年陆军项目,内容为 AI 辅助数据标注平台。
这项陆军数据合同总价值为 149,285 美元。公开记录显示,Surge Labs 为中标方,Edwin Chen 为首席研究员。
另一项空军项目在 2023 年向 Surge 授予了 73,194 美元。其说明的目标涉及用于搜索和总结情报报告的语言模型。
与大型国防科技合同相比,这些合同金额不大。然而,它们证明 Surge 已进入国防采购体系,所涉工作包括数据基础设施和情报相关应用。
公开的合同页面并未显示 Surge 获得了机密数据,也无法证明其美国项目与中国项目之间存在任何方法、材料或员工的交叉流动。
McCaul 的论点则聚焦于机构立场。他认为,受到政府业务信任的供应商,不应同时增强一家被五角大楼认定的组织的能力。
腾讯是最重要的例子。美国政府此前曾认定腾讯与中国军方有关联,但该公司对此定性提出异议。
被列入名单并不会自动使与腾讯进行的每一笔商业交易违法。然而,对服务国防客户的美国承包商而言,这确实会带来声誉和政策风险。
如今,阿里巴巴也面临同样的问题。2026 年 6 月,五角大楼将阿里巴巴、百度、比亚迪等企业列入一份扩大的实体清单,认定它们属于中国军方公司。
官方军方公司清单称,阿里巴巴通过与政府的关联为中国国防工业基础作出贡献。阿里巴巴否认这一结论,并对其被列入名单提出挑战。
这份清单本身是一项政府认定,而非刑事裁决。被列入名单可能阻止企业获得国防合同,并带来进一步限制,但并不能证明名单中每家公司的所有产品都服务于军事用途。
这一细微差别对于理解 AfterQuery 与蚂蚁集团据报道存在的合作关系至关重要。蚂蚁集团在重要的公司层面独立于阿里巴巴运营,尽管它们的业务和历史仍有联系。涉及蚂蚁集团的据报道项目,不应自动被描述为直接为中国军方工作。
不过,Google News 的标题确实有效捕捉到了政治问题。华盛顿正在要求科技供应商决定,政府业务是否意味着超出最低法律合规要求之外的责任。
联邦采购已对许多承包商施加安全规则、利益冲突披露和供应链要求。国会可以扩大这些规则,将 AI 训练数据或为被认定外国实体开展的工作纳入其中。
在监管机构定义新的出口类别之前,这种变化就可能对供应商施压。一家公司或许仍依法可以向海外出售数据集,却可能失去在国内获得联邦合同的资格。
这种做法会使采购政策成为出口管制的替代手段。由于各机构已经拥有广泛的承包商风险评估权力,它可以迅速推进。
但它也会带来复杂问题。AI 数据供应商使用分布式劳动力、分包商和专家市场。要确定一份数据集的来源、哪位客户资助了其设计,以及其中的方法是否被复用,都可能很困难。
政府采购方需要的不只是客户黑名单,还需要关于隔离团队、数据、评估方法和可复用材料的明确规则。
缺少这些细节,限制措施可能变得不一致。一个机构可能基于存在争议的客户关系拒绝某家供应商,另一个机构却继续向其采购。
因此,眼下的压力落在五角大楼采购官员身上。他们必须决定,承包商的海外商业业务是否构成运营风险、政治风险,或两者皆非。
真正的出口缺口在于人类专业能力
芯片限制瞄准计算能力,而据报道的数据贸易转移的是让这种能力更具实用性的办法。
美国的对华科技政策一直集中于处理器、半导体工具和制造知识。这些管制反映出训练先进 AI 系统所需的巨大计算需求。
计算只是其中一项投入。模型开发者还需要能够针对薄弱环节、衡量表现,并在专业领域教导可靠行为的数据。
原始互联网文本无法充分训练模型完成高级会计分析或审查实验室流程。这些任务需要了解相关工作的人员提供示例和判断。
一家供应商可能招募一名专业人士产出解决方案,再由另一名专家提出批评,第三名专家为不同答案评分。最终形成的数据包会向模型展示高质量表现应具备的样子。
评估量表尤其有价值。量表定义了一份答案必须具备的特质,以及哪些错误应当降低其分数。它将专业判断转化为可重复的训练信号。
据报道的交易表明,中国实验室可以购买这套基础设施,而不必在内部建立每一个专家网络和质量流程。这可以减少试验成本,并缩短开发周期。
Nathan Lambert(曾任 Allen Institute for AI 研究科学家)告诉 Forbes,随着模型进入更困难的领域,高质量数据变得尤为重要。这一观察解释了为何数据集具有显著的商业价值。
然而,国家安全层面的理由并非不证自明。数据供应商往往利用公开知识和受薪专家的劳动来制作内容。限制这类服务,与限制一款专用芯片相比,涉及不同的法律和实践问题。
处理器是具有型号、出货记录和可测量性能的实体产品。训练数据集则可以被复制、修改、与其他材料合并,或通过服务合同交付。
同一家供应商也可能为不同客户生产不同的数据。在某个项目中服务 Anthropic,并不能证明其在其他地方出售的现成数据集含有 Anthropic 的机密信息。
这一差异至关重要。根据相关报道,这场争议涉及共享的生产能力和专业知识。它并不能证明美国实验室的专有客户数据遭到未经授权的转售。
战略层面的担忧依然存在。供应商会了解哪些专家工作流程能带来有用改进、如何剔除低质量贡献,以及如何高效构建评估系统。
即使没有机密记录被转手,这些运营知识也能帮助另一家实验室更有效地配置资源。其优势部分在于生产方法。
华盛顿在其他技术领域也遇到过类似挑战。出口管制在官员能够界定受限物项并识别其目的地时最为有效。
知识密集型服务则更难隔离。监管者必须决定应当管制最终数据集、主题内容、生产流程、买方,还是这些因素的某种组合。
过于宽泛的规则也可能损害美国供应商。全球销售支持营收、吸引国际专家,并帮助美国公司维持对行业标准的影响力。
Forbes 引述的 AI 数据顾问 Sean Cai 警告称,全面限制可能削弱开源发展,并巩固少数封闭模型提供商的地位。他并未否认安全担忧,但质疑简单化的限制措施。
这一论点构成了对 McCaul 提案最有力的反方立场。强制性的商业切割或许会限制中国获取相关资源,但也可能割裂研究市场,并降低美国供应商之间的竞争。
开源模型又增加了一层复杂性。其权重和训练方法可以广泛流通,而用于改进它们的数据集则可能仍属私有。
限制美国数据服务并不会消除中国的替代选择。它会鼓励本土数据公司、大学和众包平台取代美国供应商。
因此,政策问题关乎延缓与杠杆,而非永久阻断。限制措施可能减缓获取某些专家网络或评估方法的速度,但无法抹去其背后的基础知识。
读者还应将数据质量与模型能力区分开来。购买高质量样本可以提升性能,但并不能保证产出具有竞争力的前沿模型。
实验室仍需要计算基础设施、研究人员、算法、部署系统和持续测试。数据是一项高价值投入,而不是这些能力的完整替代品。
Google News 的关注之所以重要,是因为它将这一微妙机制带入了公众讨论。熟悉芯片管制的读者如今可以理解,为何人类生成的训练材料也属于同一场战略讨论。
现有证据尚不足以证明存在安全漏洞
目前最有力的已证实担忧是未披露的政策冲突,而最严重的指控仍未得到证实。
目前没有公开证据表明 Surge AI、Mercor、AfterQuery 或 Turing 向中国客户转移了美国机密信息。
相关报道也未证明依据 Pentagon 合同创建的数据集被转售至海外。它没有显示 Anthropic、Google、Meta 或 OpenAI 的客户材料在未经授权的情况下被共享。
这些都将是严重得多的指控。它们需要合同、技术记录或尚未公开的直接证词作为依据。
现有证据反而是由被报道的客户关系、政府授标记录、行业估算和一名议员的评论构成。
这些材料足以支持审查,但不足以将这些公司描述为军事机密的输送渠道。
随着政治关注度上升,这一区分可能越来越难以维持。新闻标题会将复杂的供应链压缩为公司向对立双方“输送”资源的简单图景。
这种表述传达了冲突,但可能暗示存在一个在客户之间流动的共同信息池。数据供应商很少公开说明其如何隔离项目,因此这种暗示难以检验。
这些公司可以通过提高透明度消除大部分不确定性。它们可以披露针对指定实体的政策、客户筛查、数据来源,以及政府团队与商业团队之间的隔离措施。
它们也可以说明,现成产品是否采用了在机密项目期间形成的技术。这类解释无需披露客户数据。
独立审计将提供更有力的证据。审计人员可以在不公开敏感材料的情况下,测试访问控制、员工权限、数据谱系和合同限制。
政府采购官员也应提出类似问题。与外国客户的关系只是风险评估的一部分。
他们应审查人员是否重叠、工具是否共享存储环境,以及可复用数据集是否保留了机密规范。他们还应核实承包商如何管理分包商。
供应商有限的回应让这些问题仍悬而未决。保密义务可能阻止它们点名客户,但它们仍可公布一般性保障措施。
中方也对华盛顿更广泛的认定提出异议。Alibaba 和 Baidu 否认自己是军工企业,而中国政府指责美国扩大国家安全定义。
Associated Press 报道称,Pentagon 的名单在 2026 年扩大至 188 家实体。这场指定争议说明,政策制定者应当区分官方分类与经独立证实的军事活动。
这不仅仅是语义问题。与 Pentagon 名单挂钩的规则,将继承与该名单相关的争议、增补、移除和法院挑战。
即便相关商业项目仍然合法且与国防无关,一旦客户被指定,供应商也可能失去联邦资格。
Congress 需要决定限制是否具有追溯力。它还需要建立程序,让企业披露、逐步终止或质疑存在问题的关系。
另一个不确定因素涉及 Mercor 据报道获得的联邦合同。公开报道称,该公司曾告诉员工已获得政府项目,但可获得的细节仍然有限。
在缺乏机构名称、项目范围、授标记录或合同条款的情况下,现在将 Mercor 的处境与 Surge 已公开的授标置于同等证据基础上还为时过早。
AfterQuery 和 Turing 又呈现不同情况。报道将它们与中国客户联系起来,但目前所描述的公开证据并未证明两家公司任何一家拥有 Pentagon 合同。
将四家供应商视为完全相同,会掩盖有意义的差异。每一段关系都需要单独核实。
McCaul 的提案是一种政治立场,而非现行的政府范围规则。各机构尚未公开宣布一项全面禁令,涵盖所有服务于被指定中国公司的数据供应商。
不过,Congress 已加大对中国 AI 系统和美国技术依赖问题的关注。2026 年 7 月的一项 House investigation 审查了美国公司如何使用中国开放权重模型。
该调查关注的是相反方向的流动,即中国模型进入美国系统。这两场讨论共同表明,立法者正在从两个方向审视 AI 供应链。
一方追问美国企业是否应购买中国模型。另一方则追问美国企业是否应向中国实验室出售能够改进这些模型的数据。
这两个问题都不能仅凭国籍来解决。风险取决于买方、应用场景、数据集、访问控制,以及基础专业知识的敏感程度。
最有力的政策应聚焦这些可衡量因素。宽泛的政治标签更易传播,却不够精确,难以执行。
三个信号将揭示接下来的走向
下一阶段将由采购规则、公司披露和有关数据集隔离的证据来界定。
第一个信号是 Pentagon 或 Congress 的正式行动。McCaul 提出了一项原则,但各机构必须先将该原则转化为合同条款,才能改变供应商的行为。
一项有实质意义的行动会明确涵盖的实体和受限服务。它还会说明,供应商能否通过终止业务、分离运营或采取更严格的控制措施来保留资格。
仅限于 Pentagon 指定公司的规则,会比涵盖所有中国 AI 客户的禁令更为狭窄。这一区别将决定商业影响。
政府范围的采购条款将强化这样一种判断:华盛顿将训练数据视为战略资产。若继续逐案处理,则表明官员们仍不确定可行边界何在。
第二个信号是被点名供应商的披露。Surge AI、Mercor、AfterQuery 和 Turing 可以在不暴露机密客户记录的情况下澄清自身立场。
最有用的披露将说明筛查标准、禁止的应用场景、数据隔离,以及现成产品的再利用政策。
如果这些公司宣布避免服务被指定的军方关联客户,McCaul 的施压将无需立法便促成市场回应。
如果它们为全球销售辩护并强调现有控制措施,讨论将转向这些控制是否能满足政府买方的要求。
沉默本身也有代价。联邦客户通常要求对供应链风险具备信心,尤其是在承包商涉及情报、国防或敏感运营信息时。
第三个信号是有关数据来源的独立证据。来源记录会追踪训练材料来自何处、由谁修改,以及哪些限制约束其使用。
一项显示严格项目隔离的可信审计,将削弱美国客户知识直接流向中国实验室的说法。但它无法解决有关向海外出售专业能力的更广泛争议。
若出现重复使用机密规范的证据,将引发严重得多的争议。这可能触发合同执行、诉讼,或超出采购政策范围的出口管制行动。
读者应关注文件,而不仅仅是更强烈的言辞。合同授标、机构备忘录、审计报告和公开的合规政策,比匿名市场估算更能揭示真相。
通过 Google News 追踪该事件时,同样应保持这种审慎。聚合新闻标题有助于识别正在出现的争议,但往往会将指控、已核实记录和政治提案压缩进一句话。
经核实的记录范围更窄。Surge 在 2023 年获得了两项小额国防研究合同。Forbes 报道称,四家美国数据供应商与数家中国科技机构存在商业合作关系。
五角大楼已将 Tencent 及其他数家中国科技公司列为与军方有关联的实体,尽管这些公司对这一认定提出异议。McCaul 希望联邦承包商在美国政府业务与某些中国客户之间作出选择。
同样重要的是,仍有许多情况尚不明确。公开记录并未显示存在机密信息转移、跨客户复用数据集,或一项目前覆盖此类销售的全面禁令。
对开发者而言,这一事件说明,数据溯源正逐渐成为产品要求。采购训练材料的团队需要了解其来源、许可授权、复用条件以及质量控制措施。
企业采购方也面临类似责任。即使所购服务本身表现良好,供应商的客户名单仍可能成为合规问题。
创建训练示例的知识工作者同样应当思考:自己的贡献可能如何被打包并转售。这些工作可能会以标准承包协议未必明确揭示的方式,跨越不同模型、市场和司法辖区流转。
即使华盛顿限制四家公司,这场冲突也不会消失。由于模型在专业领域需要更高质量的反馈,对专家生成数据的需求正在扩大。
政策可以影响哪些供应商能够承接这一需求,以及它们以何种透明度运营。但政策无法消除专业判断所具有的经济价值。
因此,最有价值的下一步是审慎审查,而非立即下定论。应关注采购措辞,审视供应商的保障措施,并将有据可查的交易与有关国家安全后果的主张区分开来。
华盛顿会将 AI 训练数据界定为受管制的战略资源,还是继续依靠单个合同来监管市场?答案将决定这场 Google News 争议会成为持久的政策转向,还是又一次关于 AI 隐秘供应链、尚未得到解决的警示。



