top of page

美国议员调查 DoorDash 使用 Kimi K2.6 一事

据一篇 Google News 报道,DoorDash 在测试 Kimi K2.6 后正面临国会审查,尽管这款中国模型在内部代码审查基准测试中的表现更为出色。

这项据报道开展的调查,将一项技术采购决策变成了一场国家安全检验。DoorDash 使用 Moonshot AI 的模型检查源代码,再由另一款模型复核其发现。据报道,议员希望了解 DoorDash 如何部署 Kimi、该模型能够访问哪些信息,以及这项试验是否带来了数据或安全风险。

DoorDash 的结果解释了为何这一问题不会止于一家配送公司。其基准测试发现,Kimi 与 Anthropic 的 Claude Fable 5 搭配时,比若干完全围绕美国模型构建的配置发现了更多真实代码问题。该设置消耗的资源也少于 DoorDash 此前采用的双 Claude 方案。

这构成了核心冲突。企业希望为每项任务选择表现最好的模型,不论其开发地为何处。华盛顿则日益将对中国 AI 的依赖视为一种战略脆弱性,即使企业是在自己控制的基础设施上运行开放权重模型。

DoorDash 实际如何使用 Kimi K2.6

DoorDash 并未宣布 Kimi 将处理食品订单、客户对话或配送地点信息。它测试该模型,是将其作为内部软件审查系统的一部分。

这一区别很重要,因为“使用中国 AI”可能指向几种截然不同的安排。企业可能将信息发送给模型提供商的托管接口;也可能通过美国云平台访问同一模型;还可以下载开放权重——即可供独立部署的模型参数——并在受控环境中运行。

公开材料并未说明 DoorDash 在每项测试中具体采用了哪种部署路径。这个未解问题正是据报道的调查核心。模型的来源本身并不能说明提示词经过何处、日志存储在哪里,或谁能够查看生成的数据。

DoorDash 在发现常规反馈无法显示其 AI 审查器漏掉哪些缺陷后,开发了一套名为 DashBench 的内部评估体系。其工程师从 105 次历史代码变更中构建基准,并将多种模型组合与经裁定的发现进行比较。

单个模型审查一次代码变更时,往往会遗漏大多数已知问题。因此,DoorDash 引入了双阶段流水线:侦察模型广泛搜索可能的缺陷,审查模型则评估这些候选项并排除质量较低的发现。

公司发布的代码审查基准显示,Kimi K2.6 侦察模型与 Claude Fable 5 搭配时,实现了 65.2% 的加权召回率。加权召回率对严重缺陷赋予比轻微缺陷更高的重要性。同一配置还达到了 75.3% 的加权 F1 值,平衡了召回率与精确率。

DoorDash 表示,Kimi 与 Fable 的组合在有效基准测试子集中发现了 537 个真实问题,取得 89.2% 的加权精确率,并捕获了 80% 的关键问题簇。这些是公司的基准测试结果,并非对任何一款模型进行的独立审计。

此前的配置使用 Claude Sonnet 4.6 作为侦察模型、Claude Opus 4.8 作为审查模型,达到 53.6% 的加权召回率。它发现了 504 个真实问题,覆盖了 62.5% 的关键问题簇。因此,DoorDash 的数据表明,中美模型混合的流水线发现了更大比例的重要问题。

没有任何一种配置在所有指标上占据优势。Composer 与 GPT 的组合实现了最高的加权精确率,但召回率低得多。单阶段系统所需的计算资源更少,但也遗漏了更多已知问题。该基准支持按任务路由模型,而非让一个系统执行所有任务的想法。

DoorDash 联合创始人兼首席技术官 Andy Fang 曾公开将这一方案的吸引力概括为:以更低成本获得更高质量。他的评论反映了该基准的实际结论:专门化工作流可以胜过一组成本更高、但各自声名显赫的模型。

原始的 Google News 报道称,议员如今正在审查这一选择。公开记录尚未证明 DoorDash 曾向 Moonshot AI 暴露客户数据或专有代码。

这一核实缺口至关重要。调查是对事实的要求,而不是不当行为的证据。下一个问题是,议员会评估部署架构,还是会将开发商的国籍视为决定性风险。

为什么 Google News 的调查影响不止 DoorDash

这项调查给每一家使用模型路由器的美国公司带来压力,因为普通的基准测试决策如今也可能触发地缘政治审查。

企业 AI 已不再只选择一个通用模型。工程团队正越来越多地根据准确性、延迟、运营成本、上下文限制和安全要求,将不同任务发送给不同系统。

较小的模型可能总结常规文档。编码模型可能在代码库中搜索缺陷。高端推理系统可能审查最棘手的案例。所谓路由器,即为每次请求选择模型的软件,可以在同一工作流中整合这些系统。

DoorDash 的基准就是一个清晰例子。Kimi 负责广泛搜索,而 Claude 作出最终判断。中国模型并非只是替代美国模型;两个系统承担不同角色,并从彼此的差异中获益。

这种架构使传统采购规则变得复杂。一家公司可能使用数十种模型,却不直接向客户展示其中任何一种。有些通过托管接口运行,另一些则在隔离的云环境中运行。这些安排的风险存在显著差异。

议员此前已就中国开发的 AI 展开更广泛的调查。4 月,众议院国土安全委员会主席 Andrew Garbarino 与众议院中国问题特别委员会主席 John Moolenaar 宣布,对与此类模型相关的国家安全风险开展联合调查。

他们最初的信函聚焦于 Cursor 的开发商 Anysphere 和 Airbnb。官方的众议院调查称,Cursor 的 Composer 2 据报道是基于一款开放权重的 Moonshot 模型构建的。调查也质疑了 Airbnb 据报道为客服工作依赖 Alibaba 的 Qwen 一事。

这些委员会将此事界定为不只是商业竞争。他们提出了对数据暴露、安全控制、政治审查以及长期依赖由中国企业开发模型的担忧。

DoorDash 如今符合这一既有模式。它的试验提供了异常具体的证据,表明一款中国模型能够在美国公司的开发流水线中赢得有意义的角色。这使其对辩论双方都具有参考价值。

支持模型多样性的人可以指出可量化的改进。安全倡导者则可以追问,更好的基准成绩是否促使企业的推进速度超过其治理流程。美国 AI 实验室则可以主张,外国竞争对手从美国资助的研究和基础设施中获益。

压力还延伸至云服务商和模型市场。企业可通过多个中介渠道获得 Kimi,而不只通过 Moonshot 的托管服务。这些中介可能提供美国数据驻留、日志控制、访问策略和合同保护。

不过,基础设施所在地并不能回答所有担忧。可下载权重可能含有难以通过采购文件识别的行为。当模型被整合进敏感系统时,它可能复现政治偏见、过于轻易地遵循有害指令,或带来新的供应链问题。

因此,政策挑战需要细致区分。托管的中国 API、在美国云账户中运行的开放模型,以及完全隔离的部署,并不等同。忽略这些差异的规则,可能会在未能阻止不安全部署的同时,反而抑制更安全的部署。

真正的冲突是性能与来源之间的较量

DoorDash 按测得的性能选择模型,而议员则在追问:模型来源是否应限制企业被允许优化的内容。

来源涵盖模型来自何处、由谁训练、哪些数据对其产生影响,以及谁能够更新或运行它。性能则描述模型在既定测试下的表现。企业买家正越来越需要两种评估,但二者可能指向不同选择。

DashBench 衡量模型组合是否能发现已知缺陷,同时也考虑严重程度、精确率、召回率和运行资源。这比依赖通用排行榜更有参考价值,因为代码审查质量取决于 DoorDash 自身的代码库和开发模式。

该基准表明了应用特定测试为何重要。基于 GPT 的组合实现了较高精确率,却遗漏了许多已知发现。Claude 组合获得了更广泛的覆盖。Kimi 作为侦察模型,与严格的 Claude 审查模型配对时提高了召回率。

这并不能证明 Kimi K2.6 是最佳的通用编码模型。它只表明,该模型在一个基准和一种编排设计中,有效承担了一个角色。

Moonshot 将 Kimi K2.6 描述为一款面向编码和长时程智能体任务的多模态开放权重模型。多模态意味着它可处理的不仅是纯文本,而智能体任务则需要在多个步骤中反复作出决策并使用工具。

官方 Kimi 模型卡称,该模型支持原生 INT4 量化,这是一种降低其权重数值精度的技术,可减少部署所需的内存。Moonshot 还将 vLLM、SGLang 和 KTransformers 列为受支持的推理引擎。

这些分发选项有助于解释 Kimi 的商业吸引力。企业可以通过兼容接口测试该模型、通过第三方部署其权重,或在受控基础设施上运行它们。这种灵活性赋予买家闭源模型提供商并不总能提供的议价能力。

开放权重也使“使用 Kimi 就会自动将信息发送到中国”的指控变得复杂。如果 DoorDash 在隔离环境中运行该模型,Moonshot 可能从未收到提示词或代码。如果它直接使用 Moonshot 的 API,数据流则会呈现不同的风险特征。

只有 DoorDash 能够澄清实际配置。它需要说明模型提供商、托管区域、保留设置、网络控制、提示词内容和员工访问权限。议员很可能也会寻求同样的细节。

商业激励正在向 Kimi 倾斜。7 月的一项企业采用分析指出,企业正因成本、能力以及获取开放权重的便利性而试用中国模型。

该报告提到 Cursor 使用 Kimi、Airbnb 试用 Qwen,以及 Siemens 测试来自多个国家的模型。报告还称,美国初创公司正在将不同工作分配给不同模型家族,而非彻底替换某一家供应商。

这种模式削弱了简单的“中美对立”采购叙事。企业系统正日益组合使用多家开发者的模型。竞争单元正变成整个工作流,其中包括路由规则、评估数据、安全边界与人工审核。

但模型来源并不会在这一工作流中消失。低成本模型仍可能带来法律、安全或声誉风险。企业必须判断,在加入治理、监控与部署控制后,其基准测试优势是否依然成立。

美国模型开发商也面临自身压力。若开放的中国模型能在高频工作中表现出色,高端供应商就必须通过更高可靠性、安全证据、工具集成或最困难任务上的表现来证明自身价值。

DoorDash 的架构已反映出这种市场分化。它使用 Kimi 进行广泛搜索,再由 Claude 进行验证。这种安排在降低对全 Claude 流水线依赖的同时,也保留了 Anthropic 的角色。

国会调查可能会强化这种分工。企业可能将美国闭源模型保留给敏感决策,同时使用隔离的开放模型处理更广泛的任务。它们也可能要求更有力的审计证据,才允许任何由外国开发的模型接触专有信息。

安全问题无法通过基准测试回答

DashBench 衡量的是 Kimi 能否发现软件缺陷,而非该模型是否符合国家安全、隐私或供应链要求。

这一限制并不意味着该基准测试薄弱。它只是表明 DoorDash 将其设计用于回答另一个问题。工程质量与部署风险需要分别评估。

安全审查首先应从数据流入手。调查人员需要了解 DoorDash 是否将源代码、开发者评论、代码库元数据、凭据或生产信息发送到其受控环境之外。他们还需要知道提供商保留了哪些内容,以及人类是否能够审阅输入内容。

下一个问题涉及模型完整性。开放权重可以被检查和测试,但其规模使全面分析并不现实。企业需要可复现的哈希值、受控的模型注册库、漏洞监控,以及针对未来版本的审批流程。

Kimi K2.6 已不再是 Moonshot 的最新模型。这带来了另一个治理问题:团队必须决定,审批适用于某一固定工件,还是适用于整个产品家族。自动接受更新可能绕过支撑原始部署决策的测试。

安全证据也仍不完整。对前代 Kimi K2.5 模型的一项独立评估发现,它在多个双重用途领域的能力可与领先的闭源系统相当。双重用途能力既可支持正当工作,也可能被用于有害活动。

这项初步安全评估称,该模型对某些化学、生物、放射性、核与爆炸物请求的拒绝较少。评估还发现,该模型在某些情境下存在政治偏见,并且更倾向于遵从特定的有害指令。

这些发现针对的是 K2.5,而非 K2.6,不能自动套用到更新的模型上。但它们说明,单靠性能测试无法平息围绕具备先进编程和工具使用能力的开放权重模型所展开的争议。

Moonshot 并未为每一次发布都提供美国企业买家日益期待的那类全面安全文档。独立研究人员可以部分弥补这一缺口,但他们的测试往往在部署开始后才出现。

立法者还提出了与模型蒸馏有关的担忧。蒸馏是指利用一个系统的输出训练另一个系统,使较小或较新的模型模仿部分能力。这项技术很常见,但提供商可通过服务条款禁止某些形式。

Anthropic 指控 Moonshot、DeepSeek 和 MiniMax 利用欺诈账户开展协调性的蒸馏活动。Moonshot 的公开立场则反驳了中国实验室不当复制美国能力的指控。这些说法仍是更广泛政治与商业冲突的一部分。

DoorDash 对 Kimi 的使用,并不能证明 Moonshot 如何训练了该模型。不过,立法者可以通过采购调查向那些让中国模型获得美国市场分发与合法性的企业施压。

此外还存在审查担忧。在中国监管条件下训练的模型,可能会回避或扭曲政治敏感话题。对于研究、沟通和面向客户的部署,这一问题尤为重要。

但在模型搜索代码缺陷时,这一问题的直接相关性较低,前提是政治行为不影响该任务。风险评估应基于实际用途,而不应假定每项已知限制都同等适用于每种部署。

最强的质疑观点是,企业可能低估间接暴露风险。即使代码审查提示词不含客户记录,也可能包含专有逻辑。代码库结构可以暴露规划中的产品、内部系统或安全控制措施。

最有力的辩护则是,自托管的开放权重可能比闭源美国 API 提供更强的数据控制。企业可以阻止外部网络访问,保留自己的日志,检查推理服务栈,并冻结已获批准的模型版本。

这两种观点都可能成立。开放部署可以减少提供商访问数据的机会,但也会让运营方承担更多责任。关键问题并非开放模型是否天生安全,而是 DoorDash 是否建立了与模型处理信息相称的控制措施。

华盛顿现有的 AI 战略面临现实检验

这项调查将显示,当中国模型在美国企业内部表现出色时,美国政策是否能区分技术风险与经济竞争。

美国的限制措施一直集中于限制中国获取先进芯片、制造工具、投资与敏感技术。开放权重模型对这一战略构成挑战,因为软件一经发布便可在全球传播。

一旦权重可供下载,禁止直接商业访问并不能清除已有副本。开发者可以通过本国基础设施运行这些模型、对其进行修改,或从模型市场获取它们。

众议院委员会认为,中国模型正在美国企业与基础设施中造成依赖。其 4 月声明援引报道称,中国开发系统所处理工作负载的全球份额正在增长。鉴于模型流量变化迅速,相关估算与定义值得审视。

即便如此,趋势已清晰可见。中国模型因兼具竞争力能力与灵活部署方式而获得用户。根据一项Associated Press 分析,OpenRouter 在最近一个月追踪到的五个最受欢迎模型均来自中国。

同一篇报道称,随着 agent 使用增加,中国模型正接近广泛采用。agent 会生成长串模型调用,因此微小的效率差异会在规划、工具使用、重试和验证过程中不断累积。

DoorDash 的分阶段审查器正说明了这一机制。侦察模型会先搜索大量潜在问题,再由审查模型进行评估。高吞吐量的第一阶段使运营效率尤为重要。

广泛的限制措施可以保护美国提供商免受快速增长的竞争者冲击,但也可能增加那些使用开放模型、且不向中国企业传输数据的初创公司与企业的成本。

相反,狭义规则可以聚焦敏感行业、托管数据流、政府系统,或涉及关键基础设施的部署。这种做法会要求监管机构和采购团队具备更多技术专长。

政府也可以要求披露而非禁止。企业可以记录模型来源、托管地点、数据保留政策、基准测试结果、安全测试与访问控制。这将在不将每次试验都视为违规的前提下,建立可审计记录。

不过,披露也有局限。企业可能不愿公开模型选择或系统架构,因为这些信息可能暴露商业战略与安全控制。较小的公司也可能缺乏人员,为每次模型更新完成广泛评估。

美国实验室同样有推动更强限制的政策利益。它们在训练、安全测试与基础设施上投入巨大,随后却要与以更低运营成本分发的开放模型竞争。它们的担忧既涉及知识产权,也涉及安全。

买方则有不同的利益诉求。他们希望提供商之间保持竞争,并能将任务路由至最适合的系统。限制模型选择可能让他们更加依赖少数几家美国供应商。

因此,Google News 的报道指向一个艰难的监管选择。华盛顿可以主要将 Kimi 的采用视为安全问题、知识产权问题,或产业政策问题。每一种框架都支持不同的补救措施。

DoorDash 已成为一个极具价值的案例,因为其公开基准测试提供了企业选择该模型的证据。这一决定并非基于模糊的热情,而是源于与美国替代方案的量化比较。

如果立法者在要求更严格部署控制的同时承认这些证据,这项调查可能改善企业治理。如果他们将基准测试成功本身视为可疑,企业可能会停止公开评估,却不会停止底层试验。

那样的结果将降低透明度。工程团队公开披露测试了哪些模型、这些系统表现如何以及控制措施在哪些方面失效的动力会更小。

DoorDash 调查后的观察重点

三个信号将决定这是否成为一场狭义的安全审查,还是对中国 AI 进入美国企业的更广泛壁垒。

第一个信号是 DoorDash 对部署方式的披露。该公司无需公开敏感架构,但可以说明 Kimi 是通过 Moonshot、第三方提供商,还是隔离基础设施运行的。

它还可以说明所处理的信息类别、数据保留政策、网络限制,以及试验是否涉及生产代码库。隔离运行的证据将削弱“使用模型必然向中国提供商暴露信息”的说法。

直接向外部传输数据的证据则会强化收紧控制的理由。关键区别在于模型在哪里运行、谁能访问其输入,而不仅仅是其开发商注册在哪里。

第二个信号是国会要求的范围。措辞狭窄的调查将聚焦合同、托管、数据流动、模型测试与风险控制。这将表明立法者希望了解某一具体部署的事实。

若要求涵盖每一种由中国开发的模型,则将表明政策正转向基于来源的限制。此类做法可能影响 Cursor、Airbnb、Siemens,以及许多正在测试开放系统的小型企业。

密切关注立法者是否寻求自愿简报、提出报告要求,或起草具有约束力的限制措施。这些行动对企业采购方意味着截然不同的影响。

第三个信号在于美国供应商如何回应。Anthropic、OpenAI 和 Google 可以通过价格、部署灵活性、安全文档,或面向高吞吐量任务的专用模型展开竞争。

它们也可能支持对外国系统实施限制。如果政策成为主要应对手段,采购方可能会将这场争论视为保护本土供应商,而非一项中立的安全干预。

DoorDash 自身的下一项基准决定将颇具启示意义。如果公司在审查其控制措施后仍保留 Kimi,说明其性能优势很可能经受住了治理审查。如果公司移除该模型,观察人士则需要判断,推动这一决定的是技术风险、政治压力,还是某个更新的替代方案。

更大的启示是,模型选择已成为董事会层面的风险决策。工程团队依然需要基准测试,但这些测试必须与数据分类、威胁建模、法律审查和供应商评估并列进行。

读者也应谨慎看待 Google News 的标题。报道中的调查表明相关方面正受到审查,而非已确认发生数据泄露。目前的公开证据显示,DoorDash 曾在代码审查中测试 Kimi,并报告了强劲的内部结果。

未知之处比标题本身更重要:模型在哪里运行?哪些信息被输入其中?周围部署了哪些控制措施?Congress 会认为何种回应才算适度?

未来一到三个月应能提供这些答案。请关注 DoorDash 的披露、各委员会的书面要求,以及任何拟议的采购规则。它们将共同揭示,混合模型系统是否仍只是工程层面的选择,还是会成为美中科技政策的新战线。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page