미국 의원들, DoorDash의 Kimi K2.6 사용 조사
- Aisha Washington
- 1일 전
- 11분 분량
Google News 보도에 따르면 DoorDash는 내부 코드 리뷰 벤치마크에서 중국 모델이 더 강력한 성과를 냈음에도 Kimi K2.6를 시험한 일로 의회의 조사를 받고 있다.
이번 조사 보도는 기술적 구매 결정을 국가 안보 시험대로 바꿔 놓았다. DoorDash는 다른 모델이 결과를 검토하기 전에 Moonshot AI의 모델로 소스 코드를 점검했다. 의원들은 DoorDash가 Kimi를 어떻게 배포했는지, 어떤 정보에 접근할 수 있었는지, 그리고 이 실험이 데이터 또는 보안 위험을 초래했는지를 파악하려는 것으로 전해졌다.
DoorDash의 결과는 이 사안이 한 배달 기업에만 그치지 않을 이유를 보여준다. 해당 벤치마크에서는 Kimi와 Anthropic의 Claude Fable 5를 함께 사용한 구성이 미국 모델만으로 구축한 여러 구성보다 더 많은 실제 코드 문제를 발견했다. 이 설정은 DoorDash의 기존 두-Claude 접근 방식보다 리소스도 덜 소모했다.
이것이 핵심 갈등을 낳는다. 기업들은 개발 국가와 관계없이 각 작업에 가장 적합한 모델을 원한다. 워싱턴은 기업이 통제하는 인프라에서 오픈 웨이트를 실행하는 경우에도 중국 AI에 대한 의존을 전략적 취약점으로 점점 더 간주하고 있다.
DoorDash가 Kimi K2.6로 실제로 한 일
DoorDash는 Kimi가 음식 주문, 고객 대화 또는 배달 위치를 처리할 것이라고 발표하지 않았다. 이 모델은 내부 소프트웨어 검토 시스템의 일부로 시험됐다.
“중국 AI 사용”이라는 표현은 서로 매우 다른 여러 방식을 의미할 수 있기 때문에 이 구분은 중요하다. 기업은 모델 제공업체의 호스팅 인터페이스로 정보를 전송할 수 있다. 미국 클라우드 플랫폼을 통해 같은 모델에 접근할 수도 있다. 또는 독립 배포가 가능한 모델 파라미터인 오픈 웨이트를 내려받아 통제된 환경 내부에서 운영할 수도 있다.
공개된 자료만으로는 DoorDash가 모든 테스트에서 어떤 배포 경로를 사용했는지 확인되지 않는다. 이 미해결 질문이 보도된 조사의 핵심에 놓여 있다. 모델의 출신만으로는 프롬프트가 어디로 이동했는지, 로그가 어디에 저장됐는지, 또는 누가 생성된 데이터를 검토할 수 있었는지를 알 수 없다.
DoorDash는 일반적인 피드백만으로는 AI 리뷰어가 놓친 결함을 확인할 수 없다는 사실을 발견한 뒤 DashBench라는 내부 평가 체계를 개발했다. 엔지니어들은 과거 코드 변경 105건으로 벤치마크를 구성하고, 판정된 결과를 기준으로 여러 모델 조합을 비교했다.
단일 모델이 코드 변경을 검토할 경우 알려진 문제 대부분을 놓치는 경우가 많았다. 이에 DoorDash는 2단계 파이프라인을 도입했다. 스카우트 모델이 가능한 결함을 폭넓게 탐색하고, 리뷰어가 그 후보를 평가해 근거가 약한 결과를 제외하는 방식이다.
회사가 공개한 코드 리뷰 벤치마크에 따르면 Kimi K2.6 스카우트와 Claude Fable 5를 결합한 구성은 가중 재현율 65.2%를 기록했다. 가중 재현율은 경미한 결함보다 심각한 결함에 더 큰 중요도를 부여한다. 같은 구성은 재현율과 정밀도의 균형을 나타내는 가중 F1 75.3%를 달성했다.
DoorDash는 Kimi와 Fable 조합이 유효한 벤치마크 하위 집합에서 실제 문제 537건을 발견했다고 밝혔다. 가중 정밀도는 89.2%였고, 심각한 이슈 클러스터의 80%를 포착했다. 이는 회사 자체 벤치마크 결과이며, 어느 모델에 대해서도 독립적인 감사를 수행한 결과는 아니다.
Claude Sonnet 4.6을 스카우트로, Claude Opus 4.8을 리뷰어로 사용한 이전 구성은 가중 재현율 53.6%를 기록했다. 이 구성은 실제 문제 504건을 찾아냈고, 심각한 클러스터의 62.5%를 포괄했다. 따라서 DoorDash의 데이터는 중국 및 미국 모델을 혼합한 파이프라인이 의미 있는 문제를 더 폭넓게 발견했음을 시사했다.
어떤 구성도 모든 지표를 지배하지는 않았다. Composer와 GPT 조합은 가장 높은 가중 정밀도를 제공했지만 재현율은 훨씬 낮았다. 단일 패스 시스템은 연산 리소스를 덜 필요로 했지만, 알려진 문제를 더 많이 놓쳤다. 이 벤치마크는 하나의 시스템이 모든 작업을 수행해야 한다는 생각이 아니라 모델 라우팅을 뒷받침했다.
DoorDash 공동창업자 겸 최고기술책임자 Andy Fang은 더 낮은 비용으로 더 나은 품질을 얻는다는 점을 공개적으로 요약했다. 그의 발언은 벤치마크의 실용적 결론을 반영한다. 특화된 워크플로는 개별적으로 명성이 높은 모델을 더 비싸게 조합한 구성보다 뛰어난 성과를 낼 수 있다.
원래의 Google News 보도에 따르면 의원들은 현재 그 선택을 검토하고 있다. 공개 기록은 DoorDash가 고객 데이터나 독점 코드를 Moonshot AI에 노출했다는 사실을 아직 입증하지 못했다.
이 검증 공백은 매우 중요하다. 조사는 사실 확인을 요구하는 절차이지, 위법 행위의 증거가 아니다. 다음 쟁점은 의원들이 배포 아키텍처를 평가할지, 아니면 개발사의 국적을 결정적 위험 요소로 취급할지다.
Google News 조사가 DoorDash를 넘어서는 이유
일상적인 벤치마크 결정도 이제 지정학적 검토를 촉발할 수 있기 때문에, 이번 조사는 모델 라우터를 사용하는 모든 미국 기업에 압박을 가한다.
엔터프라이즈 AI는 하나의 범용 모델을 선택하는 방식에서 벗어나고 있다. 엔지니어링 팀은 정확도, 지연 시간, 운영 비용, 컨텍스트 한도 및 보안 요구사항을 기준으로 서로 다른 작업을 서로 다른 시스템에 점점 더 배정하고 있다.
더 작은 모델은 일상적인 문서를 요약할 수 있다. 코딩 모델은 리포지토리에서 결함을 찾을 수 있다. 프리미엄 추론 시스템은 가장 어려운 사례를 검토할 수 있다. 각 요청에 맞는 모델을 선택하는 소프트웨어인 라우터는 이러한 시스템을 하나의 워크플로 안에서 결합할 수 있다.
DoorDash의 벤치마크는 명확한 사례다. Kimi가 폭넓은 탐색을 수행했고 Claude가 최종 판단을 내렸다. 중국 모델이 미국 모델을 단순히 대체한 것이 아니다. 두 시스템은 서로 다른 역할을 수행했고, 그 차이에서 이점을 얻었다.
이 아키텍처는 기존 조달 규칙을 복잡하게 만든다. 기업은 그 어떤 모델도 고객에게 직접 제공하지 않은 채 수십 개 모델을 사용할 수 있다. 일부는 호스팅 인터페이스를 통해 실행되고, 다른 일부는 격리된 클라우드 환경에서 운영된다. 이러한 방식에 따라 위험은 크게 달라진다.
의원들은 이미 중국에서 개발된 AI에 대한 더 광범위한 조사를 시작했다. 4월, House Homeland Security Committee Chairman Andrew Garbarino와 House Select Committee on China Chairman John Moolenaar는 이러한 모델과 연관된 국가 안보 위험에 대한 공동 조사를 발표했다.
초기 서한은 Cursor 개발사인 Anysphere와 Airbnb에 초점을 맞췄다. 공식 하원 조사에 따르면 Cursor의 Composer 2는 오픈 웨이트 Moonshot 모델을 사용해 구축된 것으로 전해졌다. 또한 Airbnb가 고객 서비스 업무에 Alibaba의 Qwen을 사용했다는 보도에 대해서도 의문을 제기했다.
위원회들은 이 사안을 단순한 상업 경쟁 이상으로 규정했다. 데이터 노출, 안전 통제, 정치적 검열, 그리고 중국 기업이 개발한 모델에 대한 장기적 의존에 관한 우려를 제기했다.
DoorDash는 이제 이 기존 패턴에 들어맞는다. 그 실험은 중국 모델이 미국 기업의 개발 파이프라인에서 의미 있는 역할을 맡을 수 있다는 이례적으로 구체적인 증거를 제공한다. 이는 논쟁 양측 모두에 유용한 사례가 된다.
모델 다양성 지지자들은 측정 가능한 개선을 지적할 수 있다. 보안 옹호자들은 더 나은 벤치마크 점수가 기업들로 하여금 거버넌스 절차보다 빠르게 움직이도록 부추겼는지 물을 수 있다. 미국 AI 연구소들은 해외 경쟁사들이 미국에서 자금을 지원받은 연구와 인프라의 혜택을 얻고 있다고 주장할 수 있다.
압박은 클라우드 제공업체와 모델 마켓플레이스에도 미친다. 기업은 Moonshot의 호스팅 서비스뿐 아니라 여러 중개업체를 통해 Kimi를 확보할 수 있다. 이들 중개업체는 미국 내 데이터 레지던시, 로깅 통제, 접근 정책 및 계약상 보호 조치를 제공할 수 있다.
그러나 인프라의 위치가 모든 우려에 답하는 것은 아니다. 내려받을 수 있는 웨이트에는 조달 문서만으로 식별하기 어려운 행동 특성이 포함될 수 있다. 모델은 정치적 편향을 재현하거나, 유해한 지시를 지나치게 쉽게 따르거나, 민감한 시스템에 통합될 때 새로운 공급망 문제를 만들 수 있다.
따라서 정책 과제는 세분화돼 있다. 중국 호스팅 API, 미국 클라우드 계정에서 실행되는 오픈 모델, 완전히 격리된 배포는 동등하지 않다. 이러한 차이를 무시하는 규칙은 안전하지 않은 배포를 막지 못한 채 더 안전한 배포를 위축시킬 위험이 있다.
진짜 갈등은 성능 대 출처다
DoorDash는 측정된 성능을 기준으로 모델을 선택한 반면, 의원들은 모델 출처가 기업이 최적화할 수 있는 범위를 제한해야 하는지 묻고 있다.
출처는 모델이 어디서 왔는지, 누가 학습시켰는지, 어떤 데이터가 영향을 미쳤는지, 누가 이를 업데이트하거나 운영할 수 있는지를 포괄한다. 성능은 정의된 테스트에서 모델이 무엇을 수행하는지를 설명한다. 엔터프라이즈 구매자는 점점 두 가지 평가를 모두 필요로 하지만, 둘은 서로 다른 선택을 가리킬 수 있다.
DashBench는 모델 조합이 알려진 결함을 찾아내는지를 측정했다. 또한 심각도, 정밀도, 재현율 및 운영 리소스도 고려했다. 코드 리뷰 품질은 DoorDash 자체 리포지토리와 개발 패턴에 좌우되므로, 이는 일반 리더보드에 의존하는 것보다 더 많은 정보를 제공한다.
이 벤치마크는 애플리케이션별 테스트가 중요한 이유를 보여줬다. GPT 기반 조합은 높은 정밀도를 냈지만 많은 알려진 결과를 놓쳤다. Claude 조합은 더 폭넓은 범위를 달성했다. Kimi는 엄격한 Claude 리뷰어와 결합됐을 때 스카우트 역할에서 재현율을 높였다.
이는 Kimi K2.6가 전반적으로 가장 뛰어난 코딩 모델이라는 사실을 입증하지 않는다. 해당 모델이 하나의 벤치마크와 하나의 오케스트레이션 설계 안에서 한 가지 역할을 효과적으로 수행했음을 보여줄 뿐이다.
Moonshot은 Kimi K2.6를 코딩 및 장시간 에이전트 작업을 위한 멀티모달 오픈 웨이트 모델로 설명한다. 멀티모달은 일반 텍스트 이상을 처리할 수 있음을 의미하며, 에이전트 작업은 여러 단계에 걸쳐 반복적인 의사결정과 도구 사용을 요구한다.
공식 Kimi 모델 카드에 따르면 이 모델은 웨이트의 수치 정밀도를 낮추는 기술인 네이티브 INT4 양자화를 지원한다. 이는 배포에 필요한 메모리를 줄일 수 있다. Moonshot은 vLLM, SGLang 및 KTransformers도 지원되는 추론 엔진으로 열거한다.
이러한 배포 옵션은 Kimi의 상업적 매력을 설명하는 데 도움이 된다. 기업은 호환 가능한 인터페이스로 모델을 테스트하고, 제3자를 통해 웨이트를 배포하거나, 통제된 인프라에서 직접 운영할 수 있다. 이러한 유연성은 폐쇄형 모델 제공업체가 항상 제공하지는 않는 협상력을 구매자에게 부여한다.
오픈 웨이트는 Kimi 사용이 자동으로 정보를 중국에 전송한다는 주장도 복잡하게 만든다. DoorDash가 격리된 환경에서 모델을 운영했다면 Moonshot은 프롬프트나 코드를 전혀 받지 않았을 수 있다. Moonshot의 API를 직접 사용했다면 데이터 흐름은 다른 위험 프로필을 제시했을 것이다.
실제 구성을 명확히 할 수 있는 곳은 DoorDash뿐이다. 모델 제공업체, 호스팅 리전, 보존 설정, 네트워크 통제, 프롬프트 내용 및 직원 접근 권한을 식별해야 한다. 의원들도 같은 세부 사항을 요구할 가능성이 크다.
상업적 유인은 Kimi에 유리하게 움직이고 있다. 7월 기업 도입 분석은 기업들이 비용, 성능, 그리고 오픈 웨이트 접근성 때문에 중국 모델을 실험하고 있다고 보도했다.
이 보도는 Cursor의 Kimi 활용, Airbnb의 Qwen 실험, Siemens의 여러 국가 모델 테스트를 언급했다. 또한 미국 스타트업들이 한 제공업체를 완전히 대체하는 대신, 서로 다른 모델 계열에 각기 다른 업무를 배정하고 있다고 설명했다.
이러한 패턴은 단순한 ‘중국 대 미국’ 구매 구도를 약화시킨다. 기업 시스템은 점점 더 여러 개발사의 모델을 결합하고 있다. 경쟁의 단위는 라우팅 규칙, 평가 데이터, 보안 경계, 인간 검토를 포함한 워크플로가 되고 있다.
그렇다고 그 워크플로 안에서 출처 문제가 사라지는 것은 아니다. 저비용 모델도 여전히 법률적, 보안적, 평판상 위험을 초래할 수 있다. 기업은 거버넌스, 모니터링, 배포 통제를 더한 뒤에도 벤치마크 우위가 유지되는지 판단해야 한다.
미국 모델 개발사들 역시 압박에 직면해 있다. 오픈 중국 모델이 고처리량 업무에서 좋은 성과를 낸다면, 프리미엄 제공업체는 더 나은 신뢰성, 보안 근거, 도구 통합 또는 가장 어려운 과제에서의 성능으로 자신의 입지를 정당화해야 한다.
DoorDash의 아키텍처는 이미 이러한 시장 분화를 반영한다. 이 회사는 광범위한 검색에는 Kimi를, 검증에는 Claude를 사용했다. 이 구성은 Anthropic의 역할을 유지하면서도 전면적인 Claude 파이프라인 의존도를 낮췄다.
의회 조사는 이러한 분업을 강화할 수 있다. 기업들은 민감한 의사결정에는 미국의 폐쇄형 모델을 남겨두고, 더 광범위한 처리에는 격리된 오픈 모델을 사용할 수 있다. 또한 해외에서 개발된 모델이 독점 정보에 접근하도록 허용하기 전에 더 강력한 감사 근거를 요구할 수도 있다.
보안 문제는 벤치마크만으로 답할 수 없다
DashBench는 Kimi가 소프트웨어 결함을 찾아냈는지를 측정했다. 이 벤치마크는 해당 모델이 국가안보, 개인정보 보호 또는 공급망 요건을 충족하는지는 판단하지 않았다.
이 한계가 벤치마크의 가치를 떨어뜨리는 것은 아니다. DoorDash가 이를 다른 질문을 위해 설계했다는 뜻이다. 엔지니어링 품질과 배포 위험에는 별도의 평가가 필요하다.
안전한 검토는 데이터 흐름부터 시작한다. 조사관들은 DoorDash가 소스 코드, 개발자 의견, 저장소 메타데이터, 자격 증명 또는 운영 정보를 통제된 환경 밖으로 전송했는지 알아야 한다. 또한 제공업체가 무엇을 보관했는지, 그리고 사람이 입력값을 검토할 수 있었는지도 파악해야 한다.
다음 질문은 모델 무결성에 관한 것이다. 오픈 웨이트는 검사하고 테스트할 수 있지만, 규모가 커서 완전한 분석은 현실적으로 어렵다. 기업에는 재현 가능한 해시, 통제된 모델 레지스트리, 취약점 모니터링, 향후 버전을 위한 승인 절차가 필요하다.
Kimi K2.6은 더 이상 Moonshot의 최신 모델이 아니다. 이는 또 다른 거버넌스 문제를 만든다. 팀은 승인이 하나의 고정된 아티팩트에 적용되는지, 아니면 전체 제품군에 적용되는지 결정해야 한다. 업데이트를 자동으로 수용하면 최초 배포를 정당화했던 테스트를 우회할 수 있다.
안전성 근거 역시 아직 불완전하다. 이전 모델인 Kimi K2.5에 대한 독립 평가는 여러 이중용도 영역에서 선도적인 폐쇄형 시스템과 비슷한 역량을 확인했다. 이중용도 역량은 정당한 업무를 지원할 수도 있고 유해한 활동에 활용될 수도 있다.
예비 안전성 평가는 특정 화학, 생물, 방사능, 핵 및 폭발물 관련 요청에서 거부 응답이 더 적었다고 보고했다. 또한 일부 맥락에서 정치적 편향과, 선택된 유해 지침에 대한 더 높은 순응도를 발견했다.
이러한 결과는 K2.6이 아니라 K2.5에 관한 것이다. 이를 최신 모델에 자동으로 적용할 수는 없다. 다만 고급 코딩 및 도구 사용 능력을 갖춘 오픈 웨이트 모델을 둘러싼 논쟁이 왜 성능 테스트만으로 해결될 수 없는지를 보여준다.
Moonshot은 모든 출시 때마다 미국 기업 구매자들이 점점 더 기대하는 수준의 포괄적인 안전성 문서를 제공하지는 않았다. 독립 연구자들이 그 공백을 일부 메울 수 있지만, 이들의 테스트는 종종 배포가 시작된 뒤에야 나온다.
입법자들은 모델 증류와 관련한 또 다른 우려를 제기했다. 증류는 한 시스템의 출력을 사용해 다른 시스템을 훈련함으로써, 더 작거나 새로운 모델이 선택된 역량을 모방할 수 있게 하는 방식이다. 이 기술은 일반적이지만, 제공업체는 서비스 약관을 통해 특정 형태를 금지할 수 있다.
Anthropic은 Moonshot, DeepSeek, MiniMax가 사기 계정을 이용한 조직적인 증류 캠페인을 수행했다고 비난했다. Moonshot의 공개 입장은 중국 연구소들이 미국의 역량을 부적절하게 복제했다는 주장을 반박한다. 이러한 주장은 더 광범위한 정치적·상업적 갈등의 일부로 남아 있다.
DoorDash의 Kimi 사용은 Moonshot이 이를 어떻게 훈련했는지에 대해 아무것도 입증하지 않는다. 그럼에도 입법자들은 중국 모델에 미국 내 유통과 정당성을 부여하는 제품을 보유한 기업에 압력을 가하기 위해 조달 관련 조사를 활용할 수 있다.
검열에 대한 우려도 있다. 중국 규제 환경에서 훈련된 모델은 정치적으로 민감한 주제를 회피하거나 왜곡할 수 있다. 이 문제는 연구, 커뮤니케이션, 고객 대면 배포에서 매우 중요하다.
정치적 행동이 과제에 영향을 미치지 않는다면, 모델이 코드에서 결함을 찾는 경우에는 직접적인 관련성이 더 낮다. 위험 평가는 알려진 모든 한계가 모든 배포에 똑같이 적용된다고 가정하기보다 실제 사용 사례를 고려해야 한다.
가장 강한 회의적 해석은 기업들이 간접 노출을 과소평가할 수 있다는 것이다. 코드 검토 프롬프트에 고객 기록이 없더라도 독점 로직이 포함될 수 있다. 저장소 구조는 계획 중인 제품, 내부 시스템 또는 보안 통제를 드러낼 수 있다.
가장 강한 반론은 자체 호스팅한 오픈 웨이트가 폐쇄형 미국 API보다 더 큰 데이터 통제력을 제공할 수 있다는 점이다. 기업은 외부 네트워크 접근을 차단하고, 자체 로그를 보관하며, 서빙 스택을 검사하고, 승인된 모델 버전을 고정할 수 있다.
두 입장은 모두 사실일 수 있다. 오픈 배포는 제공업체의 접근을 줄이는 동시에 운영자에게 더 큰 책임을 부여할 수 있다. 핵심 질문은 오픈 모델이 본질적으로 안전한지 여부가 아니다. DoorDash가 모델이 처리한 정보에 비례하는 통제를 구축했는지 여부다.
워싱턴의 기존 AI 전략이 실질적 시험대에 올랐다
이번 조사는 중국 모델이 미국 기업 내부에서 좋은 성과를 낼 때 미국 정책이 기술적 위험과 경제 경쟁을 구분하는지 보여줄 것이다.
미국의 규제는 중국의 첨단 칩, 제조 도구, 투자, 민감 기술 접근을 제한하는 데 집중해 왔다. 오픈 웨이트 모델은 공개 후 소프트웨어가 전 세계로 확산될 수 있기 때문에 이 전략에 도전한다.
웨이트를 다운로드할 수 있게 되면 직접적인 상업 접근을 금지해도 기존 사본이 사라지지는 않는다. 개발자는 국내 인프라에서 이를 실행하거나, 수정하거나, 모델 마켓플레이스에서 확보할 수 있다.
하원 위원회들은 중국 모델이 미국 기업과 인프라 전반에 의존성을 만든다고 주장해 왔다. 이들의 4월 성명은 중국에서 개발된 시스템이 처리하는 워크로드의 글로벌 비중이 증가했다는 보도를 인용했다. 특히 모델 트래픽은 빠르게 변하기 때문에, 그 기초 추정치와 정의는 면밀히 검토할 필요가 있다.
그럼에도 방향성은 분명하다. 중국 모델은 경쟁력 있는 역량과 유연한 배포 방식을 결합해 사용자를 확보했다. Associated Press 분석에 따르면, 최근 한 달간 OpenRouter에서 추적된 가장 인기 있는 모델 5개는 모두 중국 모델이었다.
같은 보도는 에이전트 사용이 증가하면서 중국 모델이 광범위한 도입에 가까워지고 있다고 전했다. 에이전트는 긴 연속의 모델 호출을 생성하므로, 작은 효율성 차이도 계획 수립, 도구 사용, 재시도, 검증 전반에서 누적된다.
DoorDash의 단계적 리뷰어는 그 메커니즘을 보여준다. 스카우트가 많은 잠재적 이슈를 찾은 뒤 리뷰어가 이를 평가한다. 처리량이 높은 첫 단계에서는 운영 효율성이 특히 중요해진다.
광범위한 규제는 빠르게 성장하는 경쟁자로부터 미국 제공업체를 보호할 수 있다. 그러나 중국 기업에 데이터를 전송하지 않고 오픈 모델을 사용하는 스타트업과 기업의 비용을 늘릴 수도 있다.
대신 좁은 범위의 규정은 민감 분야, 호스팅 데이터 흐름, 정부 시스템 또는 핵심 인프라와 관련된 배포에 초점을 맞출 수 있다. 이 접근 방식은 규제기관과 조달팀에 더 많은 기술 전문성을 요구한다.
정부는 금지보다 공개를 요구할 수도 있다. 기업은 모델 출처, 호스팅 위치, 데이터 보존, 벤치마크 결과, 안전성 테스트, 접근 통제를 문서화할 수 있다. 이는 모든 실험을 위반으로 취급하지 않으면서 감사 가능한 기록을 만들 수 있다.
하지만 공개에는 한계가 있다. 해당 정보가 상업 전략과 보안 통제를 노출할 수 있기 때문에, 기업들은 모델 선택이나 시스템 아키텍처 공개를 꺼릴 수 있다. 소규모 기업은 모든 모델 업데이트에 대해 광범위한 평가를 완료할 인력이 부족할 수 있다.
미국 연구소들도 더 강력한 제한에 대한 정책적 이해관계를 갖고 있다. 이들은 훈련, 보안 테스트, 인프라에 막대한 투자를 한 뒤 더 낮은 운영 비용으로 배포되는 오픈 모델과 경쟁한다. 이들의 우려는 안전성뿐 아니라 지식재산권도 포함한다.
구매자들의 이해관계는 다르다. 이들은 제공업체 간 경쟁과 과제에 가장 적합한 시스템으로 업무를 라우팅할 수 있는 능력을 원한다. 모델 선택을 제한하면 소수의 미국 공급업체에 더 의존하게 될 수 있다.
따라서 Google News 보도는 어려운 규제 선택을 가리킨다. 워싱턴은 Kimi 도입을 주로 보안 문제, 지식재산권 문제 또는 산업 정책 문제로 볼 수 있다. 각 관점은 서로 다른 해결책을 뒷받침한다.
DoorDash는 회사가 왜 해당 모델을 선택했는지에 대한 근거를 공개 벤치마크로 제시했기 때문에 유난히 유용한 사례가 되었다. 이 결정은 막연한 열정에 기반한 것이 아니었다. 미국 대안들과의 측정된 비교를 따른 결과였다.
입법자들이 이 근거를 인정하면서 더 강력한 배포 통제를 요구한다면, 이번 조사는 기업 거버넌스를 개선할 수 있다. 반대로 벤치마크 성공 자체를 의심스럽게 취급한다면, 기업들은 기저의 실험을 멈추지 않은 채 평가 결과 공개를 중단할 수 있다.
그 결과는 투명성을 낮출 것이다. 엔지니어링 팀은 어떤 모델을 테스트하는지, 그러한 시스템의 성능은 어떤지, 그리고 통제가 어디에서 실패하는지를 공개할 유인이 줄어들 것이다.
DoorDash 조사 이후 주목할 점
이 사안이 좁은 범위의 보안 검토에 그칠지, 아니면 미국 기업 내 중국 AI에 대한 더 광범위한 장벽으로 이어질지를 세 가지 신호가 결정할 것이다.
첫 번째 신호는 DoorDash의 배포 공개다. 회사가 민감한 아키텍처를 공개할 필요는 없지만, Kimi가 Moonshot, 제3자 제공업체 또는 격리된 인프라를 통해 실행됐는지는 명확히 할 수 있다.
또한 처리된 정보의 범주, 보존 정책, 네트워크 제한, 그리고 실험에 운영 저장소가 포함됐는지를 설명할 수 있다. 격리의 증거는 모델 사용이 자동으로 중국 제공업체에 정보를 노출했다는 주장을 약화시킬 것이다.
직접적인 외부 전송의 증거는 더 엄격한 통제의 근거를 강화할 것이다. 핵심 구분은 단순히 개발사가 어느 국가에 법인화됐는지가 아니라, 모델이 어디에서 실행됐고 누가 입력값에 접근할 수 있었는지다.
두 번째 신호는 의회 요청의 범위다. 좁게 작성된 조사는 계약, 호스팅, 데이터 이동, 모델 테스트, 위험 통제에 초점을 맞출 것이다. 이는 입법자들이 특정 배포에 관한 사실을 원한다는 신호일 것이다.
중국에서 개발된 모든 모델을 포괄하는 더 광범위한 요구는 출처 기반 규제로의 전환을 시사할 것이다. 이러한 접근은 Cursor, Airbnb, Siemens뿐 아니라 오픈 시스템을 테스트하는 많은 소규모 기업에도 영향을 미칠 수 있다.
의원들이 자발적 브리핑을 요구하는지, 보고 요건을 제안하는지, 또는 구속력 있는 제한을 마련하는지 주시해야 한다. 이러한 조치는 기업 구매자에게 매우 다른 함의를 지닌다.
세 번째 신호는 미국 공급업체들의 대응 방식이다. Anthropic, OpenAI, Google은 가격, 배포 유연성, 안전성 문서, 또는 대규모 작업용 특화 모델을 통해 경쟁할 수 있다.
이들은 해외 시스템에 대한 제한을 지지할 수도 있다. 정책이 주된 대응 수단이 된다면, 구매자들은 이 논쟁을 중립적인 보안 개입이 아니라 국내 공급업체 보호로 받아들일 수 있다.
DoorDash의 다음 벤치마크 역시 중요한 단서가 될 것이다. 회사가 통제 체계를 검토한 뒤에도 Kimi를 유지한다면, 성능 우위가 거버넌스 검토를 통과했을 가능성이 크다. 모델을 제거한다면, 관측자들은 기술적 위험, 정치적 압력, 또는 더 새로운 대안 중 무엇이 그 결정을 이끌었는지 판단해야 한다.
더 큰 교훈은 모델 선택이 이제 이사회 차원의 위험 결정이 되었다는 점이다. 엔지니어링 팀에는 여전히 벤치마크가 필요하지만, 이러한 테스트는 데이터 분류, 위협 모델링, 법률 검토, 공급업체 평가와 함께 이뤄져야 한다.
독자들은 Google News 헤드라인도 신중하게 받아들여야 한다. 보도된 조사는 감시와 검토가 이뤄지고 있음을 보여줄 뿐, 침해 사실이 확인됐다는 의미는 아니다. 현재 공개된 증거에 따르면 DoorDash는 코드 검토에서 Kimi를 테스트했으며, 내부적으로 강력한 결과를 보고했다.
헤드라인만으로는 알 수 없는 부분이 더 중요하다. 모델은 어디에서 실행됐고, 어떤 정보가 입력됐으며, 어떤 통제가 이를 둘러싸고 있었고, 의회는 어떤 대응을 비례적이라고 판단할 것인가?
향후 1~3개월 안에 이러한 답이 나올 가능성이 크다. DoorDash의 공개 내용, 위원회의 서면 요청, 그리고 제안될 수 있는 조달 규정을 지켜보라. 이를 종합하면 혼합 모델 시스템이 계속 엔지니어링상의 선택으로 남을지, 아니면 미중 기술 정책의 새로운 전선이 될지를 보여줄 것이다.