top of page

GSA LLM 최종 규정, 적용 범위는 좁혔지만 AI 계약업체의 책임은 유지

5일 전
12분 분량

GSA LLM 최종 규정은 적용 범위가 축소됐지만, 적용 대상 연방 AI 계약업체에는 여전히 상당한 준수 의무를 부과하며 2026년 10월 19일부터 시행된다.

미 연방조달청(General Services Administration, GSA)은 이제 대규모 언어 모델 기능이 핵심 요소이고 정부 데이터가 모델에 직접 입력되거나 모델에서 직접 산출되는 시스템을 대상으로 삼는다. 내부 백오피스 도구와 부수적인 AI 기능은 해당 조항의 적용 대상에서 제외될 수 있다.

이 변화는 초기 초안에 대해 기술 업계가 제기한 가장 강력한 반대 의견 일부에 답한 것이다. 그러나 최종 문구는 여전히 상충하는 상용 계약을 우선하며, 관련 하도급업체에도 적용되고, 데이터 보안·문서화·사고 보고·모델 변경·계약 종료에 관한 상세한 규칙을 부과한다.

이는 광범위한 후퇴가 아니라 절충안이다. GSA는 일반 소프트웨어가 AI 특화 계약 체계에 포섭될 가능성을 줄였다. 다만 실제 LLM 제품을 정부에 판매하는 공급업체는 다수의 상용 배포 환경에서는 요구되지 않는 수준의 운영 가시성을 계속 제공해야 한다.

GSA LLM 최종 규정은 두 단계 적용 범위 테스트를 사용한다

최종 조항은 단순히 LLM을 사용하는 모든 계약업체 시스템이 아니라, 정부가 의도적으로 구매하는 AI 시스템에 초점을 맞춘다.

GSA는 연방조달규정(General Services Acquisition Regulation) 클래스 예외를 통해 조항 552.239-7001, 대규모 언어 모델 인공지능 시스템 내 데이터의 기본 보호(Basic Safeguarding of Data within Large Language Model Artificial Intelligence Systems)를 발행했다. 클래스 예외는 일반적인 법전화 절차가 완료되기 전에 기관이 조달 문구를 적용할 수 있도록 한다.

이 변경 사항은 GSA가 9월에 업데이트한 최종 조항에 담겼다. 이 업데이트는 기관 조달 규정을 대폭 개편하는 RGO-2026-01의 일부다.

이 조항은 두 가지 조건이 충족될 때 적용된다. 첫째, GSA가 LLM, 생성형 어시스턴트, 챗봇, 에이전트형 시스템, LLM 기반 생산성 도구 또는 LLM 기능이 핵심인 유사 제품을 조달해야 한다.

둘째, 정부 데이터가 LLM에 직접 제출되거나 LLM에 의해 생성되어야 한다. 이 두 번째 조건은 계약업체의 기술 스택 어딘가에 AI가 존재한다는 사실만으로 준수 부담을 부과하는 대신, 실제 모델 상호작용에 부담을 연계한다.

이는 6월 제안보다 상당히 좁은 범위다. 제안 문구는 일반적으로 정부 데이터가 LLM에 의해 처리되는 경우 적용됐으며, 이는 지원 시스템과 부수적 사용까지 포착할 수 있는 표현이었다.

최종 조항에는 자동 소멸 문구도 포함됐다. 계약 담당관이 달리 명시하지 않는 한, 정부가 접근하지 않는 내부 업무·백오피스·운영·성과 지원 시스템 안에서 LLM 사용이 이뤄질 경우에는 어떠한 의무도 부과하지 않는다.

두 번째 제외 조항은 LLM 기능이 부수적이거나 보조적인 상용 제품을 다룬다. AI가 제품의 주된 목적, 계약 요구 사항, 정부가 접근하는 기능 또는 정부 데이터 처리 수단이 아닌 경우 이 제외 조항이 적용된다.

이러한 구분은 다른 서비스를 제공하면서 생성형 AI를 사용하는 계약업체에 중요하다. 예를 들어 컨설팅 회사는 해당 어시스턴트를 GSA에 판매하지 않고도 업무 정리를 돕기 위해 내부 어시스턴트를 사용할 수 있다. 일반 소프트웨어 제품에도 기관이 전혀 활성화하지 않는 선택형 AI 기능이 포함될 수 있다.

이제 이런 상황에는 제외를 주장할 근거가 더 강해졌다. 하지만 최종 조항이 모든 내부 AI 워크플로를 보이지 않게 만드는 것은 아니다. 계약업체는 정부 데이터가 구매되었거나 접근 가능하거나 계약상 요구되는 LLM 기능에 입력되는지 계속 판단해야 한다.

정부 데이터의 정의도 더 정밀해졌다. 적용 대상 데이터 입력은 단순히 정부를 위해 생성된 데이터가 아니라 정부 또는 정부를 대신해 제출된 데이터다. 메타데이터와 로그는 적용 대상 데이터 출력에서 제외된다.

이 조정은 조항이 통제하는 정보의 범위를 제한한다. 그러나 프롬프트, 검색된 콘텐츠, 생성 응답, 임베딩, 파인튜닝 자료는 여전히 적용 대상 경계를 넘을 수 있으므로 데이터 매핑의 필요성을 없애지는 않는다.

따라서 제외 조항은 포괄적 면제라기보다 분류 규칙에 가깝게 작동한다. 공급업체는 정부가 무엇을 구매하는지, 어떤 기능에 접근하는지, 데이터가 어디로 이동하는지, LLM이 제공 서비스에 실질적으로 기여하는지를 보여 주는 근거를 갖춰야 한다.

공식 문구는 해석상 문제도 만든다. 자동 소멸 문단은 백오피스 제외와 부수 기능 제외를 “and” 또는 “or”로 명확히 연결하지 않은 채 나열한다.

이 작성 방식은 어느 한 조건만으로도 조항이 제외되는지, 아니면 두 조건이 모두 충족되어야 하는지를 불확실하게 만든다. 계약 담당관은 입찰 또는 협상 과정에서 답을 명확히 해야 할 수 있다.

실무적 교훈은 간단하다. 계약업체는 AI 기능이 존재한다는 이유만으로 적용 대상이라고 가정해서는 안 된다. 또한 기능을 부수적이라고 부르는 것만으로 문제가 해결된다고 가정해서도 안 된다.

제품 라벨보다 업무 명세서, 제품 설명, 시스템 아키텍처, 실제 데이터 흐름이 더 큰 비중을 갖는다. 이것이 GSA LLM 최종 규정이 도입한 첫 번째 주요 변화다.

NIST 프레임워크가 네 가지 경직된 공급망 역할을 대체한다

GSA는 고정된 공급업체 명칭에서 수명주기 업무로 전환했지만, 주계약업체는 모든 적용 대상 참여자를 식별할 책임을 계속 진다.

6월 제안은 LLM 공급망을 개발자, 시스템 운영자, 시스템 통합업체, 서비스 제공업체라는 네 가지 정의된 역할로 나눴다. 각 역할에는 연계 조항과 정해진 플로우다운 의무가 부여됐다.

플로우다운이란 주계약업체가 관련 정부 요구 사항을 하도급업체와의 계약에 포함해야 함을 뜻한다. 다른 기업이 실제로 기술이나 데이터를 처리하는 경우, 의무가 첫 번째 계약 계층에서 멈추지 않도록 하는 장치다.

최종 조항은 이 네 가지 공식 범주를 미국 국립표준기술연구소(National Institute of Standards and Technology)가 발행한 AI 위험 프레임워크의 업무 설명으로 대체한다.

참조된 업무는 AI 설계, AI 개발, AI 배포, 운영 및 모니터링을 포괄한다. 시스템 요구 사항 정의, 모델 구축, 구성 요소 통합, 시스템의 프로덕션 배치, 출시 후 출력 평가 등의 작업이 이에 포함된다.

이 접근법은 현대 AI 제품이 조립되는 방식을 더 잘 반영한다. 한 회사가 모델을 호스팅하고, 다른 회사가 검색 인프라를 제공하며, 세 번째 회사가 시스템을 정부 워크플로에 연결할 수 있다.

전통적인 역할 명칭은 이런 중첩된 책임을 가릴 수 있다. 업무 기반 테스트는 각 참여자가 실제로 무엇을 수행하는지와 그 과정에서 정부 데이터를 처리하는지를 묻는다.

주계약업체는 하도급업체가 정부 데이터를 수집, 처리, 저장, 보존, 학습, 파인튜닝하거나 그 밖의 방식으로 취급할 때 해당 업무를 수행하는 하도급업체에 적용 가능한 요구 사항을 플로우다운해야 한다.

이 문구는 모델 개발업체보다 더 넓은 범위에 미친다. 클라우드 제공업체, 호스팅 기업, 시스템 통합업체, 검색 공급업체, 평가 서비스, 관리형 운영 파트너 모두 준수 체계에 포함될 수 있다.

이 조항은 해당 하도급업체를 선정하고 감독할 때 최선의 노력을 요구한다. 계약업체는 확인서, 독립적으로 검증 가능한 증거, 모델 카드, 시스템 카드, 보안 문서, 감사 자료, 관련 인증에 의존할 수 있다.

기존 산출물은 합리적으로 준수를 입증하는 경우 요구 사항을 충족할 수 있다. 계약업체는 조항 준수만을 위해 중복 기록을 만들 필요가 없다.

하지만 주계약업체는 여전히 그러한 산출물을 적용 대상 시스템과 연결해야 한다. 일반적인 보안 인증만으로는 공급업체가 정부 프롬프트로 학습하는지, 생성 출력을 보존하는지, 요구된 삭제를 지원하는지를 자동으로 설명하지 못한다.

최종 문구는 완전 개방형 모델과 오픈 소스 LLM 구성 요소를 특별 취급한다. 계약업체는 해당 구성 요소에 대해 출처, 소유권, 관할권 또는 외국 통제에 관한 조항을 플로우다운할 필요가 없다.

GSA는 마케팅에서 흔히 쓰이는 느슨한 “오픈 소스 AI” 표현보다 더 엄격하게 완전 개방형 모델을 정의한다. 아키텍처, 가중치, 관련 코드, 학습·검증·테스트 데이터 세트는 적절한 라이선스 아래 공개적으로 검토 가능해야 한다.

오픈 웨이트 모델은 단지 파라미터를 다운로드할 수 있다는 이유만으로 같은 분류를 받지 않는다. 해당 코드와 데이터가 계속 비공개라면 GSA는 이 시스템을 완전 개방형 모델과 다르게 취급한다.

이 구분은 실사에 영향을 미친다. 개방형 구성 요소는 공개된 가중치, 기술 보고서, 모델 문서, 학습 데이터 공개 자료를 통해 문서화할 수 있다. 별도의 계약별 확인서가 항상 필요한 것은 아니다.

오픈 웨이트 모델도 문서화된 최선의 노력 검토가 필요하다. 계약업체는 모델 문서, 테스트, 기술 보고서, 계약 이행에서의 역할을 고려해야 한다.

NIST 구조는 계약업체에 6월 분류 체계보다 더 많은 유연성을 제공한다. 동시에 정확한 공급망 지도를 유지해야 한다는 압박을 더 크게 만든다.

주요 공급업체는 각 회사에 하나의 라벨만 붙이고 넘어갈 수 없다. 각 당사자가 어떤 수명주기 업무를 수행하는지, 어떤 정부 데이터를 취급하는지, 조항의 어느 문단이 적용되는지를 이해해야 한다.

상용 AI 서비스가 하위 처리업체, 호스팅 위치 또는 모델 계열을 변경할 때 이 작업은 복잡해질 수 있다. 계약팀은 이행 기간 내내 일관성을 유지하는 엔지니어링 및 조달 기록을 필요로 한다.

따라서 최종 조항은 경직된 분류를 지속적인 사실 분석으로 교환한다. 구조는 더 적응적이지만 복잡한 배포 환경에서는 반드시 더 가벼운 것은 아니다.

확대된 IP 보호도 모든 상용 계약 조건을 보존하지는 않는다

계약업체는 기존 기술에 대한 더 강한 권리를 유지하지만, 정부는 상충하는 공급업체 계약보다 자사 조항을 여전히 우선 적용한다.

지식재산권은 GSA 초기 접근법에서 가장 논쟁적인 부분 중 하나였다. 3월 초안에는 광범위한 정부 라이선스와 재사용 가능한 상용 기술에 의존하는 공급업체를 우려하게 한 제한 사항이 포함됐다.

6월 버전은 이 구조를 변경했지만 업계의 우려는 계속됐다. 최종 조항은 이제 계약 이전에 만들어졌거나 더 넓은 상업적 용도로 독립적으로 개발된 자료에 대해 더 명시적인 보호를 추가한다.

정부는 계약업체의 기존 상용 제품, 독점 기술 또는 여러 고객에게 사용되는 자료의 소유권을 취득하지 않는다. 이 확인은 소프트웨어, 구성, 워크플로, 문서, 모델, 스크립트, 기술적 방법 및 노하우를 포괄한다.

또한 서비스 생성 정보, 분석 자료, 지식 기반 콘텐츠 및 관련 자료가 기존 또는 독립 개발된 상용 자산의 요건을 충족할 경우 이를 보호한다.

이 보호는 AI 계약의 핵심 특성을 인정한다. 공급업체는 한 정부 고객만을 위해 완전한 모델과 지원 플랫폼을 구축하는 경우가 드물다. 이들은 공통 인프라, 워크플로, 평가, 기술 구성 요소를 여러 배포 환경에 맞게 조정한다.

최종 문구는 정부 데이터에서 파생된 개선 사항의 양도 범위도 좁힌다. 일반적인 역량 향상은 적용 대상 정부 정보를 포함, 노출, 공개 또는 그로부터 파생하지 않는 한 계약업체에 귀속된다.

이 예외 조항은 통상적인 플랫폼 개선이 자동으로 정부 소유가 되는 위험을 줄인다. 공급업체는 연방 계약 수행 중 학습이 이루어졌다는 이유만으로 해당 작업을 포기하지 않고도 일반적인 일정 관리 방식을 개선하거나 시스템 신뢰성을 높일 수 있다.

개선 사항이 정부 데이터에 직접 의존할 때는 경계가 더 모호해진다. 파인튜닝, 검색 인덱스, 특화된 평가 세트 또는 도메인별 워크플로는 재사용 가능한 엔지니어링과 고객 유래 정보를 결합할 수 있다.

계약업체는 분쟁이 발생하기 전에 이 구분을 문서화해야 한다. 분리된 리포지터리, 데이터 계보 기록, 모델 인벤토리, 변경 이력은 개선 사항이 일반화된 것인지 정부 특화적인 것인지를 보여줄 수 있다.

이 조항은 배경 데이터의 개념도 확장한다. 계약업체는 LLM 개발 또는 개선에 사용된 자료를 포함해 자신이 소유, 통제 또는 라이선스한 적격 정보에 대한 소유권을 유지할 수 있다.

기존 문구는 원래 형태의 배경 데이터를 언급했다. 이 제한을 없애면 계약 수행 중 적격 자료가 수정되거나 향상된 경우에도 계약업체의 지속적인 소유권이 뒷받침된다.

그럼에도 IP 개선 조항이 모든 표준 상업 조건을 보존하는 것은 아니다. 최종 조항은 기존 Federal Acquisition Regulation 및 GSAR 조건을 보완한다고 명시하면서도, 상충하는 상업 계약보다 우선한다고 규정한다.

이 규칙은 일반적인 클라우드 및 AI 계약과 충돌할 수 있다. 표준 공급업체 약관은 감사 접근을 제한하거나, 일방적인 모델 변경 권한을 설정하거나, 고객 상호작용을 활용한 서비스 개선을 허용하거나, 광범위한 보존 관행을 정의하는 경우가 많다.

GSA 조항이 달리 규정하는 경우 연방 계약은 이러한 기본 조건에 안전하게 의존할 수 없다. 주계약업체는 정부에 준수를 약속하기 전에 상위 공급업체 계약을 검토해야 한다.

문제는 리셀러와 통합업체에서 가장 심각하다. 이들은 기초 모델 제공업체가 계약상 수락하지 않은 의무에 대해 GSA에 책임을 질 수 있다.

리셀러는 제공업체로부터 상응하는 약속을 받지 못한 채 중대한 모델 변경의 사전 통지를 약속할 수 있다. 또한 제공업체의 표준 기술 통제를 초과하는 정부의 삭제 요건을 수락할 수도 있다.

따라서 확대된 IP 보호는 상업적 충돌의 한 부분만 해결한다. 공급업체는 더 명확한 소유권 경계를 확보하지만, 여전히 모든 중요한 공급업체의 운영 조건과 정부 요건을 조정해야 한다.

최종 규칙은 이전 초안과 비교해 계약업체에 유리하지만, 연방 LLM 조달을 일반적인 소프트웨어 구독으로 바꾸지는 않는다.

데이터 통제와 사고 보고에는 여전히 실질적인 무게가 있다

적용 범위가 좁아졌다고 해서 시스템이 적용 대상이 된 이후 조항의 효력이 약해지는 것은 아니다. 특히 정부 정보가 모델, 임베딩, 하도급업체를 거칠 때 그렇다.

적용 대상 계약업체는 다른 고객이나 상업적 목적을 위해 정부 데이터를 LLM 학습 또는 파인튜닝에 사용할 수 없다. 광고에 사용하거나 제3자에게 판매하는 것도 금지된다.

이러한 제한은 단순한 개인정보 보호 고지가 아니라 기술적 분리를 요구한다. 공급업체는 정부 프롬프트, 출력, 검색된 콘텐츠가 일반 학습 또는 제품 개선 파이프라인으로 유입되지 않도록 하는 통제를 마련해야 한다.

암호화, 접근 통제, 로깅, 보존 한도 및 삭제 절차는 모두 준수 근거를 뒷받침하는 요소가 된다. 계약업체는 또한 자체 시스템과 하도급업체 환경 전반에서 정보가 어디에 존재하는지를 보여주는 기록이 필요하다.

검색 증강 생성은 특정한 과제를 만든다. 이 기술은 흔히 임베딩과 벡터 데이터베이스를 통해 응답 시점에 선택된 외부 정보를 모델에 제공한다.

이러한 보조 저장소는 기반 모델이 해당 자료를 학습하지 않더라도 정부 자료를 포함할 수 있다. 따라서 계약업체는 기본 모델뿐 아니라 주변 애플리케이션까지 관리해야 한다.

계약 종료 시점에도 관련 문제가 발생한다. 계약이 끝날 때 관련 임베딩, 파인튜닝된 가중치, 저장된 입력값, 출력값 및 파생 산출물은 삭제 또는 반환이 필요할 수 있다.

분산 시스템에서는 삭제가 어려울 수 있다. 백업, 복제 데이터베이스, 텔레메트리 파이프라인, 평가 환경 및 재해 복구 사본은 기본 애플리케이션에서 데이터를 삭제한 이후에도 해당 데이터를 보존할 수 있다.

신뢰할 수 있는 종료 계획은 이러한 위치를 사전에 식별해야 한다. 계약이 끝날 때까지 기다리면 공유 시스템을 중단하지 않고는 한 고객의 정보를 분리하거나 삭제할 수 없다는 사실이 드러날 수 있다.

최종 조항은 적용 대상 사건에 대해 72시간 보고 기한도 유지한다. 이 기준은 광범위한 계약업체 네트워크 어디에서든 발생한 사고까지 포괄할 수 있었던 6월 제안보다 더 좁다.

이제 관련 사고는 계약에 사용되는 LLM에 영향을 미치고 정부 데이터의 기밀성, 무결성 또는 가용성에 잠재적으로 영향을 줄 수 있어야 한다. 이는 의무를 실제 계약 위험에 더 가깝게 맞춘다.

72시간은 계약업체가 관련 사건을 실제로 인지한 시점부터 시작된다. 계약업체는 누가 그러한 지식을 취득할 수 있는지, 그리고 정보가 엔지니어 또는 제공업체로부터 주계약업체의 정부 계약팀으로 어떻게 전달되는지를 정의해야 한다.

FedRAMP, Cybersecurity and Infrastructure Security Agency 또는 기타 연방 보고는 실질적으로 동등한 정보를 포함하고 동시에 계약 담당관에게 전달될 경우 조항을 충족할 수 있다.

이 세이프 하버는 중복 보고를 줄인다. 그러나 계약업체는 기존 보고서에 GSA가 요구하는 정보가 포함되었는지 확인해야 하므로 조정의 필요성이 사라지는 것은 아니다.

이 조항은 중대한 위반을 실제로 인지한 후 별도의 통지도 요구한다. 위반은 계약 이행, 정부 권리, 보안, 기밀성, 법규 준수 또는 계약 관리에 중대한 피해를 초래하거나 합리적으로 그러한 피해를 초래할 것으로 예상되는 경우 중대하다.

이 기준은 신속한 법률 및 기술 판단을 요구한다. 엔지니어가 데이터 노출을 인지할 수는 있지만, 그것이 계약상 중대성 기준을 충족하는지는 알지 못할 수 있으므로 팀에는 공동의 에스컬레이션 절차가 필요하다.

모델 변경은 또 다른 운영 부담을 더한다. 정부는 신뢰성, 보안 또는 운영 무결성에 영향을 미치는 변경에 대해 통지와 접근을 기대할 수 있다.

호스팅형 AI 서비스에서는 고객의 통제 없이 모델 업데이트가 빈번하게 발생할 수 있다. 빠르게 변화하는 상용 엔드포인트에 의존하는 계약업체는 제공업체의 계약상 통지와 업데이트된 모델을 테스트하는 절차가 필요하다.

이러한 의무는 좁아진 적용성 테스트가 왜 그토록 중요한지를 보여준다. 조항 적용 대상이 아닌 기업은 까다로운 통제 체계를 피할 수 있다. 적용 대상 기업은 보안, 제품 관리, 법률 검토, 조달 및 AI 평가에 걸친 의무를 마주한다.

보고된 계약업체 업무 부담에는 120일 공개 기한, 사고 보고, 종료 시 삭제, 주요 모델 교체 전 통지 및 정부 평가 권한이 포함된다.

모든 계약업체가 각 의무를 같은 방식으로 경험하는 것은 아니다. 배포 설계, 하도급업체 관계, 시스템 인가 및 계약 담당관의 지침이 구현 방식을 결정한다.

그럼에도 적용 대상 공급업체는 이 조항을 엔지니어링 요건으로 다뤄야 한다. 정책 문서만으로는 학습 파이프라인, 데이터 저장소, 모델 버전, 접근 로그 또는 삭제 작업에 대한 통제를 입증할 수 없다.

편향 기준은 축소됐지만 정부 테스트는 남아 있다

GSA는 상세한 이념 규칙을 합리적 노력 기준으로 대체해 하나의 준수 분쟁은 줄였지만, 모델 품질 측정 방식에 대한 문제는 해결하지 못했다.

6월 제안에는 광범위한 “Unbiased AI Principles”가 포함되어 있었다. 이 원칙은 진실하고 중립적이며 초당파적인 시스템을 요구하는 한편, 학습 데이터, 프롬프트, 검색 소스 및 기타 구성 선택을 통한 이념적 영향력을 제한했다.

이 조항들은 진실 추구 및 이념적 중립성 원칙에 부합하는 LLM을 조달하도록 기관에 지시한 2025년 7월 연방 조달 명령을 반영했다.

업계 단체와 시민사회 조직은 이러한 개념을 객관적인 계약 테스트로 전환할 수 있는지에 의문을 제기했다. 모델 출력은 프롬프트, 맥락, 샘플링 설정, 검색된 정보 및 시스템 구성에 따라 달라진다.

최종 조항은 규범적인 프레임워크 대부분을 삭제했다. 대신 계약업체는 사용자가 사실 정보나 분석을 요청할 때 정확성, 과학적 탐구 및 객관성을 우선하도록 적용 대상 LLM을 설계, 학습 및 구성하기 위해 합리적인 노력을 기울여야 한다.

“합리적인 노력”은 중립적 행동을 보장하는 것보다 더 유연한 기준이다. 이는 확률적 모델이 모든 프롬프트에서 완벽한 정확성이나 일관된 답변을 약속할 수 없음을 인정한다.

개정된 문구는 당파적 또는 이념적 판단을 내재화하는 행위에 대한 명시적 금지도 삭제한다. 더 이상 이전 편향 프레임워크에 특별히 연결된 동일한 지속적 모니터링 의무를 만들지 않는다.

이는 실질적인 양보다. 하나의 논쟁적인 응답이 자동으로 계약 위반을 입증할 위험을 낮춘다.

그러나 합리적인 노력에도 증거는 필요하다. 계약업체는 평가 계획, 문서화된 시스템 프롬프트, 벤치마크 결과, 알려진 한계 보고서, 모델 카드 및 시정 조치 기록이 필요할 수 있다.

정부는 배포된 시스템을 평가할 권한도 유지한다. 계약업체는 정확성이나 객관성에 대한 내부 주장이 테스트 없이 받아들여질 것이라 가정할 수 없다.

이 지점에서 NIST 프레임워크는 공급망 용어 이상의 의미를 갖는다. 그 수명주기 접근법은 테스트, 평가, 검증 및 확인을 설계, 개발, 배포 및 운영 전반에 걸쳐 지속되는 활동으로 본다.

단일 벤치마크만으로 범용 모델이 정확하거나 객관적인지 결론낼 수는 없다. 성능은 도메인, 언어, 검색 소스, 도구 및 정부 활용 사례에 따라 달라진다.

문서 요약 조달에는 누락, 인용 충실도 및 제한 자료 처리에 대한 테스트가 필요하다. 대민 지원 도우미에는 사실성, 거부 동작, 접근성, 개인정보 보호 및 근거 없는 조언에 대한 검증이 필요하다.

에이전트형 시스템은 도구를 호출하거나 행동을 수행할 수 있으므로 추가 위험을 만든다. 이러한 시스템의 평가는 생성된 문장의 품질뿐 아니라 워크플로 로직과 권한 부여 경계도 포괄해야 한다.

이 조항은 정부가 언제든 적용 대상 LLM의 사용을 중단할 수 있도록 한다. 이전 문구는 해결되지 않은 성능 문제를 중심으로 사용 중단을 더 직접적으로 규정했다.

이처럼 더 광범위한 권한은 상업적 불확실성을 초래한다. 기술적으로 준수하는 시스템도 기관이 우려 사항을 조사하는 동안 운영 중단에 직면할 수 있다.

최종 조항은 서비스 종료 비용 책임도 변경한다. 이전의 unbiased-AI 조항 위반에만 연계하는 대신, 해당 조항 미준수 통지에 따른 계약 해지와 그 비용을 연결한다.

이러한 서비스 종료 비용에 대한 계약업체 책임은 영향을 받는 과업 또는 납품 주문의 25%로 제한된다. 재조달 비용과 대체 시스템 개발 비용은 이 계산에서 제외된다.

이 상한은 공급업체에 더 명확한 한계를 제공한다. 그러나 사용 중단이나 계약 해지는 정해진 서비스 종료 금액을 넘어 평판 손상, 수익 손실 및 엔지니어링 비용을 초래할 수 있다.

가장 큰 미해결 문제는 평가의 일관성이다. 기관, 계약 담당관 및 기술팀에 따라 서로 다른 프롬프트, 데이터세트 또는 임계값을 사용할 수 있다.

모델은 일반 벤치마크에서 높은 점수를 받아도 특화된 정부 워크플로에서는 실패할 수 있다. 또한 사실성은 개선되지만 지나치게 자주 거부해 유용성이 떨어질 수도 있다.

따라서 계약업체는 평가를 조달된 사용 사례와 연결해야 합니다. 광범위한 마케팅 점수보다 대표적인 정부 업무에서 배포된 구성이 어떻게 작동하는지를 보여주는 증거가 더 중요합니다.

최종 문구는 완벽한 중립성이라는 불가능한 상태를 약속하지 않는다는 점에서 현명합니다. 합리적 노력 기준은 어떤 평가가 적절한지, 어떤 성능이 수용 가능한지에 관한 분쟁의 여지를 여전히 남깁니다.

세 가지 신호가 이 규칙의 실효성을 보여줄 것이다

다음 시험대는 이행입니다. 계약 담당관, 원도급업체, 모델 제공업체는 이 조항을 실행 가능한 계약 및 엔지니어링 관행으로 전환해야 합니다.

첫 번째 신호는 10월 19일 이후 GSA가 두 부분으로 구성된 범위 테스트를 어떻게 적용하는지입니다. 입찰 공고는 LLM 기능이 중대한지, 그리고 정부 데이터가 시스템에 직접 입력되거나 시스템에서 생성되는지를 식별해야 합니다.

명확한 판단은 GSA가 실제로 규칙의 범위를 좁혔다는 견해를 강화할 것입니다. 부수적인 AI 기능을 위해 계약에 이 조항을 일상적으로 삽입한다면, 그러한 결론은 약화되고 최종 문구가 해소하려 했던 불확실성이 다시 생길 것입니다.

계약업체는 입찰 공고에서 이 조항이 적용되는 이유를 설명하는지 주시해야 합니다. 또한 계약 담당관이 두 가지 자동 해제 조건을 어떻게 해석하는지도 검토해야 합니다.

두 번째 신호는 하도급업체 플로우다운의 품질입니다. 원도급업체는 NIST 라이프사이클 업무와 각 공급업체가 처리하는 데이터에 부합하는 계약을 마련해야 합니다.

모델 제공업체와 클라우드 플랫폼은 보존, 학습 제한, 사고 통지, 모델 변경, 평가 접근, 삭제를 포괄하는 정부용 약관을 제공하라는 압박을 받게 될 것입니다.

표준화된 부속 합의서는 소규모 통합업체의 규정 준수를 더 쉽게 만들 것입니다. 주요 공급업체가 그러한 조건 수용을 거부한다면, 연방 정부 사업 기회는 더 큰 협상력이나 전용 정부 서비스 상품을 보유한 벤더에 집중될 수 있습니다.

오픈 모델과 오픈 웨이트 모델은 또 다른 시험대입니다. 최종 조항은 완전한 공개 아티팩트를 갖춘 모델과 가중치만 공개하는 제품을 구분합니다.

계약업체는 자신의 분류가 기술적으로 정확하다는 점을 입증해야 합니다. 개방성에 관한 모호한 마케팅 문구가 라이선스, 소스 이용 가능성, 데이터세트, 문서를 점검하는 일을 대신해서는 안 됩니다.

세 번째 신호는 GSA가 모델 평가와 미준수를 어떻게 다루는지입니다. 합리적 노력은 유연성을 제공하지만, 그러한 유연성에는 반복 가능한 테스트와 비례적인 구제 조치가 필요합니다.

정부 평가는 구매된 사용 사례, 공개된 구성, 이용 가능한 증거, 알려진 기술적 한계를 반영해야 합니다. 단일 적대적 프롬프트가 복잡한 배포 환경의 성능을 자동으로 규정해서는 안 됩니다.

동시에 벤더는 모델의 가변성을 허술한 통제의 변명으로 삼아서는 안 됩니다. 테스트 스위트, 평가 데이터세트, 인간 검토 임계값, 검색 소스, 시정 결정 등을 문서화할 수 있습니다.

현재 입찰을 준비하는 조직은 계약 협상이 시작되기 전에 증거 패키지를 구축해야 합니다. 여기에는 아키텍처 다이어그램, 데이터 흐름 맵, 하도급업체 목록, 보존 일정, 모델 변경 절차, 평가 결과, 계약 종료 계획이 포함되어야 합니다.

검색 가능한 기술 아카이브는 팀이 엔지니어링, 보안, 조달, 법률 검토 전반에서 이러한 아티팩트를 연결하는 데 도움이 될 수 있습니다. 다만 시스템은 정부 데이터에 관한 계약상 제한을 계속 준수해야 합니다.

GSA LLM 최종 규칙은 이전 규칙보다 범위가 좁지만, 부담이 가볍지는 않습니다. 그 핵심 거래는 정부가 의도적으로 LLM 시스템을 구매할 때 더 깊은 책임성을 지는 대가로 더 명확한 경계를 제공하는 것입니다.

AI 계약업체에 당면한 질문은 어디선가 생성형 AI를 사용하느냐가 아닙니다. 정부가 그 기능을 구매하는지, 정부 데이터가 그 기능에 닿는지, 그리고 모든 참여자가 규정 준수를 입증할 수 있는지입니다.

10월 19일 이전에 벤더는 실제 아키텍처와 계약을 기준으로 그 답을 검증해야 합니다. 제공업체가 내일 모델을 변경한다면, 원도급업체는 즉흥적인 대응 없이 영향을 파악하고, GSA에 통지하며, 증거를 보존하고, 정부 데이터를 보호할 수 있을까요?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page