Ostateczna regulacja GSA dotycząca LLM zawęża zakres, ale nadal nakłada obowiązki na wykonawców AI
Ostateczna regulacja GSA dotycząca LLM wchodzi w życie 19 października 2026 r. i ma węższy zakres, lecz nakłada istotne obowiązki w zakresie zgodności na objętych nią federalnych wykonawców AI.
General Services Administration skupia się obecnie na systemach, w których funkcjonalność dużego modelu językowego stanowi istotną cechę, a dane rządowe bezpośrednio trafiają do modelu lub z niego wychodzą. Wewnętrzne narzędzia zaplecza administracyjnego i uboczne funkcje AI mogą nie podlegać tej klauzuli.
Ta zmiana odpowiada na część najważniejszych zastrzeżeń branży technologicznej wobec wcześniejszych projektów. Mimo to ostateczne brzmienie nadal ma pierwszeństwo przed sprzecznymi umowami komercyjnymi, obejmuje odpowiednich podwykonawców i nakłada szczegółowe zasady dotyczące bezpieczeństwa danych, dokumentacji, zgłaszania incydentów, zmian w modelach oraz zamykania kontraktów.
Rezultatem jest kompromis, a nie szerokie wycofanie się z regulacji. GSA ograniczyła ryzyko, że zwykłe oprogramowanie zostanie objęte reżimem kontraktowym właściwym dla AI. Dostawcy sprzedający rządowi rzeczywiste produkty LLM nadal muszą zapewnić poziom przejrzystości operacyjnej, którego wiele wdrożeń komercyjnych nie wymaga.
Ostateczna regulacja GSA dotycząca LLM stosuje dwuczęściowy test zakresu
Ostateczna klauzula koncentruje się na systemach AI, które rząd celowo kupuje, a nie na każdym systemie wykonawcy, który akurat korzysta z LLM.
GSA wydała klauzulę 552.239-7001, Basic Safeguarding of Data within Large Language Model Artificial Intelligence Systems, w ramach odstępstwa klasowego od General Services Acquisition Regulation. Odstępstwo klasowe pozwala agencji stosować język zamówieniowy przed ukończeniem standardowej kodyfikacji.
Zmiana pojawia się we wrześniowej aktualizacji GSA dotyczącej ostatecznej klauzuli. Aktualizacja stanowi część RGO-2026-01, większego przeglądu regulacji agencji dotyczących zamówień.
Klauzula ma zastosowanie, gdy spełnione są dwa warunki. Po pierwsze, GSA musi nabywać LLM, generatywnego asystenta, chatbota, system agentowy, narzędzie zwiększające produktywność oparte na LLM lub podobny produkt, w którym funkcjonalność LLM ma istotne znaczenie.
Po drugie, dane rządowe muszą być bezpośrednio przekazywane do LLM lub przez niego wytwarzane. Ten drugi warunek wiąże ciężar zgodności z rzeczywistymi interakcjami z modelem, a nie z samą obecnością AI gdzieś w stosie technologicznym wykonawcy.
Jest to zakres znacząco węższy niż w propozycji z czerwca. Proponowany tekst zasadniczo obowiązywał, gdy dane rządowe miały być przetwarzane przez LLM, co mogło obejmować systemy wspierające i przypadkowe zastosowania.
Ostateczna klauzula zawiera również postanowienie automatycznie wyłączające jej zastosowanie. O ile urzędnik kontraktowy nie postanowi inaczej, nie nakłada ona obowiązków, gdy korzystanie z LLM ogranicza się do wewnętrznych systemów biznesowych, zaplecza administracyjnego, operacyjnych lub wspierających realizację zadań, do których rząd nie ma dostępu.
Drugie wyłączenie dotyczy produktów komercyjnych, w których funkcja LLM jest przypadkowa lub pomocnicza. Wyłączenie ma zastosowanie, gdy AI nie jest głównym przeznaczeniem produktu, wymogiem kontraktowym, funkcją dostępną rządowi ani podmiotem przetwarzającym dane rządowe.
Te rozróżnienia są istotne dla wykonawców korzystających z generatywnej AI podczas świadczenia innej usługi. Firma konsultingowa może używać wewnętrznego asystenta do organizowania pracy, nie sprzedając tego asystenta GSA. Konwencjonalny produkt programistyczny może zawierać opcjonalną funkcję AI, której agencja nigdy nie aktywuje.
Takie sytuacje mają obecnie silniejszą podstawę do wyłączenia. Ostateczna klauzula nie czyni jednak każdego wewnętrznego przepływu pracy z AI niewidocznym. Wykonawcy nadal muszą ustalić, czy dane rządowe trafiają do nabytej, dostępnej lub wymaganej umową funkcji LLM.
Definicja danych rządowych również stała się bardziej precyzyjna. Objête dane wejściowe są przekazywane przez rząd lub w jego imieniu, a nie po prostu tworzone dla niego. Metadane i logi są wyłączone z objętych regulacją danych wyjściowych.
To doprecyzowanie ogranicza zbiór informacji kontrolowanych przez klauzulę. Nie eliminuje jednak potrzeby mapowania danych, ponieważ prompty, pobierane treści, generowane odpowiedzi, osadzenia oraz materiały do dostrajania nadal mogą przekraczać objęte granice.
Wyłączenia działają zatem bardziej jak zasady klasyfikacji niż ogólne zwolnienia. Dostawcy potrzebują dowodów pokazujących, co kupuje rząd, do jakich funkcji ma dostęp, gdzie przepływają dane i czy LLM istotnie przyczynia się do świadczonej usługi.
Oficjalny tekst rodzi też problem interpretacyjny. Jego paragraf automatycznie wyłączający zastosowanie wymienia wyłączenie dla zaplecza administracyjnego i wyłączenie dotyczące funkcji ubocznej bez wyraźnego połączenia ich słowem „i” lub „lub”.
Ten wybór redakcyjny pozostawia niepewność, czy każdy z warunków niezależnie wyłącza klauzulę, czy też muszą być spełnione oba. Urzędnicy kontraktowi mogą potrzebować wyjaśnić tę kwestię podczas postępowań lub negocjacji.
Wniosek praktyczny jest prosty. Wykonawcy nie powinni zakładać, że funkcja AI jest objęta regulacją tylko dlatego, że istnieje. Nie powinni też zakładać, że określenie funkcji jako ubocznej rozstrzyga sprawę.
Opis prac, opis produktu, architektura systemu i faktyczny przepływ danych będą miały większe znaczenie niż etykieta produktu. To pierwsza istotna zmiana wprowadzona przez ostateczną regulację GSA dotyczącą LLM.
Ramy NIST zastępują cztery sztywne role w łańcuchu dostaw
GSA przeszła od stałych etykiet dostawców do zadań w cyklu życia, ale główni wykonawcy nadal odpowiadają za identyfikację każdego objętego regulacją uczestnika.
Propozycja z czerwca dzieliła łańcuch dostaw LLM na cztery zdefiniowane role: dewelopera, operatora systemu, integratora systemu i dostawcę usług. Z każdą rolą wiązała się odpowiednia klauzula towarzysząca oraz określony zestaw obowiązków przenoszonych na niższe szczeble.
Przeniesienie obowiązków oznacza, że główny wykonawca musi wprowadzić odpowiednie wymogi rządowe do umów z podwykonawcami. Zapobiega to zatrzymaniu obowiązku na pierwszym poziomie kontraktowym, gdy inna firma faktycznie obsługuje technologię lub dane.
Ostateczna klauzula zastępuje te cztery formalne kategorie opisami zadań z ram zarządzania ryzykiem AI opublikowanych przez National Institute of Standards and Technology.
Wskazane zadania obejmują projektowanie AI, rozwój AI, wdrażanie AI oraz eksploatację i monitorowanie. Obejmują pracę taką jak definiowanie wymagań systemowych, budowanie modeli, integrowanie komponentów, wdrażanie systemów do środowiska produkcyjnego i ocena wyników po uruchomieniu.
Podejście to lepiej odzwierciedla sposób tworzenia współczesnych produktów AI. Jedna firma może hostować model, druga zapewniać infrastrukturę wyszukiwania, a trzecia łączyć system z rządowymi procesami pracy.
Tradycyjna etykieta roli może ukrywać te nakładające się obowiązki. Test oparty na zadaniach pyta, co faktycznie robi każdy uczestnik i czy podczas tego działania obsługuje dane rządowe.
Główny wykonawca musi przenosić mające zastosowanie wymogi na podwykonawców wykonujących te zadania, gdy gromadzą, przetwarzają, przechowują, zatrzymują, wykorzystują do trenowania, dostrajają na podstawie lub w inny sposób obsługują dane rządowe.
To sformułowanie obejmuje więcej niż deweloperów modeli. Dostawcy usług chmurowych, firmy hostingowe, integratorzy systemów, dostawcy rozwiązań wyszukiwania, usługi ewaluacyjne i partnerzy świadczący zarządzane operacje mogą wszyscy wejść do łańcucha zgodności.
Klauzula wymaga dołożenia należytych starań przy wyborze i nadzorze nad tymi podwykonawcami. Wykonawcy mogą opierać się na oświadczeniach, niezależnie weryfikowalnych dowodach, kartach modeli, kartach systemów, dokumentacji bezpieczeństwa, materiałach audytowych i odpowiednich certyfikatach.
Istniejące materiały mogą spełnić wymóg, gdy w rozsądny sposób wykazują zgodność. Wykonawca nie musi tworzyć zduplikowanych zapisów wyłącznie po to, by spełnić wymogi klauzuli.
Główny wykonawca nadal musi jednak powiązać te materiały z objętym regulacją systemem. Ogólny certyfikat bezpieczeństwa nie wyjaśnia automatycznie, czy dostawca trenuje na rządowych promptach, przechowuje generowane wyniki lub obsługuje wymagane usunięcie danych.
Ostateczne brzmienie zapewnia szczególne traktowanie w pełni otwartym modelom i komponentom LLM open source. Wykonawcy nie muszą przenosić na te komponenty postanowień dotyczących pochodzenia, własności, jurysdykcji ani zagranicznej kontroli.
GSA definiuje w pełni otwarty model bardziej rygorystycznie niż luźne określenie „open source AI”, często używane w marketingu. Architektura, wagi, odpowiedni kod oraz zbiory danych treningowych, walidacyjnych i testowych muszą być publicznie możliwe do sprawdzenia na odpowiednich licencjach.
Modele z otwartymi wagami nie otrzymują takiej samej klasyfikacji wyłącznie dlatego, że ich parametry można pobrać. Jeśli odpowiadający im kod i dane pozostają niedostępne, GSA traktuje system inaczej niż w pełni otwarty model.
To rozróżnienie wpływa na należytą staranność. Otwarte komponenty można dokumentować za pomocą publicznie dostępnych wag, raportów technicznych, dokumentacji modelu i ujawnień dotyczących danych treningowych. Oddzielne poświadczenie specyficzne dla kontraktu nie zawsze jest wymagane.
Modele z otwartymi wagami nadal wymagają udokumentowanego przeglądu opartego na należytych staraniach. Wykonawca musi uwzględnić dokumentację modelu, testy, raporty techniczne i jego rolę w realizacji kontraktu.
Struktura NIST daje wykonawcom większą elastyczność niż czerwcowa taksonomia. Jednocześnie wywiera na nich większą presję, by utrzymywali dokładną mapę łańcucha dostaw.
Główny dostawca nie może po prostu przypisać każdej firmie jednej etykiety i przejść dalej. Musi rozumieć, jakie zadania w cyklu życia wykonuje każda strona, jakie dane rządowe obsługuje i które paragrafy klauzuli mają zastosowanie.
Praca ta może stać się trudna, gdy komercyjne usługi AI zmieniają podwykonawców, lokalizacje hostingu lub rodziny modeli. Zespoły kontraktowe będą potrzebować dokumentacji inżynieryjnej i zakupowej, która pozostaje spójna przez cały okres realizacji.
Ostateczna klauzula zastępuje więc sztywną kategoryzację ciągłą analizą faktów. Struktura jest bardziej elastyczna, ale niekoniecznie mniej wymagająca w przypadku złożonych wdrożeń.
Rozszerzona ochrona własności intelektualnej nie zachowuje wszystkich warunków komercyjnych
Wykonawcy zachowują silniejsze prawa do istniejącej wcześniej technologii, podczas gdy rząd nadal przyznaje swojej klauzuli pierwszeństwo przed sprzecznymi umowami dostawców.
Własność intelektualna była jednym z najbardziej spornych elementów wcześniejszego podejścia GSA. Marcowy projekt zawierał szeroką licencję dla rządu i ograniczenia, które zaniepokoiły dostawców, których produkty opierają się na wielokrotnie wykorzystywanej technologii komercyjnej.
Wersja z czerwca zmieniła tę strukturę, ale obawy branży utrzymały się. Ostateczna klauzula dodaje teraz bardziej jednoznaczną ochronę materiałów stworzonych przed zawarciem kontraktu lub niezależnie opracowanych do szerszego użytku komercyjnego.
Rząd nie nabywa własności istniejących wcześniej komercyjnych produktów wykonawcy, technologii zastrzeżonej ani materiałów używanych dla wielu klientów. Uznanie to obejmuje oprogramowanie, konfiguracje, przepływy pracy, dokumentację, modele, skrypty, metody techniczne i know-how.
Chroni również informacje generowane przez usługi, analitykę, zawartość baz wiedzy i powiązane materiały, gdy kwalifikują się jako istniejące wcześniej lub niezależnie opracowane aktywa komercyjne.
Ochrona ta uznaje kluczową cechę kontraktowania AI. Dostawcy rzadko budują kompletny model i wspierającą go platformę wyłącznie dla jednego klienta rządowego. Dostosowują wspólną infrastrukturę, przepływy pracy, ewaluacje i komponenty techniczne do wielu wdrożeń.
Ostateczny tekst zawęża także przeniesienie praw do ulepszeń wynikających z danych rządowych. Ogólne usprawnienia możliwości pozostają przy wykonawcy, gdy nie zawierają, nie ujawniają, nie odsłaniają ani nie wynikają z objętych regulacją informacji rządowych.
To wyłączenie zmniejsza ryzyko, że zwykłe ulepszenia platformy automatycznie staną się własnością rządu. Dostawca może udoskonalić ogólną metodę harmonogramowania lub poprawić niezawodność systemu bez rezygnowania z tego dorobku wyłącznie dlatego, że wiedza powstała podczas realizacji zlecenia federalnego.
Granica staje się mniej wyraźna, gdy ulepszenie bezpośrednio zależy od danych rządowych. Dostrajanie, indeksy do wyszukiwania, wyspecjalizowane zestawy ewaluacyjne lub przepływy pracy specyficzne dla danej dziedziny mogą łączyć inżynierię nadającą się do ponownego wykorzystania z informacjami pochodzącymi od klienta.
Wykonawcy będą musieli udokumentować to rozróżnienie, zanim dojdzie do sporu. Oddzielne repozytoria, rejestry pochodzenia danych, inwentaryzacje modeli i historie zmian mogą wykazać, czy ulepszenie ma charakter ogólny, czy jest specyficzne dla administracji rządowej.
Klauzula rozszerza również pojęcie danych istniejących wcześniej. Wykonawcy mogą zachować własność kwalifikujących się informacji, które posiadają, kontrolują lub licencjonują, w tym materiałów używanych do tworzenia lub ulepszania LLM.
Wcześniejsze brzmienie odnosiło się do danych istniejących wcześniej w ich pierwotnej postaci. Usunięcie tego ograniczenia wspiera dalsze zachowanie własności przez wykonawcę, gdy kwalifikujący się materiał zostanie zmodyfikowany lub ulepszony w trakcie realizacji.
Mimo to ulepszenia dotyczące własności intelektualnej nie zachowują wszystkich standardowych warunków komercyjnych. Ostateczna klauzula stanowi, że uzupełnia obowiązujące warunki Federal Acquisition Regulation i GSAR, lecz zachowuje pierwszeństwo przed sprzecznymi umowami handlowymi.
Zasada ta może kolidować ze zwykłymi umowami dotyczącymi chmury i AI. Standardowe warunki dostawców często ograniczają dostęp do audytu, przyznają jednostronne prawa do zmian modeli, zezwalają na ulepszanie usług z wykorzystaniem interakcji klientów lub definiują szerokie praktyki retencji.
Kontrakt federalny nie może bezpiecznie opierać się na tych domyślnych zasadach, gdy klauzula GSA stanowi inaczej. Główni wykonawcy muszą przeanalizować umowy z dostawcami wyższego szczebla, zanim zobowiążą się wobec rządu do zgodności.
Problem jest najbardziej dotkliwy dla resellerów i integratorów. Mogą oni odpowiadać przed GSA za zobowiązanie, którego podstawowy dostawca modelu nie zaakceptował umownie.
Reseller może obiecać wcześniejsze powiadomienie o istotnej zmianie modelu, nie otrzymując równoważnego zobowiązania od swojego dostawcy. Może też zaakceptować rządowe wymogi usunięcia danych, które wykraczają poza standardowe techniczne mechanizmy kontroli dostawcy.
Rozszerzona ochrona własności intelektualnej rozwiązuje zatem tylko część konfliktu handlowego. Dostawcy zyskują wyraźniejsze granice własności, lecz nadal muszą pogodzić wymogi rządowe z warunkami operacyjnymi każdego istotnego dostawcy.
Ostateczna reguła jest korzystniejsza dla wykonawców niż wcześniejsze projekty, lecz nie przekształca federalnych zamówień na LLM w zwykłą subskrypcję oprogramowania.
Kontrole danych i raportowanie incydentów nadal mają realne znaczenie
Zawężony zakres nie osłabia klauzuli, gdy system się kwalifikuje, zwłaszcza gdy informacje rządowe przepływają przez modele, embeddingi i podwykonawców.
Objęci klauzulą wykonawcy nie mogą wykorzystywać danych rządowych do trenowania ani dostrajania LLM dla innych klientów lub celów komercyjnych. Nie mogą też używać ich do reklamy ani sprzedawać ich stronom trzecim.
Ograniczenia te wymagają technicznego rozdzielenia, a nie jedynie oświadczenia o prywatności. Dostawcy potrzebują mechanizmów kontroli, które zapobiegają przedostawaniu się rządowych promptów, wyników i odzyskanych treści do ogólnych procesów treningowych lub ulepszania produktów.
Szyfrowanie, kontrola dostępu, rejestrowanie zdarzeń, limity retencji i procedury usuwania danych stają się częścią dowodów potwierdzających zgodność. Wykonawcy potrzebują także zapisów wskazujących, gdzie informacje znajdują się w ich własnych systemach i środowiskach podwykonawców.
Generowanie wspomagane wyszukiwaniem tworzy szczególne wyzwanie. Technika ta dostarcza modelowi wybrane informacje zewnętrzne w chwili generowania odpowiedzi, często za pośrednictwem embeddingów i wektorowych baz danych.
Takie pomocnicze magazyny mogą zawierać materiały rządowe, nawet gdy model bazowy nigdy nie jest na nich trenowany. Wykonawcy muszą zatem zarządzać otaczającą aplikacją, a nie wyłącznie modelem bazowym.
Zakończenie kontraktu rodzi powiązany problem. Odpowiednie embeddingi, dostrojone wagi, przechowywane dane wejściowe, wyniki i artefakty pochodne mogą wymagać usunięcia lub zwrotu po zakończeniu współpracy.
Usuwanie danych może być trudne w systemach rozproszonych. Kopie zapasowe, replikowane bazy danych, potoki telemetrii, środowiska ewaluacyjne i kopie do odtwarzania po awarii mogą zachowywać dane po usunięciu ich przez główną aplikację.
Wiarygodny plan zakończenia musi z wyprzedzeniem wskazać te lokalizacje. Czekanie do końca kontraktu może ujawnić, że dostawca nie potrafi odizolować ani usunąć informacji jednego klienta bez zakłócania wspólnego systemu.
Ostateczna klauzula utrzymuje również 72-godzinny termin raportowania zdarzeń objętych zakresem. Przesłanka jest węższa niż w propozycji z czerwca, która mogła obejmować incydenty w dowolnym miejscu rozległej sieci wykonawcy.
Obecnie odpowiedni incydent musi dotyczyć LLM używanego w ramach kontraktu i potencjalnie wpływać na poufność, integralność lub dostępność danych rządowych. To lepiej dopasowuje obowiązek do rzeczywistego ryzyka kontraktowego.
Okres 72 godzin rozpoczyna się po uzyskaniu przez wykonawcę faktycznej wiedzy o odpowiednim zdarzeniu. Wykonawcy powinni określić, kto może uzyskać taką wiedzę i w jaki sposób informacje przechodzą od inżynierów lub dostawców do zespołu głównego wykonawcy zajmującego się kontraktami rządowymi.
Raporty dla FedRAMP, Cybersecurity and Infrastructure Security Agency lub innych organów federalnych mogą spełnić wymogi klauzuli, gdy zawierają zasadniczo równoważne informacje i jednocześnie trafiają do urzędnika kontraktowego.
Ta bezpieczna przystań ogranicza dublowanie raportów. Nie eliminuje koordynacji, ponieważ wykonawca musi potwierdzić, że istniejący raport zawiera informacje oczekiwane przez GSA.
Klauzula odrębnie wymaga zawiadomienia po uzyskaniu faktycznej wiedzy o istotnym naruszeniu. Naruszenie jest istotne, gdy powoduje lub można rozsądnie oczekiwać, że spowoduje znaczącą szkodę dla realizacji, praw rządu, bezpieczeństwa, poufności, zgodności prawnej lub administracji kontraktu.
Standard ten wymaga szybkiej oceny prawnej i technicznej. Zespoły potrzebują wspólnego procesu eskalacji, ponieważ inżynier może rozpoznać ujawnienie danych, zanim będzie wiedział, czy spełnia ono kontraktowy próg istotności.
Zmiany modeli tworzą dodatkowe obciążenie operacyjne. Rząd może oczekiwać powiadomienia i dostępu w związku ze zmianami wpływającymi na wiarygodność, bezpieczeństwo lub integralność operacyjną.
W przypadku hostowanych usług AI aktualizacje modeli mogą następować często i bez kontroli klienta. Wykonawca zależny od szybko zmieniającego się komercyjnego endpointu potrzebuje umownego powiadomienia od dostawcy oraz procesu testowania zaktualizowanego modelu.
Obowiązki te wyjaśniają, dlaczego zawężony test stosowalności ma tak duże znaczenie. Firma poza zakresem klauzuli unika wymagającego systemu kontroli. Firma objęta klauzulą staje wobec obowiązków obejmujących bezpieczeństwo, zarządzanie produktem, analizę prawną, zakupy i ewaluację AI.
Zgłoszony nakład pracy wykonawców obejmuje 120-dniowy termin ujawnienia, raportowanie incydentów, usuwanie danych po zakończeniu kontraktu, powiadomienie przed istotną zmianą modelu oraz prawa rządu do oceny.
Nie każdy wykonawca doświadczy każdego obowiązku w ten sam sposób. Sposób wdrożenia określą architektura wdrożenia, relacje z podwykonawcami, autoryzacja systemu oraz instrukcje urzędnika kontraktowego.
Mimo to objęci klauzulą dostawcy powinni traktować ją jako wymóg inżynieryjny. Sam dokument polityki nie może wykazać kontroli nad potokami treningowymi, magazynami danych, wersjami modeli, dziennikami dostępu ani operacjami usuwania danych.
Standard dotyczący uprzedzeń jest węższy, lecz testy rządowe pozostają
GSA zastąpiła szczegółowe reguły ideologiczne standardem rozsądnych starań, ograniczając jeden spór o zgodność bez rozstrzygnięcia, jak będzie mierzona jakość modelu.
Propozycja z czerwca zawierała rozbudowane „Unbiased AI Principles”. Wzywała do stosowania systemów prawdziwych, neutralnych i bezstronnych politycznie, jednocześnie ograniczając wpływ ideologiczny poprzez dane treningowe, prompty, źródła wyszukiwania i inne wybory konfiguracyjne.
Postanowienia te odzwierciedlały federalne rozporządzenie zakupowe z lipca 2025 r., które nakazywało agencjom nabywanie LLM zgodnych z zasadami dążenia do prawdy i neutralności ideologicznej.
Grupy branżowe i organizacje społeczeństwa obywatelskiego kwestionowały, czy idee te można przełożyć na obiektywne testy kontraktowe. Wyniki modeli różnią się w zależności od promptu, kontekstu, ustawień próbkowania, odzyskanych informacji i konfiguracji systemu.
Ostateczna klauzula usuwa większość nakazowego ramowego podejścia. Zamiast tego wykonawcy muszą podejmować rozsądne starania, aby projektować, trenować i konfigurować objęte zakresem LLM tak, by priorytetowo traktowały dokładność, dociekanie naukowe i obiektywizm, gdy użytkownicy żądają informacji faktycznych lub analizy.
„Rozsądne starania” są bardziej elastycznym standardem niż gwarancja neutralnego zachowania. Uznają, że modele probabilistyczne nie mogą obiecać doskonałej dokładności ani spójnych odpowiedzi na każdy prompt.
Zmienione brzmienie usuwa również wyraźny zakaz osadzania partyjnych lub ideologicznych ocen. Nie tworzy już takiego samego mandatu ciągłego monitorowania, powiązanego szczególnie z wcześniejszymi ramami dotyczącymi uprzedzeń.
To istotne ustępstwo. Zmniejsza ryzyko, że jedna zakwestionowana odpowiedź automatycznie ustanowi naruszenie kontraktu.
Jednak rozsądne starania nadal wymagają dowodów. Wykonawcy mogą potrzebować planów ewaluacji, udokumentowanych promptów systemowych, wyników benchmarków, raportów o znanych ograniczeniach, kart modeli i zapisów działań naprawczych.
Rząd zachowuje również możliwość oceny wdrożonych systemów. Wykonawcy nie mogą zakładać, że ich wewnętrzne twierdzenia o dokładności lub obiektywizmie zostaną zaakceptowane bez testów.
W tym miejscu ramy NIST stają się czymś więcej niż słownikiem dotyczącym łańcucha dostaw. Ich podejście oparte na cyklu życia traktuje testowanie, ocenę, weryfikację i walidację jako działania kontynuowane podczas projektowania, rozwoju, wdrożenia i eksploatacji.
Żaden pojedynczy benchmark nie może rozstrzygnąć, czy model ogólnego przeznaczenia jest dokładny lub obiektywny. Wyniki zmieniają się między dziedzinami, językami, źródłami wyszukiwania, narzędziami i rządowymi przypadkami użycia.
Zamówienie na streszczanie dokumentów wymaga testów dotyczących pominięć, wierności cytowań i postępowania z materiałami objętymi ograniczeniami. Asystent publicznie dostępny potrzebuje kontroli faktyczności, zachowania przy odmowie, dostępności, prywatności i niepopartych dowodami porad.
Systemy agentowe tworzą dodatkowe ryzyko, ponieważ mogą wywoływać narzędzia lub podejmować działania. Ich ewaluacja musi obejmować logikę przepływu pracy i granice autoryzacji, a nie tylko jakość generowanego tekstu.
Klauzula pozwala rządowi w dowolnym momencie zawiesić korzystanie z objętego nią LLM. Wcześniejsze brzmienie wiązało zawieszenie bardziej bezpośrednio z nierozwiązanymi problemami z wydajnością.
To szersze uprawnienie tworzy niepewność handlową. System zgodny technicznie może mimo to doświadczyć przerwy operacyjnej, gdy agencja bada problem.
Ostateczna klauzula zmienia również odpowiedzialność za koszty wycofania z eksploatacji. Wiąże te koszty z rozwiązaniem umowy po zawiadomieniu o niezgodności z klauzulą, a nie wyłącznie z naruszeniami wcześniejszych postanowień dotyczących bezstronnej AI.
Odpowiedzialność wykonawcy za koszty wycofania z eksploatacji jest ograniczona do 25 procent wartości dotkniętego zamówienia zadaniowego lub dostawy. Koszty ponownego zamówienia oraz opracowania systemu zastępczego są wyłączone z tego obliczenia.
Limit daje dostawcom wyraźniejszą granicę. Jednak zawieszenie lub rozwiązanie umowy może nadal powodować szkody reputacyjne, utratę przychodów i koszty inżynieryjne wykraczające poza określoną kwotę wycofania z eksploatacji.
Największym nierozstrzygniętym pytaniem pozostaje spójność ewaluacji. Różne agencje, urzędnicy kontraktowi i zespoły techniczne mogą używać różnych promptów, zbiorów danych lub progów.
Model może uzyskać dobre wyniki w ogólnym benchmarku, a mimo to nie sprawdzić się w wyspecjalizowanym rządowym przepływie pracy. Może także poprawić faktyczność, stając się mniej użyteczny, ponieważ zbyt często odmawia odpowiedzi.
W związku z tym wykonawcy powinni łączyć oceny z zamawianym przypadkiem użycia. Szerokie wskaźniki marketingowe mają mniejsze znaczenie niż dowody pokazujące, jak wdrożona konfiguracja działa w reprezentatywnych zadaniach rządowych.
Ostateczne brzmienie rozsądnie unika obietnicy niemożliwego stanu pełnej neutralności. Standard oparty na rozsądnych staraniach nadal pozostawia pole do sporów o to, które oceny są właściwe i jaki poziom działania należy uznać za akceptowalny.
Trzy sygnały pokażą, czy ta zasada działa
Kolejnym sprawdzianem jest wdrożenie: urzędnicy ds. zamówień, główni dostawcy i dostawcy modeli muszą przełożyć tę klauzulę na praktyczne zasady kontraktowe i inżynieryjne.
Pierwszym sygnałem będzie sposób, w jaki GSA zastosuje dwuczęściowy test zakresu po 19 października. Zaproszenia do składania ofert powinny wskazywać, czy funkcjonalność LLM ma istotne znaczenie oraz czy dane rządowe będą bezpośrednio trafiać do systemu lub z niego wychodzić.
Jasne rozstrzygnięcia wzmocniłyby pogląd, że GSA rzeczywiście zawęziła zakres tej zasady. Rutynowe włączanie jej do umów z powodu ubocznych funkcji AI osłabiłoby ten wniosek i odtworzyło niepewność, którą ostateczne brzmienie próbowało wyeliminować.
Wykonawcy powinni obserwować, czy zaproszenia wyjaśniają, dlaczego klauzula ma zastosowanie. Powinni także analizować, jak urzędnicy ds. zamówień interpretują dwa warunki powodujące automatyczne wyłączenie klauzuli.
Drugim sygnałem będzie jakość przenoszenia obowiązków na podwykonawców. Główni dostawcy potrzebują umów zgodnych z zadaniami cyklu życia NIST oraz z danymi obsługiwanymi przez każdego dostawcę.
Dostawcy modeli i platform chmurowych znajdą się pod presją, by oferować warunki gotowe do zastosowania w administracji publicznej, obejmujące retencję, ograniczenia szkolenia, powiadamianie o incydentach, zmiany modeli, dostęp do ocen i usuwanie danych.
Standaryzowane aneksy ułatwiłyby zgodność mniejszym integratorom. Odmowa przyjęcia takich warunków przez głównych dostawców skoncentrowałaby możliwości federalne wśród firm o większej sile negocjacyjnej lub posiadających dedykowane oferty dla sektora publicznego.
Kolejny test stanowią modele otwarte i open-weight. Ostateczna klauzula rozróżnia modele z kompletnymi publicznie dostępnymi artefaktami od produktów, które udostępniają wyłącznie swoje wagi.
Wykonawcy będą musieli wykazać, że ich klasyfikacje są technicznie poprawne. Niejednoznaczny język marketingowy dotyczący otwartości nie powinien zastępować sprawdzania licencji, dostępności kodu źródłowego, zbiorów danych i dokumentacji.
Trzecim sygnałem będzie sposób, w jaki GSA podchodzi do oceny modeli i niezgodności. Rozsądne starania zapewniają elastyczność, lecz ta elastyczność wymaga powtarzalnych testów i proporcjonalnych środków zaradczych.
Oceny rządowe powinny odzwierciedlać zakupiony przypadek użycia, ujawnioną konfigurację, dostępne dowody i znane ograniczenia techniczne. Pojedynczy adversarialny prompt nie powinien automatycznie definiować działania złożonego wdrożenia.
Jednocześnie dostawcy nie powinni wykorzystywać zmienności modeli jako wymówki dla słabych mechanizmów kontroli. Mogą dokumentować zestawy testowe, zbiory danych ewaluacyjnych, progi weryfikacji przez człowieka, źródła wyszukiwania oraz decyzje dotyczące działań naprawczych.
Organizacje przygotowujące obecnie oferty powinny stworzyć pakiet dowodowy przed rozpoczęciem negocjacji kontraktowych. Powinien on obejmować diagramy architektury, mapy przepływu danych, wykazy podwykonawców, harmonogramy retencji, procedury zmian modeli, wyniki ocen i plany zamknięcia projektu.
Przeszukiwalne archiwum techniczne może pomóc zespołom połączyć te artefakty w obszarach inżynierii, bezpieczeństwa, zamówień i przeglądu prawnego. System nadal musi przestrzegać ograniczeń kontraktowych dotyczących danych rządowych.
Ostateczna zasada GSA dotycząca LLM jest węższa niż jej poprzedniczki, ale nie jest lekka. Jej główny kompromis polega na jaśniejszych granicach w zamian za głębszą rozliczalność, gdy administracja celowo kupuje system LLM.
Dla wykonawców AI bezpośrednie pytanie nie brzmi, czy gdzieś używają generatywnej AI. Chodzi o to, czy administracja kupuje tę funkcję, czy dane rządowe jej dotyczą i czy każdy uczestnik może udowodnić zgodność.
Przed 19 października dostawcy powinni sprawdzić tę odpowiedź w odniesieniu do swojej rzeczywistej architektury i umów. Gdyby dostawca jutro zmienił swój model, czy główny wykonawca potrafiłby określić wpływ tej zmiany, powiadomić GSA, zachować dowody i chronić dane rządowe bez improwizacji?



