AT&T obniża koszty AI o 90% dzięki routowaniu modeli i otwartym modelom
AT&T twierdzi, że obniżyło niektóre koszty sztucznej inteligencji nawet o 90%, mimo że średnio przetwarza 45 miliardów tokenów dziennie. Deklaracja trafiająca do czytelników Google News jest uderzająca, lecz ważniejszy od samego procentu jest mechanizm.
Firma nie znalazła jednego tańszego modelu, który mógłby zastąpić wszystkie systemy premium. Zbudowała bramę wybierającą różne modele zależnie od przewidywanego poziomu trudności, szybkości, jakości i kosztu każdego żądania.
Podejście to podważa założenie, że przedsiębiorstwa powinny standaryzować się na jednym modelu czołowym od OpenAI, Anthropic, Google lub innego dużego dostawcy. AT&T zamiast tego łączy systemy komercyjne z mniejszymi otwartymi modelami trenowanymi do pracy w telekomunikacji.
Strategia wiąże się z wyraźnym kompromisem. Wybór modelu może obniżyć wydatki na inferencję i zmniejszyć zależność od jednego dostawcy. Tworzy jednak również złożoną warstwę operacyjną, która musi oceniać jakość, bezpieczeństwo, opóźnienia i awarie w wielu systemach.
Wyniki AT&T pozostają deklaracjami firmy, a publicznie dostępne dowody nie zapewniają pełnego niezależnego audytu. Mimo to skala działania firmy sprawia, że to coś więcej niż kolejny korporacyjny eksperyment z AI.
AT&T wdrożyło router modeli do produkcji
Kluczowa zmiana w AT&T nie polega wyłącznie na wdrożeniu otwartych modeli. Firma umieściła wybór modelu między pracownikami, aplikacjami a modelami odpowiadającymi na ich żądania.
Dyrektor ds. danych i AI w AT&T, Andy Markus, opisał tę strategię w opublikowanym 23 lipca firmowym wpisie o ekonomice AI. Według tej aktualizacji kosztów AI firma przetwarza średnio 45 miliardów tokenów dziennie.
Token to niewielka jednostka tekstu lub danych przetwarzana przez model. Wolumen tokenów jest użyteczną miarą operacyjną, ponieważ większość hostowanych usług AI nalicza opłaty na podstawie zużycia wejścia i wyjścia.
Wysyłanie każdego tokenu do najbardziej zaawansowanego modelu byłoby proste. Oznaczałoby jednak marnowanie kosztownej zdolności rozumowania na rutynowe zadania ekstrakcji, klasyfikacji, podsumowywania i przygotowywania danych.
Własna AI Gateway AT&T ma zapobiegać temu marnotrawstwu. Brama korzysta z routowania uwzględniającego pamięć podręczną, sprawdzając przed wyborem modelu, czy istnieją już informacje możliwe do ponownego użycia.
W każdej turze system równoważy oczekiwaną jakość odpowiedzi ze szybkością i kosztem. Może też zmieniać modele podczas rozmowy wieloturowej, zamiast utrzymywać całą sesję u jednego dostawcy.
Ta możliwość zmiany w trakcie sesji jest istotna. Rozmowa może zacząć się od podstawowego wyszukiwania, przejść do wyspecjalizowanej analizy sieci, a zakończyć złożoną rekomendacją.
Statyczne przypisanie potraktowałoby te kroki jako jedno obciążenie. Dynamiczne routowanie może wysyłać je do różnych systemów, zależnie od ich wymagań.
AT&T twierdzi, że proces ten obniżył istotne koszty AI nawet o 90% i już przynosi oszczędności liczone w milionach. Te stwierdzenia dotyczą użycia produkcyjnego, a nie laboratoryjnego benchmarku.
AT&T nie podało jednak publicznie punktu odniesienia stojącego za wynikiem 90%. Nie ujawniło udziału ruchu, który uzyskuje maksymalną redukcję, ani szczegółowego porównania jakości.
Dlatego deklarację należy odczytywać jako zgłoszony przez firmę wynik z górnej granicy. Nie należy traktować jej jako gwarantowanej oszczędności dla każdej aplikacji lub przedsiębiorstwa.
Nawet przy tym ograniczeniu ujawniony wolumen nadaje wynikowi wagę. Niewielkie usprawnienia routowania kumulują się, gdy firma przetwarza dziesiątki miliardów tokenów każdego dnia.
System odzwierciedla także wcześniejsze decyzje architektoniczne AT&T. Ask AT&T początkowo korzystał z technologii OpenAI, lecz operator zaprojektował go tak, aby wspierał algorytmy innych firm.
Ta elastyczność była widoczna, gdy uruchomiono Ask AT&T w 2023 roku. Wewnętrzny asystent wspierał programowanie, obsługę klienta, tłumaczenia, wyszukiwanie dokumentów, optymalizację sieci i pracę z oprogramowaniem legacy.
Obecna brama AT&T przekształca tę opcjonalność w politykę operacyjną. Aplikacje nie muszą już samodzielnie podejmować każdej decyzji dotyczącej modelu.
Brama staje się punktem kontroli routowania, buforowania, pomiaru i zarządzania. Może stosować spójne zasady, nawet gdy dostawcy wypuszczają nowe modele lub zmieniają warunki świadczenia usług.
Dlatego historia pojawiająca się w Google News jest czymś więcej niż komunikatem o obniżaniu kosztów. AT&T traktuje wybór modelu jako infrastrukturę przedsiębiorstwa, a nie ustawienie aplikacji.
Dlaczego routowanie modeli zmienia ekonomię AI w przedsiębiorstwach
Router przesuwa konkurencję od poszukiwania jednego uniwersalnie lepszego modelu w kierunku znalezienia najtańszego modelu spełniającego wymagania każdego zadania.
Wdrażanie AI w przedsiębiorstwach często zaczyna się od prostego wzorca. Zespół wybiera wiodący hostowany model, łączy go z informacjami firmowymi i rozszerza dostęp po udanym pilotażu.
Koszty stają się trudniejsze do przewidzenia, gdy wykorzystanie wykracza poza pracowników zadających okazjonalne pytania. Zautomatyzowane przepływy pracy mogą generować powtarzalne prompty, długie konteksty, wywołania narzędzi, ponowienia i pośrednie wyniki.
Agenci zwiększają tę presję, ponieważ jedno żądanie użytkownika może uruchomić wiele wywołań modelu. Przepływ pracy może pobierać rekordy, klasyfikować dokumenty, tworzyć plan, wywoływać narzędzia programowe, sprawdzać wyniki i poprawiać odpowiedź.
Użytkownik widzi jedno ukończone zadanie. Przedsiębiorstwo płaci za każdy krok niezbędny do jego wykonania.
Router AT&T rozwiązuje ten problem przed wystąpieniem zużycia. Próbuje wybrać odpowiedni model w każdej turze, zamiast analizować nadmierne wydatki po otrzymaniu faktury.
Można to porównać do przydzielania pracy mieszanemu zespołowi. Rutynowe prośby nie zawsze wymagają najbardziej wyspecjalizowanego eksperta, podczas gdy trudne decyzje nadal uzasadniają eskalację.
Analogia ma ograniczenia, ponieważ router musi dokonywać tej oceny automatycznie. Błędna decyzja może skutkować słabą odpowiedzią, zanim ktokolwiek rozpozna, że potrzebny był silniejszy model.
AT&T twierdzi, że jego brama szacuje oczekiwaną jakość wyniku obok kosztu i szybkości. Ten próg jakości jest centralnym elementem, choć większą uwagę przyciąga procent oszczędności.
Routowanie oparte wyłącznie na koszcie konsekwentnie faworyzowałoby najmniejszy dostępny model. Routowanie produkcyjne musi natomiast wskazać najtańszą opcję, która pozostaje akceptowalna dla konkretnego zadania.
Powstały system może dać przedsiębiorstwom większą siłę negocjacyjną. Firma zdolna przenosić obciążenia między dostawcami odczuwa mniejszą presję, by akceptować ograniczenia techniczne lub warunki handlowe jednego dostawcy.
Strategia zmienia także sposób budowania aplikacji. Deweloperzy mogą żądać określonej możliwości lub poziomu usługi, bez trwałego wiązania każdej funkcji z jednym modelem.
Ta abstrakcja może skrócić przyszłe migracje. Może też pozwolić zespołom oceniać nowy model na tle kategorii obciążeń produkcyjnych, zanim otrzyma on szerszy dostęp.
Podejście AT&T nadaje modelom czołowym węższą rolę. Stają się one celami eskalacji dla żądań intensywnie korzystających z rozumowania, a nie domyślnymi silnikami każdej interakcji.
Nie oznacza to, że systemy czołowe tracą wartość. Oznacza, że ich wartość musi odpowiadać pracy, której mniejsze modele nie potrafią niezawodnie wykonać.
Niezależni obserwatorzy postrzegają to podejście jako część szerszego wzorca w przedsiębiorstwach. Roy Chua, główny analityk AvidThink, powiedział Mobile World Live, że wiodące przedsiębiorstwa używają bram routujących do kontroli kosztów, bezpieczeństwa, buforowania i audytu.
Założyciel Futuriom, Scott Raynovich, argumentował, że otwarte modele mogą obsługiwać zastrzeżone dane przedsiębiorstw bez uzależniania firm od najdroższych systemów czołowych.
Komentarze te wspierają tę architekturę, lecz nie potwierdzają niezależnie zgłoszonych przez AT&T oszczędności. Rozróżnienie jest ważne, ponieważ architektura i zmierzone wyniki biznesowe to odrębne kwestie.
Router koncentruje także władzę. Ten, kto kontroluje bramę, decyduje o tym, które modele otrzymują ruch, jakie progi jakości obowiązują i jak obsługiwane są awarie.
Ta pozycja staje się strategicznie cenna. Dostawcy modeli konkurują w zakresie inteligencji, podczas gdy warstwy routowania obserwują popyt w aplikacjach i u dostawców.
Router może nauczyć się, który model dobrze radzi sobie z programowaniem, obsługą klienta, standardami telekomunikacyjnymi, analizą oszustw lub ekstrakcją dokumentów. Ta historia działania staje się użytecznymi danymi operacyjnymi.
Dla nabywców korporacyjnych wniosek jest praktyczny. Same benchmarki modeli nie mogą wyjaśnić ekonomiki produkcyjnego programu AI.
Skład obciążeń ma równie duże znaczenie. Organizacja musi wiedzieć, które zadania są częste, które kosztowne, a które rzeczywiście wymagają rozumowania na poziomie modeli czołowych.
Zespoły potrzebują również możliwych do prześledzenia kryteriów oceny. Bez nich routowanie może stać się nieprzejrzystym mechanizmem, który po cichu wymienia jakość odpowiedzi na niższe zużycie.
Wyszukiwalny przepływ pracy AI może pomóc zespołom zachowywać decyzje, dowody i wyniki. Taki zapis staje się ważniejszy, gdy do jednego procesu przyczynia się kilka modeli.
Relacje Google News mogą sprawić, że wynik 90% będzie wyglądał na pojedynczy przełom techniczny. Faktyczna metoda AT&T jest ciągłą dyscypliną obejmującą klasyfikację, ocenę, buforowanie i pomiar obciążeń.
Otwarte modele telekomunikacyjne dają AT&T kolejną dźwignię kosztową
Routowanie ogranicza niepotrzebne zużycie, a wyspecjalizowane otwarte modele zapewniają routerowi tańsze opcje rozumiejące terminologię i operacje telekomunikacyjne.
AT&T połączyło swoją bramę z OTel 2.0, rodziną otwartych modeli dostosowanych do telekomunikacji. Firma opracowała modele z wykorzystaniem danych branżowych i mieszanki platform obliczeniowych.
Model wyspecjalizowany dziedzinowo jest trenowany lub dostosowywany do ograniczonego obszaru, a nie do ogólnej rozmowy. Jego węższe ukierunkowanie może poprawiać wyniki w pracy ze specjalistycznym słownictwem, dokumentami i pytaniami operacyjnymi.
Telekomunikacja stanowi trudny test. Modele mogą potrzebować interpretować standardy techniczne, topologię sieci, telemetrię sprzętu, konfiguracje radiowe i systemy wielu dostawców.
Model ogólny może szeroko omawiać te zagadnienia. Nadal może mu jednak brakować precyzji potrzebnej w operacjach sieciowych, gdzie wiarygodnie brzmiąca, lecz błędna odpowiedź może prowadzić do poważnych konsekwencji.
GSMA Intelligence argumentuje, że modele dostosowane do dziedziny mogą być mniejsze, a zarazem konkurencyjne w zadaniach telekomunikacyjnych. Jego analiza OTel przedstawia strategię AT&T jako alternatywę dla kierowania każdego żądania do ogólnego modelu czołowego.
AT&T twierdzi, że przeprowadziło dodatkowe trenowanie OTel 2.0 na ponad 400 miliardach tokenów z użyciem GPU AMD. Szerszy proces rozwoju przetworzył około biliona tokenów.
Microsoft podaje, że AT&T korzystało z około 530 GPU za pośrednictwem Foundry Managed Compute. Łącznie obejmowało to 430 GPU AMD Instinct MI300X oraz wiele architektur sprzętowych.
Proces rozwoju modeli rozdzielał także pracę pomiędzy kilka otwartych modeli. Phi-4 firmy Microsoft obsługiwał przygotowanie danych i generowanie danych syntetycznych, przetwarzając miesięcznie ponad 700 miliardów tokenów.
Inne modele wspierały zadania związane z rozumowaniem i rozwojem. Odzwierciedla to filozofię bramy produkcyjnej: jeden model nie musi dominować na każdym etapie.
Microsoft twierdzi, że generowanie danych przez otwarte modele pozwoliło zaoszczędzić dziesiątki milionów w porównaniu z użyciem modeli czołowych do tej samej pracy rozwojowej. Jest to porównanie zgłoszone przez partnera, a nie neutralny audyt finansowy.
Mimo to konto Microsoft zawiera więcej szczegółów technicznych niż krótsze ogłoszenie AT&T. Pokazuje, że wybór modelu i sprzętu traktowano jako powiązane decyzje.
Otwarte modele mogą działać na dedykowanej infrastrukturze, a nie wyłącznie za pośrednictwem interfejsu programowania aplikacji kontrolowanego przez dostawcę. Firmy mogą więc oceniać różne kombinacje modeli, akceleratorów, chmur i systemów lokalnych.
Ta elastyczność wspiera deklarowane przez AT&T zainteresowanie suwerennością. W tym kontekście suwerenność oznacza kontrolę nad przepływami danych, decyzjami wdrożeniowymi i zależnościami od dostawców.
Nie oznacza to, że AT&T wyeliminowało technologie zewnętrzne. Projekt wykorzystuje infrastrukturę Microsoft, sprzęt AMD, dane GSMA oraz modele bazowe stworzone gdzie indziej.
Lepiej rozumieć tę strategię jako zdywersyfikowaną zależność. AT&T stara się zapobiec sytuacji, w której jakikolwiek pojedynczy model, dostawca chipów, chmura lub środowisko programistyczne stanie się niezastąpione.
Takie podejście może poprawić pozycję negocjacyjną. Jeśli firma wykaże porównywalne wyniki na kilku platformach, zmiana dostawcy staje się bardziej wiarygodna podczas rozmów zakupowych.
Otwarte modele pozwalają również na głębsze dostosowanie do domeny. AT&T może trenować na zatwierdzonych materiałach telekomunikacyjnych i dostrajać ocenę do zadań specyficznych dla sieci.
GSMA podaje, że początkowy materiał źródłowy obejmował standardy i dokumenty branżowe. Wśród współtwórców znalazły się organizacje i projekty zajmujące się sieciami radiowymi, interfejsami, API i operacjami telekomunikacyjnymi.
Rodzina modeli ma być również przeznaczona do szerszego wykorzystania w branży. Udostępnienie rezultatów innym może zachęcić do wspólnych testów, rozszerzeń i wyspecjalizowanych zastosowań.
Jednak określenie „open source” wymaga w AI ostrożnej interpretacji. Wydanie może udostępniać wagi i prawa do użycia bez ujawniania każdego rekordu treningowego, decyzji filtrujących czy metody rozwoju.
Organizacje oceniające OTel 2.0 muszą sprawdzić jego faktyczną licencję, dokumentację, ujawnienia dotyczące danych i wymagania wdrożeniowe. Sama etykieta nie odpowiada na pytania dotyczące zarządzania.
Skala procesu treningowego pokazuje również, że otwartość nie oznacza braku kosztów. Dedykowane GPU, praca inżynierów, kontrole bezpieczeństwa, ocena i bieżące wnioskowanie generują koszty.
AT&T może uzasadnić te inwestycje, ponieważ działa na nietypową skalę. Mniejsza firma mogłaby wydać więcej na budowę i zarządzanie portfolio modeli, niż zaoszczędziłaby dzięki routowaniu.
Ta różnica skali ogranicza możliwość bezpośredniego naśladowania. Uniwersalną ideą nie jest to, że każda firma powinna trenować model telekomunikacyjny.
Szersza lekcja polega na łączeniu wyboru modelu z dowodami specyficznymi dla obciążenia. Przedsiębiorstwo powinno korzystać z otwartego modelu tam, gdzie wydajność domenowa, kontrola i ekonomika operacyjna uzasadniają dodatkową odpowiedzialność.
Oszczędność 90% nadal wymaga audytu jakości
AT&T ujawniło wiarygodny mechanizm i znaczną skalę operacyjną, lecz nie opublikowało wystarczających dowodów, aby niezależnie zweryfikować główny wynik.
Pierwsza niepewność dotyczy zakresu. „Nawet 90%” opisuje najsilniejsze zgłoszone ograniczenie, a niekoniecznie średnią dla całego środowiska AI AT&T.
Publiczne ujawnienia nie wskazują bazowej mieszanki modeli. Nie pokazują też, jaka część ruchu trafiła do mniejszych modeli, jak często router eskalował zadania ani jak oszczędności różniły się między aplikacjami.
Druga niepewność dotyczy jakości. AT&T twierdzi, że routowanie nie pogarsza jakości, lecz czytelnicy nie mogą sprawdzić progów akceptacji na poziomie zadań ani wyników ocen.
To pominięcie jest istotne, ponieważ jakość nie jest jedną miarą. Podsumowanie obsługi klienta, rekomendacja dotycząca sieci, poprawka oprogramowania i alert o oszustwie wymagają różnych standardów.
Router może obniżyć średnie wydatki, kierując więcej ruchu do mniejszych modeli. Wynik ma wartość tylko wtedy, gdy modele te pozostają niezawodne w przydzielonych im zadaniach.
Ocena musi również wykrywać rzadkie błędy. Średni wynik może ukrywać niewielką liczbę kosztownych pomyłek w operacjach sieciowych lub procesach regulowanych.
Nadzór człowieka pozostaje ważny. Gdy uruchomiono Ask AT&T, Markus powiedział, że eksperci dziedzinowi nadal muszą weryfikować wygenerowany kod i inne istotne rezultaty.
Routowanie nie usuwa tego wymogu. Dodaje kolejną decyzję, którą zespoły muszą monitorować, ponieważ aplikacja może zachowywać się inaczej po zmianie wybranego modelu.
Działanie uwzględniające pamięć podręczną rodzi powiązane obawy. Ponowne wykorzystanie wcześniejszych obliczeń może ograniczyć zużycie, ale dane z pamięci podręcznej muszą pozostać aktualne, właściwie ograniczone i chronione.
Odpowiedź odpowiednia dla jednego pracownika lub klienta nie może automatycznie zostać ponownie użyta dla innego. Tożsamość, uprawnienia, położenie geograficzne i zasady retencji danych muszą być uwzględnione w żądaniu.
Zespoły bezpieczeństwa muszą również ocenić każdego połączonego dostawcę i model. System wielomodelowy tworzy więcej integracji, danych uwierzytelniających, logów, granic polityk i możliwych trybów awarii.
Brama może centralizować te mechanizmy kontrolne, co jest zaletą. Centralizacja sprawia jednak również, że brama staje się celem o wysokiej wartości i krytyczną zależnością.
Jeśli jej logika klasyfikacji zawiedzie, wrażliwe zadanie może trafić do niezatwierdzonego modelu. Jeśli usługa stanie się niedostępna, wiele aplikacji zależnych może zawieść jednocześnie.
Opóźnienie stanowi kolejny kompromis. Router musi przeanalizować wystarczającą ilość informacji, aby wybrać model, a złożona ocena może opóźnić odpowiedź.
Pamięć podręczna może zrównoważyć część opóźnienia, podczas gdy mniejsze modele mogą odpowiadać szybciej. Łączny wynik zależy od narzutu routowania, projektu aplikacji i wybranego modelu.
Różnorodność dostawców również tworzy pracę operacyjną. Dostawcy stosują różne interfejsy, limity kontekstu, formaty wywoływania narzędzi, mechanizmy bezpieczeństwa i harmonogramy aktualizacji.
Brama może znormalizować część tych różnic. Nie może zagwarantować, że dwa modele będą identycznie interpretować każdą instrukcję lub format ustrukturyzowanego wyniku.
Aktualizacje modeli sprawiają, że problem jest ciągły. Trasa, która działała dobrze w ubiegłym miesiącu, może stać się gorsza po zmianie zachowania przez dostawcę lub wydaniu zamiennika.
AT&T musi zatem utrzymywać oceny, zamiast certyfikować każdą trasę tylko raz. Ślady produkcyjne powinny ujawniać wskaźniki awarii, eskalacje, opóźnienia i korekty dokonywane przez ludzi według obciążenia.
Wdrożenia otwartych modeli dodają kwestie związane z łańcuchem dostaw. Zespoły muszą śledzić wagi, biblioteki, licencje, pochodzenie modeli i podatności w całym stosie obsługującym.
Jakość danych stanowi kolejne ograniczenie. Model telekomunikacyjny trenowany na standardach i materiałach syntetycznych może nadal dziedziczyć luki, nieaktualne założenia lub słabe pokrycie nietypowego sprzętu.
Wynik w rankingu daje użyteczne dowody, ale nie odtwarza wszystkich warunków działającej sieci. Oceny produkcyjne muszą odzwierciedlać własne dane, narzędzia i konsekwencje operacyjne AT&T.
Ostatnia niepewność ma charakter organizacyjny. Technicznie poprawny router nie naprawi niejasnego procesu ani aplikacji bez osób odpowiedzialnych.
Kadra kierownicza AT&T podkreślała kompleksowe przepływy pracy zamiast odizolowanych zadań AI. To rozróżnienie ma znaczenie, ponieważ lokalne oszczędności mogą zniknąć, gdy pracownicy muszą później naprawiać słabe wyniki.
Firmy rozważające podobne systemy powinny obliczać całkowity koszt procesu. Rachunek powinien obejmować zużycie modeli, infrastrukturę, oceny, inżynierię, bezpieczeństwo, przeglądy i odzyskiwanie po awariach.
Powinny również porównywać zakończone rezultaty, a nie tylko tokeny. Tańsza odpowiedź nie jest ekonomiczna, jeśli powoduje kolejny kontakt, kolejne uruchomienie modelu lub ręczne poprawki.
Żadne z tych ryzyk nie podważa wyniku AT&T. Wyjaśniają one, dlaczego zgłoszony odsetek powinien rozpoczynać proces należytej staranności, a nie go kończyć.
Dla czytelników Google News odpowiedzialna interpretacja jest wąska. AT&T twierdzi, że jego brama przyniosła redukcje sięgające 90%, lecz szersza możliwość zastosowania pozostaje niezweryfikowana.
Na co zwrócić uwagę po deklaracji AT&T dotyczącej kosztów AI
Trzy sygnały pokażą, czy AT&T zbudowało powtarzalną architekturę dla przedsiębiorstw, czy udokumentowało wyjątkowo korzystny zestaw obciążeń.
Pierwszym sygnałem jest bardziej szczegółowa karta wyników produkcyjnych. AT&T powinno ujawnić średnie oszczędności w kategoriach obciążeń, a nie tylko największą redukcję.
Użyteczne raportowanie rozdzielałoby obsługę klienta, programowanie, wyszukiwanie dokumentów, analizę sieci, wykrywanie oszustw i autonomiczne przepływy pracy. Każda kategoria ma inny próg jakości i profil modelu.
Mocna karta wyników obejmowałaby wskaźniki eskalacji, opóźnienia, błędów i korekt dokonywanych przez ludzi. Pokazałaby również, czy zużycie nadal rośnie po spadku kosztów jednostkowych.
Jeśli średnie koszty pozostaną pod kontrolą przy rosnącym wolumenie, argument AT&T za routowaniem modeli stanie się silniejszy. Jeśli oszczędności skupiają się w niewielkiej grupie prostych zadań, twierdzenie staje się mniej przenośne.
Drugim sygnałem jest niezależna ocena OTel 2.0. Rankingi branżowe stanowią punkt wyjścia, ale operatorzy potrzebują testów powiązanych z rzeczywistymi decyzjami sieciowymi.
Ewaluatorzy powinni porównać model z większymi systemami ogólnego przeznaczenia pod względem interpretacji standardów, analizy topologii, rozumowania na podstawie telemetrii, rozwiązywania problemów i użycia narzędzi.
Powinni również udokumentować, gdzie mniejszy model zawodzi. Godny zaufania model domenowy potrzebuje jasnych granic eskalacji, a nie tylko wysokich wyników zbiorczych.
Wdrożenie OTel 2.0 poza AT&T dostarczyłoby kolejnej formy dowodów. Inni operatorzy mogą sprawdzić, czy jego zgłoszone zalety utrzymują się w różnych sieciach, u różnych dostawców, w różnych językach i regulacjach.
Znaczące wdrożenie zewnętrzne wsparłoby argument AT&T, że wyspecjalizowane otwarte modele mogą służyć branży. Ograniczona adopcja sugerowałaby, że ekonomika w dużej mierze zależy od skali AT&T i jego danych wewnętrznych.
Trzecim sygnałem jest reakcja dostawców modeli czołowych i infrastruktury. Strategia AT&T wywiera na nich presję, by uzasadniali koszt premium dla każdego obciążenia.
Dostawcy mogą odpowiedzieć mniejszymi modelami, systemami o niższym opóźnieniu, lepszym buforowaniem, zautomatyzowanym routowaniem lub bardziej przewidywalnymi kontraktami dla przedsiębiorstw. Mogą też poprawić adaptację do domeny i opcje prywatnego wdrożenia.
Konkurencja na warstwie routowania zasługuje na szczególną uwagę. Firmy chmurowe, dostawcy modeli, niezależne bramy i dostawcy oprogramowania dla przedsiębiorstw chcą wpływać na wybór modelu.
Jeśli routowanie stanie się standaryzowane, przedsiębiorstwa będą mogły swobodniej przenosić obciążenia. Jeśli każda platforma opracuje własny router, zależność od dostawcy może po prostu przesunąć się wyżej.
Różnorodność sprzętu również będzie mieć znaczenie. Wykorzystanie przez AT&T AMD i innych architektur sprawdza, czy przedsiębiorstwa mogą uniknąć uzależnienia ekonomiki AI od jednego planu rozwoju akceleratorów.
Spójna wydajność na różnych sprzętach wzmocniłaby argument suwerenności. Trudne migracje lub nierówne wsparcie oprogramowania ujawniłyby koszt utrzymania tej elastyczności.
Doświadczenie AT&T daje również nabywcom korporacyjnym praktyczną listę kontrolną. Mogą zacząć od mierzenia żądań według zadania, ryzyka, opóźnienia, jakości i ukończonego wyniku biznesowego.
Następnie mogą sprawdzić, czy mniejsze modele spełniają wymagania wąsko zdefiniowanych obciążeń. Dopiero wtedy powinni wprowadzić automatyczne routowanie między zatwierdzonymi opcjami.
Zarządzanie musi pojawić się przed szerokim ruchem. Zespoły potrzebują kontroli dostępu, logów, bramek oceny, reguł awaryjnych, procedur incydentowych i wyznaczonych właścicieli każdej trasy produkcyjnej.
Celem nie jest maksymalizacja udziału żądań obsługiwanych tanio. Chodzi o minimalizację kosztu akceptowalnej, ukończonej pracy.
To rozróżnienie utrzymuje zgodność routera z wynikami biznesowymi. Zapobiega też temu, by cel kosztowy po cichu osłabiał obsługę klienta, niezawodność sieci lub zaufanie pracowników.
AT&T przedstawiło jeden z najjaśniejszych przykładów tej architektury w dużym przedsiębiorstwie. Połączenie 45 miliardów tokenów dziennie, dynamicznego routowania i modeli specyficznych dla domeny zasługuje na uwagę.
Firma nie wykazała, że każda organizacja może odtworzyć redukcję o 90%. Pokazała, dlaczego płacenie jednemu modelowi za obsługę każdego zadania staje się trudne w skali produkcyjnej.
Kolejna faza będzie zależeć od dowodów, a nie od kolejnego nagłówka. Warto obserwować średnie oszczędności, zewnętrzną walidację OTel 2.0 oraz reakcje dostawców na zakupy obejmujące wiele modeli.
Te sygnały zdecydują, czy deklaracja Google News stanie się branżowym podręcznikiem działania, czy pozostanie imponującym wynikiem ukształtowanym przez nietypową skalę AT&T. Zespoły przedsiębiorstw powinny już teraz zacząć mierzyć własną strukturę obciążeń, zanim wybiorą router lub rozpoczną trenowanie kolejnego modelu.



