Barclays twierdzi, że laboratoria AI przekazują niemal 40% przychodów gigantom chmurowym
Według Barclays firmy tworzące modele AI przekazują około 35–40 dolarów z każdych 100 dolarów przychodu AWS, Microsoft Azure i Google Cloud. Szacunek ten sprawia, że boom na AI staje się bardziej złożoną historią o tym, kto przechwytuje jego wartość ekonomiczną.
Analizę opisało 30 sierpnia kilka mediów, w tym newsflash 36Kr. Przedstawia ona inferencję — obliczenia wykonywane za każdym razem, gdy wdrożony model przetwarza żądanie — jako istotny transfer przychodów z laboratoriów AI do operatorów chmurowych.
Barclays ma szacować, że dostawcy chmury zatrzymują od 10 do 20 dolarów zysku operacyjnego z każdych 100 dolarów zarobionych przez laboratorium AI. Oznaczałoby to marże operacyjne na poziomie od 35% do 45% w przypadku powiązanych przychodów z infrastruktury.
Zaskakujące nie jest to, że firmy AI mają wysokie rachunki za obliczenia. Odwrócenie sytuacji polega na tym, że poprawa ekonomiki modeli nie usunęła firm chmurowych z łańcucha wartości. Laboratoria AI i hyperscalerzy stają się rentowni na tych samych żądaniach, lecz właściciele infrastruktury nadal jako pierwsi pobierają swoją część.
To tworzy główne napięcie stojące za tymi liczbami. OpenAI, Anthropic i inni twórcy modeli chcą przekształcić inteligencję w wysokomarżowy produkt programistyczny. AWS, Azure i Google Cloud dostarczają znaczną część mocy obliczeniowej potrzebnej do jego udostępniania.
Teza o 40 dolarach zmienia sposób odczytywania przychodów AI
Przychody laboratorium AI mogą szybko rosnąć, podczas gdy duża i powtarzalna część natychmiast odpływa jako wydatki na infrastrukturę.
Szacunek Barclays zaczyna się od hipotetycznych 100 dolarów przychodu laboratorium AI. Według doniesień opisujących badanie około 35–40 dolarów trafia na moce inferencyjne dostarczane przez trzy największe platformy chmurowe.
Płatność ta pokrywa sprzęt i systemy wykorzystywane do obsługi odpowiedzi modeli. Systemy te obejmują akceleratory, urządzenia sieciowe, pamięć masową, zasilanie, chłodzenie oraz oprogramowanie służące do planowania obciążeń.
Szacunek nie oznacza, że każda firma AI płaci taki sam odsetek. Koszty laboratorium zależą od architektury modelu, struktury klientów, warunków umów, poziomów wykorzystania, sprzętu oraz zdolności do obsługi własnej infrastruktury.
Agent programistyczny pracujący z dużym repozytorium może zużyć znacznie więcej tokenów niż krótka wymiana zdań z konsumenckim chatbotem. Wdrożenie korporacyjne z rygorystycznymi wymaganiami dotyczącymi opóźnień może też wiązać się z innymi kosztami niż zadanie streszczania wykonywane w tle.
Lepiej rozumieć tę liczbę jako model branżowy, a nie audytowane zestawienie jednej wskazanej firmy. Barclays ma określać analizę mianem „AI Labs & Hyperscaler Unit Economics Primer”, lecz pełny raport instytucjonalny nie jest publicznie dostępny.
Ta luka w dostępie ma znaczenie. Czytelnicy nie mogą niezależnie sprawdzić każdego założenia stojącego za szacunkiem 35–40 dolarów, w tym wolumenu obciążeń, amortyzacji sprzętu, zakontraktowanych rabatów i efektywności modeli.
Publicznie dostępne relacje zasadniczo zgadzają się co do głównych liczb. Oddzielne podsumowanie Barclays również przypisuje udział infrastruktury na poziomie 35–40 dolarów i zysk operacyjny wynoszący 10–20 dolarów badaniom banku.
Powtarzane relacje mogą jednak nadal pochodzić z tego samego dokumentu źródłowego. Nie należy traktować ich jako odrębnych potwierdzeń obliczeń modelu.
Mimo to szacunek oferuje użyteczne ramy do rozumienia ekonomiki AI. Przychód raportowany przez dostawcę modelu nie jest równoznaczny z wartością zatrzymaną po uwzględnieniu inferencji.
Tradycyjne oprogramowanie może obsłużyć dodatkowego użytkownika przy relatywnie niewielkim koszcie krańcowym. Generatywna AI musi wykonywać znaczące obliczenia za każdym razem, gdy użytkownik prosi o odpowiedź, generuje obraz lub powierza zadanie agentowi.
Twórcy modeli mogą obniżać ten koszt poprzez kwantyzację, cache’owanie, batchowanie, routing oraz mniejsze modele wyspecjalizowane. Mogą też negocjować tańszą pojemność lub wdrażać systemy niestandardowe.
Większa efektywność nie obniża jednak automatycznie całkowitych wydatków na infrastrukturę. Niższe koszty mogą zachęcać użytkowników do składania większej liczby żądań, a agenci mogą generować długie sekwencje wywołań modeli bez ciągłego udziału człowieka.
Ten efekt odbicia zmienia znaczenie spadających kosztów tokenów. Koszt jednej jednostki inteligencji może spadać, podczas gdy całkowita liczba kupowanych jednostek rośnie znacznie szybciej.
Model Barclays wychwytuje tę różnicę między efektywnością jednostkową a zagregowanym popytem. Laboratoria AI mogą coraz lepiej obsługiwać każde żądanie, podczas gdy dostawcy chmury nadal sprzedają więcej obliczeń łącznie.
Dlatego teza o 40 dolarach tworzy rzeczywiste napięcie. Sugeruje, że warstwa modeli się rozwija, nie uwalniając się jednak od zależności od warstwy infrastruktury.
Dlaczego marże na inferencji AI rosły tak szybko
Raportowana poprawa marż odzwierciedla tańszą obsługę modeli, lepsze wykorzystanie zasobów i wyższe przychody, a nie zniknięcie kosztów obliczeniowych.
Barclays ma szacować, że marże na płatnej inferencji wzrosły z niskiego poziomu dwucyfrowego w 2025 roku do około 50–65% lub więcej w 2026 roku. Raportowana poprawa skorygowanej marży brutto rok do roku sięga 30–50 punktów procentowych.
Płatna inferencja oznacza wykorzystanie modelu powiązane z przychodami, takie jak wywołania API, subskrypcje lub produkty dla przedsiębiorstw. Marża brutto mierzy przychód pozostający po odjęciu bezpośrednich kosztów zapewnienia takiego wykorzystania.
Kilka mechanizmów może szybko podnieść tę marżę. Nowe akceleratory przetwarzają więcej pracy, a lepsze oprogramowanie utrzymuje ich wykorzystanie przez większą część dnia.
Dostawcy modeli wykorzystują również cache’owanie, aby uniknąć ponownego obliczania powtarzających się informacji. Batchowanie łączy kompatybilne żądania, rozkładając koszty infrastruktury na większą liczbę wyników.
Kwantyzacja zmniejsza precyzję numeryczną wykorzystywaną do reprezentowania parametrów modelu. Może to obniżyć wymagania dotyczące pamięci i obliczeń, choć agresywna kwantyzacja może wpływać na jakość wyników.
Dystylacja szkoli mniejszy model tak, by odtwarzał wybrane zachowania większego modelu. Powstały model może być tańszy w eksploatacji w zadaniach, które nie wymagają maksymalnych możliwości.
Routing dodaje kolejną warstwę efektywności. Usługa może kierować proste żądania do mniejszych modeli, a kosztowne systemy frontierowe rezerwować dla trudnych problemów.
Struktura przychodów ma równie duże znaczenie jak efektywność techniczna. Kontrakty korporacyjne, wysokowartościowe obciążenia programistyczne i produkty rozliczane według użycia mogą generować wyższe przychody z danej ilości infrastruktury.
Liczby Barclays wskazują, że firmy tworzące modele poczyniły znaczące postępy po obu stronach kalkulacji. Wydają się osiągać większe przychody z płatnych żądań, jednocześnie obniżając koszt obliczeniowy przypisany do każdej użytecznej odpowiedzi.
Marża brutto na poziomie 50–65% nie jest jednak równoznaczna z rentownością całej firmy. Laboratoria AI nadal płacą za szkolenie, badania, pracowników, dane, systemy bezpieczeństwa, dystrybucję i działalność ogólną.
Wydatki na szkolenie są szczególnie istotne, ponieważ raportowany model skupia się na ekonomice inferencji. Stworzenie kolejnej generacji modelu może wymagać odrębnej puli zasobów obliczeniowych na długo przed tym, zanim model zacznie generować przychody.
Zachęty sprzedażowe również mogą komplikować obraz. Bezpłatne wykorzystanie, dostęp pakietowy, kredyty promocyjne i umowy o minimalnym wydatku mogą wpływać na relację między rozpoznanym przychodem a faktycznym popytem.
Szacowana poprawa wspiera zatem węższy wniosek. Płatna obsługa modeli ma podobno stawać się rentowną działalnością o wysokiej marży, nawet po uwzględnieniu znacznych kosztów chmury.
To istotna zmiana względem poglądu, że każde dodatkowe zapytanie AI z konieczności pogłębia straty dostawcy. Nie dowodzi ona, że każde duże laboratorium osiągnęło trwałą rentowność netto.
Wyższe marże mogą też przyciągać silniejszą konkurencję. Dostawcy modeli mogą obniżać stawki API, uwzględniać większe wykorzystanie w subskrypcjach lub zużywać dodatkowe zasoby obliczeniowe, by poprawiać jakość odpowiedzi.
Barclays ma oczekiwać, że marże inferencyjne będą stopniowo spadać wraz z nasileniem konkurencji między modelami frontierowymi i dostępnością większej podaży mocy obliczeniowej. Ta prognoza wynika z normalnej logiki rynkowej.
Jeśli kilku dostawców może zapewnić porównywalną inteligencję, klienci zyskują siłę negocjacyjną. Część oszczędności wynikających z efektywności trafia wówczas do nabywców, zamiast pozostawać w laboratorium.
Ta sama presja może być widoczna w projektowaniu produktów. Dostawcy mogą zezwalać na dłuższy kontekst, więcej kroków agenta i dodatkowe rozumowanie w ramach istniejących subskrypcji.
Dodatki te poprawiają produkt, lecz zużywają więcej obliczeń. Mogą zamienić efektywność sprzętową w lepszą usługę, zanim przełoży się ona na trwały zysk.
To mechanizm stojący za raportowanym odwróceniem. Laboratoria AI poprawiły swoje marże, jednak konkurencja może przekształcić część tego zysku w niższe ceny i większe obciążenia.
Giganci chmurowi otrzymują zapłatę niezależnie od tego, który model wygra
AWS, Azure i Google Cloud zajmują korzystną pozycję, ponieważ konkurencja między modelami może zwiększać popyt na infrastrukturę na całym rynku.
Laboratorium AI musi przekonać klientów, że jego modele oferują lepszą wydajność, niezawodność lub integrację. Dostawca chmury może zyskiwać, gdy kilka laboratoriów konkuruje i wszystkie potrzebują więcej obliczeń.
Układ ten przypomina opłatę infrastrukturalną, choć firmy chmurowe również ponoszą znaczne koszty i ryzyko inwestycyjne. Muszą kupować sprzęt i budować centra danych, zanim przyszły popyt stanie się pewny.
Najnowsze ujawnienia finansowe pokazują, dlaczego inwestorzy poważnie traktują pozycję chmurową. Amazon podał, że AWS wygenerował 42,2 mld dolarów sprzedaży w drugim kwartale 2026 roku, o 37% więcej niż rok wcześniej.
AWS wypracował 16,6 mld dolarów kwartalnego zysku operacyjnego, wobec 10,2 mld dolarów rok wcześniej. Liczby te oznaczają marżę operacyjną segmentu na poziomie około 39%.
Amazon podał też, że jego działalność AWS AI przekroczyła roczne tempo przychodów wynoszące 25 mld dolarów. Firma opisała ten biznes jako rosnący w tempie trzycyfrowym rok do roku w swoich wynikach kwartalnych.
Wyniki te nie wyodrębniają przychodów z inferencji spośród innych usług AWS. Nie dowodzą też konkretnego podziału przypisywanego przez Barclays laboratoriom AI.
Pokazują jednak, że duża platforma chmurowa może szybko się rozwijać, jednocześnie generując znaczny zysk operacyjny. W kwartale AWS odpowiadał za większość segmentowego zysku operacyjnego Amazonu.
Microsoft prezentuje inny obraz, ponieważ nie publikuje Azure jako odrębnego segmentu raportowego. Jego dział Intelligent Cloud obejmuje Azure wraz z produktami serwerowymi i korporacyjnymi.
Microsoft podał, że przychody Azure i innych usług chmurowych wzrosły o 43% w kwartale zakończonym 30 czerwca 2026 roku. Roczne przychody Azure przekroczyły 100 mld dolarów i wzrosły o 41%, zgodnie z jego rozmową dotyczącą wyników.
Segment Intelligent Cloud raportował 39,3 mld dolarów kwartalnych przychodów i 16 mld dolarów zysku operacyjnego. Jego marża operacyjna utrzymała się w pobliżu 41%.
Microsoft podał również, że popyt klientów nadal przewyższał dostępną pojemność chmury. Firma uruchomiła 31 centrów danych w kwartale i 88 w roku fiskalnym.
Liczby te wspierają stronę popytową tezy Barclays. Pojemność pozostaje wartościowa, ponieważ klienci są gotowi korzystać z nowej infrastruktury wkrótce po jej udostępnieniu.
Ujawniają również stronę kosztową. Marża brutto Microsoftu w chmurze spadła, ponieważ firma rozbudowywała infrastrukturę AI przed wzrostem popytu i obsługiwała rosnące wykorzystanie produktów.
Marża brutto Microsoft Cloud spadła w ostatnim kwartale do 65%, z 68% rok wcześniej. Ten segment obejmuje więcej niż Azure, więc wskaźnik ten nie może odzwierciedlać czystej rentowności infrastruktury AI.
Google Cloud reprezentuje trzecią strukturę. Google sprzedaje infrastrukturę i aplikacje chmurowe, jednocześnie rozwijając modele Gemini oraz własne układy Tensor Processing Units.
Alphabet podał, że przychody Google Cloud w drugim kwartale 2025 roku wyniosły 13,6 mld USD, co oznacza wzrost o 32%. Zysk operacyjny osiągnął 2,8 mld USD, dając segmentowi 20,7% marży operacyjnej w jego wynikach chmurowych.
Trzy firmy łączą zatem kilka ról ekonomicznych. Sprzedają podstawową infrastrukturę, zarządzane bazy danych, platformy modelowe, aplikacje dla przedsiębiorstw oraz dostęp do modeli własnych lub zewnętrznych.
Ta szerokość oferty zwiększa ich możliwość przechwytywania wartości. Dostawca chmury może uzyskiwać przychody z akceleratora, pamięci masowej, sieci, bazy danych, warstwy bezpieczeństwa i zarządzanej usługi AI stojącej za jedną aplikacją.
Twórca modelu nadal zachowuje istotną siłę negocjacyjną. Najsilniejsze modele przyciągają użytkowników, wpływają na projektowanie aplikacji i mogą negocjować duże umowy na moce obliczeniowe z kilkoma dostawcami.
OpenAI i Anthropic rozszerzyły swoje relacje infrastrukturalne poza pojedynczą platformę. Większa różnorodność dostawców może ograniczyć zależność operacyjną i poprawić siłę negocjacyjną.
Dostawcy chmury konkurują również między sobą. AWS rozwija Trainium i Inferentia, Google oferuje TPU, a Microsoft projektuje własne akceleratory, nadal wdrażając sprzęt zewnętrzny.
Własne układy mogą obniżać koszty i wyróżniać każdą platformę. Mogą też silniej wiązać obciążenia z oprogramowaniem i środowiskiem operacyjnym danego dostawcy.
Podstawowa rywalizacja nie toczy się więc między AWS, Azure i Google Cloud. Chodzi o laboratoria AI dążące do marż charakterystycznych dla oprogramowania oraz właścicieli infrastruktury pobierających powtarzalną część przychodów modeli.
Konkurencja między trzema chmurami wspiera tę rywalizację, lecz jej nie zastępuje. Nawet laboratorium korzystające z kilku dostawców nadal płaci za podstawową pracę obliczeniową.
Czego szacunek Barclays nie dowodzi
Przedstawione liczby opisują wiarygodną strukturę branży, ale nie dostarczają audytowanej ekonomiki dla każdego laboratorium AI ani platformy chmurowej.
Pierwszą niewiadomą są dane źródłowe. Barclays jest dużą instytucją finansową, jednak pełny raport i jego metodologia nie są dostępne na otwartej stronie publicznej.
Publiczne podsumowania pokazują wynik modelu, nie ujawniając wszystkich danych wejściowych. Utrudnia to przetestowanie szacunku względem różnych wolumenów tokenów, założeń dotyczących wykorzystania zasobów i umów na moce obliczeniowe.
Druga niewiadoma dotyczy zakresu księgowego. AWS raportuje przychody segmentu i zysk operacyjny, ale segment ten obejmuje znacznie więcej niż inferencję AI.
Google Cloud również łączy infrastrukturę z aplikacjami Workspace. Segment Intelligent Cloud Microsoftu jest szerszy niż Azure, a Microsoft Cloud obejmuje kilka dodatkowych produktów.
Raportowanych marż operacyjnych chmur nie można bezpośrednio przypisać inferencji AI. Wspólne wydatki na badania, koszty korporacyjne i amortyzacja sprzętu mogą również trafiać do różnych kategorii księgowych.
Dostawca chmury może raportować wysoką marżę segmentu, zarabiając mniej na nowo wdrożonych mocach AI. Dojrzałe usługi pamięci masowej, baz danych i tradycyjnych obliczeń mogą wspierać szerszy wynik.
Możliwa jest również sytuacja odwrotna. Platforma może akceptować niższe marże w krótkim okresie, wypełniając nowe moce i budując większą bazę klientów.
Trzecia niewiadoma dotyczy transferów wewnętrznych i relacji strategicznych. Firma tworząca modele może otrzymywać inwestycje od tego samego dostawcy chmury, który sprzedaje jej moce obliczeniowe.
Kredyty chmurowe, preferencyjny dostęp, umowy o podziale przychodów i inwestycje kapitałowe mogą zacierać prostą relację klient–dostawca. Nominalny rachunek za infrastrukturę może nie odzwierciedlać pełnej ekonomiki po żadnej ze stron.
Czwarta niewiadoma dotyczy zróżnicowania obciążeń. Krótkie zapytanie tekstowe, zadanie generowania obrazu i długotrwały agent programistyczny nie mają porównywalnych kosztów inferencji.
Modele mogą też zużywać dodatkowe zasoby obliczeniowe przed wygenerowaniem odpowiedzi. Systemy rozumowania często wymieniają wyższe wydatki na inferencję na lepszą wydajność w trudnych zadaniach.
Wraz z przesuwaniem się wykorzystania w stronę autonomicznych agentów liczba wywołań modelu na jedno działanie użytkownika może gwałtownie rosnąć. Człowiek może zainicjować jedno zadanie, podczas gdy oprogramowanie wykonuje wiele wyszukiwań, ocen i poprawek.
To sprawia, że kontrola kosztów staje się problemem projektowania aplikacji, a nie wyłącznie problemem modelu. Deweloperzy muszą zdecydować, kiedy odpowiedź wyższej jakości uzasadnia dodatkowe obliczenia.
Nabywcy korporacyjni stają przed podobnym problemem. Niska cena tokena nie gwarantuje niskiego całkowitego rachunku, gdy aplikacja działa dla tysięcy pracowników i w powtarzanych zautomatyzowanych procesach.
Nabywcy powinni monitorować koszt ukończonego zadania, a nie tylko koszt tokena. Tańszy model nie zawsze jest tańszy, jeśli wymaga większej liczby prób, większego nadzoru lub dodatkowej pracy w dalszych etapach.
To rozróżnienie ma także znaczenie przy ocenie deklaracji dotyczących produktywności. System, który wydaje więcej na inferencję, może nadal zapewniać lepszą ekonomikę, jeśli oszczędza wystarczająco dużo czasu pracowników lub zapobiega kosztownym błędom.
Deweloperzy budujący systemy wewnętrzne mogą zachować decyzje stojące za takimi wdrożeniami w przeszukiwalnej technicznej bazie wiedzy. Taki zapis pomaga zespołom porównywać jakość modeli, realizację zadań i koszty operacyjne w czasie.
Piąta niewiadoma dotyczy zachowań cenowych. Spadające koszty inferencji nie gwarantują rosnących marż, gdy dostawcy agresywnie obniżają ceny.
Modele otwarte mogą wywierać dodatkową presję na własnościowe API. Przedsiębiorstwa mogą wdrażać niektóre otwarte modele na wynajętej lub własnej infrastrukturze, choć wtedy przejmują większą odpowiedzialność operacyjną.
Wyspecjalizowani dostawcy chmury również mogą konkurować o obciążenia AI. Mogą oferować atrakcyjny dostęp do akceleratorów, elastyczne umowy lub systemy zaprojektowane wokół węższego zakresu zadań.
Te alternatywy osłabiają założenie, że trzej hiperskalerzy na stałe będą przechwytywać ten sam procent przychodów AI. Nie eliminują jednak konieczności finansowania układów, energii, sieci i pojemności centrów danych.
Według doniesień Barclays oczekuje, że rzeczywiste marże laboratoriów AI przekroczą niektóre z jego szacunków. Pozostaje to oceną modelową, a nie zweryfikowanym ujawnieniem ze strony zaangażowanych laboratoriów.
Szacunek należy więc traktować jako mapę łańcucha wartości. Pokazuje, gdzie prawdopodobnie przepływają przychody, ale nie może rozstrzygnąć, która firma ma najlepszą ekonomikę jednostkową.
Trzy sygnały sprawdzą tezę o zyskach chmurowych
O kolejnej fazie zdecydują ujawniane marże, dywersyfikacja infrastruktury i ilość obliczeń zawartych w produktach AI.
Pierwszym sygnałem jest rentowność chmury podczas dalszej rozbudowy mocy. AWS, Microsoft i Google muszą wykazać, że rosnący popyt na AI może wspierać marże, gdy wydatki na infrastrukturę pozostają wysokie.
Wyniki Amazonu stanowią stosunkowo przejrzysty punkt odniesienia, ponieważ AWS publikuje przychody segmentu i zysk operacyjny. Inwestorzy mogą porównać przyszły wzrost AWS z marżą segmentu i wydatkami gotówkowymi Amazonu.
Microsoft zasługuje na odrębne traktowanie. Wzrost Azure może pozostać silny, nawet gdy szersza marża brutto chmury spada, ponieważ Microsoft buduje moce i obsługuje większe wykorzystanie AI.
Wskaźniki inwestorskie firmy investor metrics podały 65% marży brutto Microsoft Cloud w ostatnim kwartale. Przyszłe ujawnienia pokażą, czy wzrost efektywności zrównoważy koszty intensywniejszego wdrażania AI.
Jeśli marże chmurowe pozostaną stabilne, podczas gdy przychody związane z AI będą rosły, teza Barclays stanie się silniejsza. Wskazywałoby to, że dostawcy infrastruktury mogą absorbować duże inwestycje bez rezygnacji ze swojej ekonomiki.
Utrzymujący się spadek marż osłabiłby tę tezę. Sugerowałby, że konkurencja, amortyzacja, energia i nowe moce pochłaniają większą część przychodów AI, niż zakłada model.
Drugim sygnałem jest to, czy czołowe laboratoria AI przeniosą istotne obciążenia inferencyjne poza AWS, Azure i Google Cloud. Dywersyfikacja może obejmować wyspecjalizowanych dostawców, własne obiekty lub szersze umowy dotyczące własnego sprzętu.
Laboratorium nie musi porzucać hiperskalerów, aby zyskać siłę negocjacyjną. Potrzebuje jedynie wiarygodnych alternatyw dla kolejnego bloku mocy.
Długoterminowe umowy będą miały większe znaczenie niż ogłoszenia. Kluczowym dowodem jest to, gdzie faktycznie działają nowe obciążenia produkcyjne, a nie gdzie firma przeprowadza ograniczony test techniczny.
Według doniesień Barclays oczekuje, że niektóre projekty infrastrukturalne wspierane przez zobowiązanych klientów odbiorą udział trzem największym dostawcom. Jeśli tak się stanie, szacowany transfer od 35 do 40 USD może zostać szerzej rozdzielony.
Giganci chmurowi mogą odpowiedzieć niższymi stawkami, własnymi układami, finansowaniem lub głębszą integracją oprogramowania. Każda odpowiedź mogłaby utrzymać wolumen obciążeń, jednocześnie zmniejszając zarabianą na nim marżę.
Jeśli największe laboratoria nadal będą zawierać swoje największe zobowiązania produkcyjne z tymi samymi trzema platformami, pozycja chmur pozostanie nienaruszona. Dywersyfikacja dostawców bez migracji obciążeń niewiele zmieni.
Trzecim sygnałem jest to, ile inferencji dostawcy wliczają w każdy produkt. Firmy tworzące modele mogą utrzymywać marże dzięki rozliczeniom zależnym od użycia, ostrzejszym limitom i kierowaniu ruchu do tańszych systemów.
Mogą zamiast tego konkurować, oferując dłuższe konteksty, więcej działań agentowych i większy wysiłek rozumowania w ramach tej samej subskrypcji. Taka strategia może zwiększać wartość dla klientów, jednocześnie zmniejszając marże.
Zakupy AI przez przedsiębiorstwa ułatwią obserwowanie tego sygnału. Nabywcy coraz częściej oceniają łącznie skuteczne ukończenie zadań, opóźnienia, bezpieczeństwo i przewidywalność wydatków.
Produkt, który obniża koszt inferencji bez zachowania jakości wyników, nie stworzy trwałej wartości. Produkt, który poprawia jakość bez kontrolowania całkowitego zużycia, może stać się trudny do skalowania.
Zespoły powinny śledzić wybór modelu, prompty, wyniki, zatwierdzenia i rezultaty biznesowe w jednym powtarzalnym przepływie pracy. Ustrukturyzowany przepływ pracy AI może pomóc ujawnić, czy dodatkowe użycie modelu rzeczywiście poprawia gotową pracę.
Szacunek Barclays ostatecznie przeformułowuje debatę o zyskach AI. Zgodnie z raportowanymi liczbami laboratoria modeli nie tylko spalają pieniądze na każdym płatnym żądaniu.
Dostawcy chmury również nie są biernymi sprzedawcami. Finansują i obsługują fizyczne systemy, które umożliwiają każde żądanie, a następnie pobierają znaczną część przychodów modeli.
Rozstrzygające pytanie brzmi, czy laboratoria AI zdołają szybciej zmniejszyć udział infrastruktury, niż konkurencja zmusi je do wydania oszczędności. Warto obserwować kolejne wyniki finansowe chmur, duże umowy na moce i zmiany limitów użycia produktów.
Te sygnały pokażą, czy niemal 40 USD z każdych 100 USD pozostanie trwałą opłatą chmurową, czy też stanie się tymczasową cechą rozbudowy infrastruktury AI.



