Sieciowanie scale-across napotyka barierę kosztów centrów danych AI
Google News uwidoczniło 11 sierpnia kluczowy konflikt: klastry AI potrzebują więcej przestrzeni i mocy, lecz połączenie wielu lokalizacji może zniweczyć związane z tym korzyści ekonomiczne.
Punktem wyjścia była dyskusja Data Center Dynamics oraz panel branżowy poświęcony data center interconnect, czyli DCI, które przenosi ruch między obiektami. W sesji z marca 2026 roku uczestniczyły Google, Meta, Nokia, Lumen Technologies i Zayo. Łączący je problem miał większe znaczenie niż kolejny wzrost deklarowanej przepustowości.
Twórcy AI coraz częściej chcą, by wiele budynków działało jak jeden system obliczeniowy. Takie podejście, określane jako sieciowanie scale-across, może pokonać fizyczne ograniczenia pojedynczego obiektu. Jednocześnie naraża kosztowne akceleratory na awarie światłowodów, przeciążenia, dystans i opóźnienia synchronizacji.
Sednem rywalizacji są więc koszty i wydajność. Operatorzy mogą umieszczać moce obliczeniowe w pobliżu dostępnej energii i rozdzielać je między kilka lokalizacji. Muszą jednak zbudować sieć optyczną wystarczająco szybką i niezawodną, aby drogie procesory pozostawały produktywne.
Google i Meta już opisują architektury przekraczające granice pojedynczych budynków. Dostawcy sprzętu promują szybszą optykę koherentną, która koduje dane na świetle, aby przesyłać je na większe odległości. Nic z tego nie gwarantuje jednak, że rozproszone trenowanie pozostanie ekonomiczne w skali produkcyjnej.
Google News wskazuje architekturę sieciową wchodzącą do produkcji
Sieciowanie scale-across przechodzi od branżowej propozycji do wymogu projektowego dla największych klastrów AI.
Program panelu OFC określił DCI jako najszybciej rosnący segment sieci, ze wzrostem rocznym przekraczającym 50 procent. Wskazał też scale-across jako odrębny przypadek użycia sieci zaplecza, a nie zwykły ruch między lokalizacjami.
Tradycyjne DCI przesyła między obiektami ruch aplikacyjny, pamięci masowej, replikacyjny i kliencki. Takie przepływy mogą wymagać wysokiej przepustowości, lecz zwykle tolerują większą zmienność niż zsynchronizowane trenowanie AI.
Sieć AI na zapleczu łączy akceleratory pracujące nad tym samym zadaniem trenowania lub inferencji. Każdy procesor wielokrotnie wymienia parametry modelu, wyniki pośrednie i komunikaty synchronizacyjne. Opóźniony ruch może pozostawić procesory w oczekiwaniu, nawet gdy lokalne zasoby obliczeniowe są dostępne.
Scale-across rozszerza tę sieć zaplecza poza jeden budynek. Uczestniczące obiekty tworzą większą domenę obliczeniową, mimo że dzielą je światłowody i odległość geograficzna.
To rozróżnienie ma znaczenie, ponieważ operatorzy nie łączą już niezależnych centrów danych wyłącznie dla odporności lub przesyłania danych. Próbują koordynować akceleratory między lokalizacjami jako elementy jednej maszyny.
Opis panelu przygotowany przez Nokia podzielił łączność AI na trzy wymiary. Scale-up łączy procesory w obrębie szafy rack, scale-out łączy szafy wewnątrz obiektu, a scale-across spaja klastry poza jednym obiektem.
Kategorie te wiążą się z różnymi wymaganiami inżynieryjnymi. Krótkie połączenia miedziane pozostają powszechne wewnątrz szaf, podczas gdy na dłuższych trasach dominują łącza optyczne. Scale-across dodaje do infrastruktury AI transmisję koherentną, systemy liniowe, trasy światłowodowe i mechanizmy kontroli operacyjnej.
W panelu wraz z przedstawicielami Meta, Zayo, Lumen Technologies i Nokia uczestniczył inżynier Google Kevin Croussore. Ich udział pokazał, że problem obejmuje operatorów chmurowych, przewoźników sieciowych i dostawców sprzętu.
Istotny jest również moment. W kwietniu 2026 roku Google zaprezentowało Virgo Network, nową infrastrukturę scale-out dla AI Hypercomputer. Google podało, że wymagania treningowe przekraczają obecnie moc i przestrzeń dostępne w pojedynczych centrach danych.
Architektura Virgo wykorzystuje płaską, dwuwarstwową topologię oraz niezależne domeny sterowania. Google zaprojektowało ją, aby zmniejszyć liczbę warstw sieciowych przy zapewnieniu przewidywalnych opóźnień i izolacji usterek.
Virgo nie sprawia, że każde odległe centrum danych staje się odpowiednikiem lokalnej szafy rack. Pokazuje jednak, że Google traktuje obecnie kampus jako jedno środowisko obliczeniowe, a nie zbiór odizolowanych budynków.
Ta zmiana architektoniczna tworzy centralne napięcie artykułu. Podział klastra między wiele obiektów może zapewnić dostęp do mocy i powierzchni. Wprowadza też sieć, której koszt i działanie bezpośrednio wpływają na użyteczną wydajność obliczeniową.
Operatorzy nie mogą już oceniać DCI wyłącznie na podstawie surowej przepustowości. Muszą pytać, ile czasu pracy akceleratorów zachowuje sieć, jak szybko się regeneruje i ile energii zużywa każdy przesłany bit.
Niedobór mocy wymusza rozproszenie klastrów AI między budynkami
Presja wynika z niedopasowania między skoncentrowanym zapotrzebowaniem na obliczenia a wolniejszą rozbudową centrów danych gotowych na zasilanie.
Duże systemy AI skupiają tysiące akceleratorów, urządzeń pamięciowych, przełączników, elementów chłodzenia i systemów konwersji energii. Dodawanie procesorów zwiększa również zapotrzebowanie na infrastrukturę pomocniczą potrzebną do ich zasilania, chłodzenia i łączenia.
Pojedynczy budynek w końcu osiąga ograniczenia narzucone przez dostawy energii, stacje transformatorowe, systemy chłodzenia, harmonogramy budowy i lokalne pozwolenia. Operatorzy mogą projektować gęstsze szafy rack, lecz większa gęstość nie tworzy dodatkowej przepustowości sieci elektroenergetycznej.
Przesyłanie danych jest często bardziej praktyczne niż transport energii elektrycznej na duże odległości. Światłowód staje się więc narzędziem do łączenia oddzielnie zasilanych obiektów w większą pulę zasobów.
Google opisało tę zasadę bezpośrednio w maju 2026 roku. Firma podała, że lokalizuje centra danych w pobliżu zasobów energetycznych, a następnie rozdziela obciążenia AI między kampusy za pośrednictwem swojej sieci.
Jej globalna infrastruktura odzwierciedla skalę tej inwestycji. Google twierdzi, że przepustowość jego sieci rozległej wzrosła siedmiokrotnie między 2020 a 2025 rokiem. Sieć obsługuje usługi konsumenckie, ruch chmurowy, dane treningowe i zasoby obliczeniowe AI.
Meta mierzy się z tym samym fizycznym ograniczeniem w innej skali. Jej klaster Prometheus zaprojektowano z myślą o mocy jednego gigawata rozłożonej na co najmniej pięć budynków centrów danych.
Według opisu infrastruktury Meta Prometheus obejmuje również przyległą przestrzeń colocation i tymczasowe konstrukcje odporne na warunki pogodowe. Taki układ czyni sieć częścią podstawowego planu budowy klastra.
Większy projekt Hyperion firmy Meta ma zacząć stopniowo działać w 2028 roku. Firma podaje, że ukończony klaster będzie obsługiwać do pięciu gigawatów.
Liczby te pokazują, dlaczego scale-across zyskuje obecnie uwagę. Obiekty tej wielkości nie mogą polegać na jednej konwencjonalnej hali danych ani jednej lokalnej infrastrukturze przełączającej.
System agregacji zaplecza Meta, znany jako BAG, łączy wiele infrastruktur AI między obiektami. BAG jest scentralizowaną warstwą Ethernet super-spine, co oznacza, że łączy górne poziomy oddzielnych infrastruktur sieciowych.
Firma twierdzi, że agregacja zaplecza pomoże połączyć dziesiątki tysięcy GPU wykorzystywanych przez Prometheus. Musi również połączyć dwa różne projekty infrastruktury Meta.
Podejście to wywiera presję nie tylko na hyperscalerów. Dostawcy chmury potrzebują wystarczającej przepustowości między lokalizacjami, aby oferować duże pule akceleratorów. Operatorzy telekomunikacyjni potrzebują tras o przewidywalnych opóźnieniach, zróżnicowaniu fizycznym i szybszej realizacji.
Dostawcy optyki muszą zwiększać przepustowość, nie pozwalając jednocześnie, by zużycie energii, koszt modułów lub wskaźniki awarii rosły w tym samym tempie. Deweloperzy centrów danych muszą również planować trasy światłowodowe przed otwarciem budynków.
Nabywcy korporacyjni ponoszą pośrednią konsekwencję. Koszty ich usług AI zależą częściowo od tego, jak efektywnie dostawcy wykorzystują akceleratory. Rozproszony klaster o słabym wykorzystaniu sieci może marnować kosztowną moc obliczeniową.
Wymuszona odpowiedź ma charakter długoterminowy. Operatorzy muszą koordynować wybór lokalizacji, pozyskiwanie energii, trasy światłowodowe, architekturę obliczeniową i oprogramowanie obciążeń na lata przed uruchomieniem dużego klastra.
Sieciowanie scale-across daje im kolejną opcję projektową, ale nie eliminuje niedoboru. Zamienia skoncentrowane ograniczenie mocy w problem systemów rozproszonych.
Opłacalne sieciowanie scale-across zależy od użytecznego czasu pracy GPU
Najtańszy komponent sieciowy niekoniecznie tworzy sieć zapewniającą najniższy koszt trenowania.
Trenowanie AI przebiega poprzez powtarzające się obliczenia i komunikację. Akceleratory obliczają wyniki lokalnie, wymieniają informacje i czekają na innych uczestników przed kontynuowaniem pracy.
To zachowanie sprawia, że opóźnienie ogonowe jest wyjątkowo istotne. Opóźnienie ogonowe mierzy najwolniejsze odpowiedzi w grupie, a nie średni czas odpowiedzi dla całego ruchu.
Jedno opóźnione łącze, przeciążona ścieżka lub mający problemy węzeł mogą spowolnić znacznie większe zadanie. Koszt ujawnia się jako bezczynny czas akceleratorów, a nie prosta opłata sieciowa.
Dlatego sama przepustowość oferuje niepełną miarę ekonomiki scale-across. Łącze o wysokiej pojemności może nadal zapewniać niespójne czasy ukończenia, słabe odzyskiwanie po awarii lub nadmierne zużycie energii.
Google zaprojektowało Virgo wokół deterministycznych opóźnień, wysokiej przepustowości przekrojowej i izolacji usterek sprzętowych. Przepustowość przekrojowa mierzy, ile ruchu może jednocześnie przejść między dwiema połowami sieci.
Funkcje te mają zapewnić przewidywalny postęp zadań rozproszonych. Ilustrują też, czym sieci AI różnią się od ruchu aplikacyjnego typu best-effort.
Meta rozwiązuje ten problem poprzez zmiany w sieci i oprogramowaniu. Prace nad Prometheus obejmują Twine i MAST, systemy przeznaczone do wspierania trenowania w geograficznie rozproszonych centrach danych.
Planowanie staje się kluczowe, ponieważ nie każde obciążenie powinno przekraczać każdy dystans. Operator może umieścić ściśle zsynchronizowane zadania w jednej lokalizacji, a mniej wrażliwe etapy rozdzielić na szerszy region.
Optyka koherentna umożliwia dłuższe połączenia o wysokiej przepustowości. Technologia wykorzystuje zaawansowaną modulację i przetwarzanie sygnału, aby zachować dane na łączach światłowodowych wykraczających poza typowe odległości w centrach danych.
Nowoczesne moduły koherentne mogą mieścić się w wymiennych formatach przeznaczonych do podłączania do przełączników. Zmniejsza to w niektórych zastosowaniach zależność od oddzielnych półek transportowych i może uprościć wdrożenia.
Jednak koszt zakupu modułu jest tylko jedną częścią ekonomiki sieci. Operatorzy muszą uwzględnić dostępność światłowodów, systemy liniowe, wzmacnianie, monitorowanie, pracę związaną z wymianą, bezpieczeństwo i zapasową przepustowość.
Sieć zużywa również energię, która mogłaby w przeciwnym razie zasilać obliczenia. Projekt zwiększający przepustowość, a jednocześnie wymagający większej liczby urządzeń optycznych i przełączających, może nasilić pierwotne ograniczenie mocy w lokalizacji.
Ciena oferuje systemy 400G, 800G i 1.6T w swoim portfolio DCI. Marvell podobnie opisywał moduły koherentne 1.6T przeznaczone dla rozwijających się wdrożeń scale-across.
Te plany rozwoju sygnalizują znaczący wzrost przepustowości. Nie dowodzą jednak, że każde obciążenie AI będzie mogło efektywnie wykorzystywać tę przepustowość między wieloma obiektami.
Oprogramowanie musi koordynować rozmieszczenie, trasowanie, kontrolę przeciążeń, tworzenie punktów kontrolnych i odzyskiwanie. Operatorzy potrzebują również widoczności obejmującej warstwy obliczeniowe i transportowe, którymi wcześniej zarządzano jako oddzielnymi systemami.
Awaria ścieżki optycznej nie powinna zmuszać dużego zadania treningowego do ponownego uruchomienia od początku. Sieć i harmonogram obciążeń potrzebują skoordynowanych strategii odzyskiwania, które ograniczają utraconą pracę.
Wymóg ten zmienia sposób, w jaki nabywcy powinni porównywać projekty. Koszt na przesłany bit pozostaje użyteczny, lecz koszt na ukończony krok treningowy jest bliższy faktycznemu wynikowi biznesowemu.
Czas ukończenia zadania, wykorzystanie akceleratorów, pobór mocy przez układy optyczne oraz czas przywracania działania powinny być analizowane łącznie. Traktowanie ich jako odrębnych wskaźników zakupowych może ukrywać rzeczywiste koszty.
Scale-across staje się opłacalne tylko wtedy, gdy sieć zachowuje wystarczająco dużo produktywnego czasu procesorów, aby zrównoważyć dodatkową infrastrukturę. Szybsza optyka wspiera ten cel, ale o wyniku decydują architektura i operacje.
Otwarty Ethernet pod presją wydajności rozwiązań własnościowych
Sieci scale-across zaostrzają rywalizację między interoperacyjnymi systemami Ethernet a ściśle kontrolowanymi strukturami akceleratorów.
Ethernet ma ogromną zainstalowaną bazę, szeroki rynek dostawców i dojrzałe narzędzia operacyjne. Te zalety mogą ograniczać koncentrację dostawców i dawać operatorom więcej możliwości wyboru komponentów.
Projekt BAG firmy Meta wykorzystuje Ethernet do agregowania różnych struktur back-endowych. Ta decyzja pokazuje, jak hyperscaler może zachować wspólną warstwę połączeń, jednocześnie rozwijając pod nią wyspecjalizowane systemy.
Google również rozwija pionowo układy, systemy, struktury sieciowe, oprogramowanie i usługi chmurowe. Kontrola pionowa pozwala firmie dostrajać kilka warstw do swoich obciążeń, nawet gdy poszczególne interfejsy korzystają z ustanowionych standardów.
Nvidia oferuje inny punkt odniesienia dzięki NVLink, InfiniBand, Spectrum-X Ethernet i swoim systemom rack-scale. Jej portfolio łączy akceleratory, przełączniki, sprzęt interfejsowy i oprogramowanie w skoordynowanej architekturze.
Ściślejsza integracja może poprawić przewidywalność wydajności i zmniejszyć niepewność wdrożenia. Może też ograniczać możliwość zastępowania komponentów i skupiać decyzje dotyczące roadmapy u jednego dostawcy.
Otwarte systemy obiecują elastyczność, ale interoperacyjność nie gwarantuje wydajnego treningu rozproszonego. Urządzenia różnych dostawców mogą obsługiwać tę samą nominalną prędkość łącza, a mimo to zachowywać się inaczej podczas przeciążenia lub awarii.
Operatorzy stają więc przed trudną decyzją zakupową. Bardziej zintegrowana architektura może ograniczyć nakład pracy inżynieryjnej, podczas gdy otwarty projekt może poprawić elastyczność zaopatrzenia i długoterminową siłę negocjacyjną.
Debata obejmuje także interfejsy optyczne. Moduły pluggable umożliwiają wymianę i wybór dostawcy, natomiast optyka co-packaged umieszcza silniki optyczne bliżej krzemu przełącznika.
Optyka co-packaged może skrócić elektryczną odległość między układem przełącznika a połączeniem optycznym. Krótsze ścieżki elektryczne mogą poprawić integralność sygnału i efektywność energetyczną przy wysokich przepływnościach.
Serwisowanie staje się trudniejsze, gdy układy optyczne i sprzęt przełączający są silniej zintegrowane. Wymiana niewielkiego uszkodzonego modułu jest prostsza niż obsługa silnika optycznego połączonego z kosztownym pakietem przełącznika.
Liniowa optyka pluggable usuwa cyfrowy procesor sygnałowy z modułu. To podejście może zmniejszyć pobór mocy i opóźnienia, lecz przenosi większą odpowiedzialność za przetwarzanie sygnału na sprzęt hosta.
Data Center Dynamics wskazało niezawodność optyki i opóźnienia ogonowe jako pojawiające się ograniczenia w swojej analizie złożoności sieci. Zauważyło również, że szybsze cykle odświeżania zwiększają presję na zespoły projektowe i instalacyjne.
Warstwę fizyczną nadal łatwo przeoczyć. Więcej światłowodów oznacza większe wiązki kabli, gęstsze panele, bardziej napięte budżety tłumienia oraz bardziej wymagające procedury testowe.
Logiczny diagram sieci może przedstawiać dwa ośrodki połączone redundantnymi ścieżkami. W praktyce obie ścieżki mogą współdzielić kanały, mosty, systemy zasilania lub ryzyka budowlane, jeśli operatorzy nie zweryfikują fizycznej różnorodności.
Standardy mogą obniżać koszty, tworząc większe rynki komponentów. Mogą też dojrzewać wolniej niż systemy własnościowe rozwijane według harmonogramu jednego dostawcy.
Dlatego główną rywalizacją nadal pozostaje koszt kontra wydajność, a nie Ethernet kontra jeden wskazany konkurent. Strategia dostawców wspiera tę rywalizację, ale jej nie zastępuje.
Otwarta sieć, która pozostawia procesory bezczynne, jest kosztowna. Własnościowa sieć, która uzależnia nabywców od niekorzystnych modernizacji, także może stać się kosztowna.
Zwycięskie podejście zapewni przewidywalną wydajność zadań przy zachowaniu możliwych do opanowania wymagań dotyczących energii, utrzymania i zaopatrzenia. Żadna pojedyncza specyfikacja interfejsu sama w sobie nie potwierdza takiego wyniku.
Roadmapa optyczna wciąż musi przejść test niezawodności
Największą niewiadomą jest to, czy powstające systemy optyczne mogą zapewnić deklarowaną przepustowość przy ciągłych obciążeniach AI bez tworzenia nowych kosztów operacyjnych.
Łącza optyczne już przenoszą ruch wewnątrz dużych centrów danych i między nimi. Scale-across zmienia wzorzec ruchu, wrażliwość na awarie oraz oczekiwane wykorzystanie tych łączy.
Ruch back-endowy AI może być ciągły i zsynchronizowany. Może przez długie okresy wypełniać łącza, pozostawiając mniej miejsca na zdarzenia serwisowe lub nieprzewidywalne spadki wydajności.
Wyższe szybkości sygnalizacji zmniejszają również marginesy inżynieryjne. Komponenty muszą zachowywać jakość sygnału podczas pracy w gęstych, gorących środowiskach o ograniczonym budżecie mocy.
Branża przechodzi od 400G do koherentnych modułów pluggable 800G, a dostawcy przygotowują produkty 1.6T. Każda taka zmiana wpływa na przełączniki, moduły, sprzęt testowy, projekty światłowodów i praktyki operacyjne.
IEEE Spectrum poinformowało, że dostawcy optyki rozwijają także gęste zwielokrotnianie długości fali dla krótszych połączeń AI. DWDM przesyła kilka długości fali optycznej przez jedno włókno.
Jeden projekt z 2026 roku rozdziela ruch na osiem kanałów o niższej przepływności i zakłada łączną szybkość sięgającą 1,6 terabita na sekundę. Jego twórcy planują szerszą produkcję przed spodziewanymi wdrożeniami w 2028 roku.
Roadmapa skalowania optyki wygląda obiecująco, ale cele dostawców nie są dowodem gotowości produkcyjnej. Uzysk produkcyjny, zachowanie termiczne, współczynniki błędów i niezawodność w długim okresie nadal wymagają walidacji w warunkach eksploatacyjnych.
Ta sama ostrożność dotyczy deklaracji wydajności dostawców. Niższy pobór mocy przez moduł nie zmniejsza automatycznie całkowitego poboru mocy systemu, jeśli architektura wymaga większej liczby łączy lub dodatkowej pojemności zapasowej.
Większa przepustowość nie gwarantuje krótszego czasu ukończenia zadania. Kontrola przeciążenia, rozmieszczanie obciążeń i odzyskiwanie działania przez oprogramowanie mogą dominować wyniki podczas awarii.
Odległość tworzy kolejne stałe ograniczenie. Światło porusza się szybko, ale opóźnienia propagacji nie da się usunąć za pomocą oprogramowania ani lepszej modulacji.
Dodatkowe przełączniki, konwersje optyczne, kolejki i korekcja błędów zwiększają opóźnienie. Operatorzy mogą ograniczać te kary, lecz nie są w stanie sprawić, by odległy obiekt zachowywał się dokładnie jak sąsiednia szafa rack.
Ogranicza to zakres obciążeń odpowiednich dla scale-across. Niektóre zadania treningowe mogą tolerować szersze rozproszenie, szczególnie gdy oprogramowanie zaprojektowano z uwzględnieniem lokalności i checkpointingu.
Inne zadania wymagają niezwykle częstej synchronizacji. Ich ekonomika może się pogorszyć, gdy odległość sieciowa wielokrotnie zatrzymuje procesory.
Niezawodność ma także inne znaczenie w skali klastra. Komponent o niskim indywidualnym współczynniku awarii może mimo to generować częste incydenty, gdy jest wdrożony w ogromnej populacji łączy.
Czas naprawy staje się wtedy równie istotny jak częstotliwość awarii. Technicy mogą potrzebować zlokalizować uszkodzone włókno, wymienić moduły, wyczyścić złącza i ponownie przetestować ścieżki w kilku obiektach.
Umiejętności operacyjne mogą stać się wąskim gardłem. Gęsta infrastruktura optyczna wymaga wyspecjalizowanych praktyk instalacji, dokumentacji, pomiarów i rozwiązywania problemów.
Łańcuchy dostaw wprowadzają dalszą niepewność. Przyspieszone wdrażanie modułów koherentnych, laserów, złączy i sprzętu światłowodowego może powodować niedobory lub nierówną jakość.
Sceptyczny wniosek nie brzmi, że scale-across poniesie porażkę. Google, Meta i ich dostawcy mają wyraźne powody, by w nie inwestować.
Nierozstrzygnięte pytanie dotyczy tego, czy rozproszone klastry mogą utrzymać wysokie wykorzystanie po uwzględnieniu rzeczywistych awarii, prac utrzymaniowych i narzutu oprogramowania. Publicznie dostępne specyfikacje przepustowości nie odpowiadają na to pytanie.
Nabywcy powinni traktować deklaracje redukcji kosztów jako zależne od konkretnej architektury. Wynik osiągnięty w niestandardowej sieci jednego hyperscalera może nie przenosić się na mniejszego operatora korzystającego z innych obiektów, tras światłowodowych i oprogramowania.
Co czytelnicy Google News powinni obserwować dalej
Trzy sygnały pokażą, czy sieci scale-across stają się ekonomicznym modelem produkcyjnym, a nie kosztownym obejściem problemu.
Pierwszym sygnałem będzie zmierzone wykorzystanie działających klastrów wielobudynkowych. Wdrożenie Prometheus firmy Meta stanowi szczególnie istotny test, ponieważ jego planowana moc jednego gigawata obejmuje kilka konstrukcji.
Meta wyjaśniła swoją topologię sieciową, ale rozstrzygające dowody będą pochodzić z trwałej wydajności obciążeń. Przydatne ujawnienia obejmowałyby czas ukończenia zadania, wykorzystanie akceleratorów, czas przywracania działania oraz przerwy związane z siecią.
Wysokie wykorzystanie w wielu budynkach wspierałoby argument, że światłowód może odblokować niewykorzystaną moc bez marnowania zasobów obliczeniowych. Częste przestoje synchronizacji osłabiłyby go.
Drugim sygnałem będzie pojawienie się w produkcji modułów koherentnych 1.6T. Dostawcy ogłosili produkty i harmonogramy próbkowania, ale operatorzy potrzebują dostępności wolumenowej oraz niezawodności w terenie.
Warto obserwować kwalifikację przez hyperscalerów, wdrożenia operatorskie, testy interoperacyjności i pomiary mocy na poziomie kompletnego systemu. Same specyfikacje modułów niewiele mówią o koszcie wdrożenia.
Pomyślna kwalifikacja od kilku dostawców poprawiłaby możliwości w zakresie pojemności i zaopatrzenia. Opóźnienia, słabe uzyski lub wysokie wskaźniki awarii wydłużyłyby ekonomiczną żywotność systemów 800G.
Trzecim sygnałem będzie sposób, w jaki Google, Meta i Nvidia dzielą obciążenia między domeny sieciowe. Ich wybory programowe ujawnią, gdzie scale-across wnosi wartość, a gdzie fizyczna lokalność pozostaje konieczna.
Google twierdzi, że jego sieć obejmuje strukturę wewnątrz AI Hypercomputer, strukturę w jego obrębie oraz globalną sieć szkieletową. Meta łączy odrębne struktury treningowe przez BAG.
Nvidia nadal rozwija zintegrowane systemy dla środowisk scale-up, scale-out i scale-across. Granice między tymi domenami będą równie istotne jak ich maksymalne szybkości.
Przejście w kierunku harmonogramowania uwzględniającego lokalność potwierdziłoby, że odległość pozostaje twardym ograniczeniem projektowym. Szerokie rozmieszczanie zsynchronizowanych zadań między obiektami wskazywałoby, że ulepszenia sieci i oprogramowania zmniejszają tę karę.
Google News jest tu przydatne jako kanał odkrywania informacji, a nie jako dowód techniczny. Czytelnicy powinni śledzić źródłowe publikacje inżynieryjne, raporty wdrożeniowe i niezależne testy.
Dla deweloperów ta zmiana wpływa na dostępną pojemność akceleratorów i zachowanie platform treningu rozproszonego. Dla nabywców korporacyjnych może oddziaływać na niezawodność usług, dostępność regionalną i koszt obliczeń AI.
Architekci sieci powinni oceniać kompletne rezultaty obciążeń zamiast porównywać prędkości łączy w izolacji. Zespoły zakupowe powinny również żądać dowodów dotyczących odzyskiwania działania po awariach, poboru mocy i interoperacyjności.
Najważniejsze pytanie jest praktyczne: czy kolejny połączony budynek zapewnia proporcjonalną wartość obliczeniową po uwzględnieniu kosztów i opóźnień sieciowych?
Śledź te trzy sygnały, zanim zaakceptujesz twierdzenia, że scale-across rozwiązało problem kosztów centrów danych AI. Sieć musi udowodnić, że rozproszona moc staje się produktywnym przetwarzaniem, a nie niewykorzystaną pojemnością połączoną drogim światłowodem.



