Architektura CXL Panmnesia i Meta rozszerza obliczenia AI poza pojedynczą szafę
Panmnesia i Meta zaproponowały architekturę CXL, która mogłaby połączyć do 960 akceleratorów AI w jednej spójnej domenie obliczeniowej. Projekt podważa granicę między ściśle sprzężonymi systemami szafowymi a konwencjonalnymi sieciami centrów danych. Wiąże się jednak z istotnym zastrzeżeniem. To propozycja architektoniczna wsparta wybranymi komponentami krzemowymi, a nie produkcyjne wdrożenie z 960 akceleratorami.
Architektura CXL Panmnesia i Meta została przedstawiona w artykule przeglądowym opublikowanym przez Nature Reviews Electrical Engineering 10 sierpnia 2026 r. Jej celem jest sprawienie, by procesory CPU, akceleratory i pamięć działały bardziej jak komponenty jednego dużego procesora. Compute Express Link, czyli CXL, to otwarty interkonekt wspierający współdzielony dostęp do pamięci i zarządzaną sprzętowo spójność pamięci podręcznej.
Cel ten stawia CXL obok uznanych łączy scale-up i sieci scale-out, w tym NVLink, Ethernetu oraz InfiniBand. Technologie te rozwiązują różne elementy problemu obliczeń rozproszonych. Autorzy artykułu twierdzą, że CXL może rozszerzyć przewidywalną, przypominającą dostęp do pamięci komunikację na większy obszar centrum danych AI.
Propozycja ma znaczenie, ponieważ duże zadania AI często czekają na najwolniejsze uczestniczące urządzenie. Dodawanie akceleratorów zwiększa teoretyczną wydajność, ale tworzy też więcej ścieżek komunikacyjnych i więcej okazji do opóźnień. Kluczowa rywalizacja nie toczy się więc między CXL a jednym dostawcą. Chodzi o zarządzaną sprzętowo spójność kontra sieci koordynowane programowo w przypadku ściśle zsynchronizowanych zadań AI.
Co faktycznie proponuje architektura CXL Panmnesia i Meta
Propozycja przenosi CXL z obszaru rozszerzania pamięci serwerów do roli między-szafowej struktury scale-up dla systemów AI.
Recenzowany przegląd architektury CXL opisuje podejście „jak jeden chip” do projektowania centrów danych. To sformułowanie nie oznacza, że każdy serwer staje się fizycznie scalony z pozostałymi. Oznacza natomiast, że rozdzielone zasoby stosują zasady komunikacji i pamięci podobne do tych występujących wewnątrz dużego pakietu obliczeniowego.
Współczesne systemy AI zwykle obejmują kilka warstw komunikacji. Akceleratory w obrębie jednego serwera lub szafy mogą korzystać ze specjalizowanych łączy o wysokiej przepustowości. Ruch między szafami zazwyczaj przechodzi przez sieci Ethernet lub InfiniBand. Oprogramowanie, interfejsy sieciowe, stosy protokołów i kopiowanie danych pomagają koordynować tę wymianę.
Warstwy te zapewniają elastyczność routingu i separację błędów. Sprawiają jednak również, że czas działania jest mniej przewidywalny. Żądanie może napotkać różną głębokość kolejek, aktywność oprogramowania, przeciążenie i długość ścieżki. Duże zadania synchroniczne odczuwają te różnice, ponieważ uczestniczące akceleratory często spotykają się w punktach komunikacji zbiorowej lub synchronizacji.
Przegląd wskazuje rozrzut opóźnień, czyli różnicę między szybszymi i wolniejszymi operacjami, jako główne ograniczenie. Średnie opóźnienie nadal ma znaczenie, lecz niska średnia może ukrywać szkodliwe wartości odstające. Jeden opóźniony uczestnik może zmusić setki innych akceleratorów do oczekiwania.
Panmnesia i Meta proponują rozszerzenie spójnej domeny poprzez uporządkowaną hierarchię tac, podów i zasobów na poziomie struktury. Spójność pamięci podręcznej to mechanizm zapewniający zgodność kopii współdzielonych danych między procesorami i urządzeniami. Zarządzana sprzętowo spójność ogranicza potrzebę koordynowania przez aplikacje każdego transferu za pośrednictwem oprogramowania sieciowego.
Proponowana architektura opiera się na trzech kluczowych elementach sprzętowych. Przełącznik o wysokim stopniu rozgałęzienia i bez blokowania łączy wiele zasobów, ograniczając wewnętrzną rywalizację. Jednostka przyspieszania łącza realizuje funkcje komunikacyjne po stronie urządzenia. Kontroler struktury konfiguruje zasoby i zarządza nimi w całej większej domenie.
Hierarchia ma utrzymywać stałą lub regularną liczbę skoków. Skok występuje za każdym razem, gdy dane przechodzą przez pośrednie połączenie lub przełącznik. Utrzymywanie spójności tych ścieżek może zawęzić zmienność opóźnień, nawet gdy zasoby znajdują się w różnych lokalizacjach fizycznych.
To ambitniejsze rozwiązanie niż dołączenie dodatkowej pamięci do jednego serwera. Opublikowany projekt traktuje procesory CPU, akceleratory i urządzenia pamięci jako modułowe bloki konstrukcyjne. Obciążenie robocze mogłoby uzyskiwać dostęp do tych zasobów za pośrednictwem wspólnej struktury adresowej, zamiast traktować każdy zdalny komponent jako niezależny cel sieciowy.
Autorzy opisują konfigurację obejmującą do 960 akceleratorów w jednej domenie spójności. Liczba ta wynika z architektonicznego układu przedstawionego w artykule, który grupuje akceleratory w większej strukturze. Nie należy jej interpretować jako niezależnie przetestowanego produkcyjnego klastra.
To rozróżnienie definiuje główne napięcie tej historii. Proponowany system przedstawia mapę spójności między szafami, podczas gdy publicznie dostępne dowody potwierdzają jedynie fragmenty tej mapy. Publikacja w Nature potwierdza znaczenie architektury dla badań, ale nie certyfikuje jej gotowości komercyjnej.
Dlaczego infrastruktura AI potrzebuje więcej niż szybszych akceleratorów
Presja wynika ze zsynchronizowanej komunikacji, pojemności pamięci i nieprzewidywalnych przestojów, a nie wyłącznie z niewystarczającej wydajności obliczeniowej.
Dostawcy infrastruktury AI od lat zwiększają przepustowość akceleratorów. Większe modele rozdzielają jednak pracę między większą liczbę urządzeń, przez co komunikacja staje się coraz większą częścią całkowitego czasu wykonania. Każdy akcelerator musi wymieniać parametry, aktywacje, gradienty lub informacje routingu z innymi komponentami.
Synchroniczne zadanie treningowe często przechodzi dalej dopiero po ukończeniu etapu przez wszystkie uczestniczące urządzenia. Szybsze urządzenia nie mogą po prostu kontynuować, jeśli ich następne obliczenie zależy od danych opóźnionego partnera. Wraz ze wzrostem systemu rośnie też prawdopodobieństwo napotkania wolnej ścieżki.
Przegląd Nature podaje, że liczba parametrów modeli AI wzrosła milion razy w ciągu pięciu lat. Porównanie to uzasadnia motywację artykułu, choć sam rozmiar modelu nie determinuje wymagań infrastrukturalnych. Na ilość potrzebnych obliczeń i pamięci wpływają również architektura, rzadkość, precyzja i projekt obciążenia roboczego.
Inferencja tworzy kolejny punkt presji. Duże systemy rekomendacyjne i językowe mogą rozkładać usługi intensywnie korzystające z pamięci na wiele serwerów. Systemy sieciowe mogą obsłużyć tę pracę, ale często wymagają jawnych transferów danych, koordynacji programowej i replikowanych zasobów.
CXL zmienia interfejs między obliczeniami a zdalną pamięcią. Zamiast przedstawiać wszystkie zdalne zasoby jako punkty końcowe sieci, może udostępniać pamięć za pośrednictwem operacji odczytu i zapisu. Procesor może zatem adresować dołączoną lub współdzieloną pojemność, korzystając z semantyki zorientowanej na pamięć.
Specyfikacje CXL stopniowo rozszerzały dostępny zakres projektowania. Wczesne wersje skupiały się na spójnym połączeniu między hostami a urządzeniami. Późniejsze wersje dodały przełączanie, pulę pamięci, bezpośrednią komunikację między urządzeniami i szersze funkcje struktury.
Ta ewolucja wyjaśnia, dlaczego Panmnesia i Meta przedstawiają tę propozycję właśnie teraz. CXL wykroczył poza model połączenia punkt-punkt z serwerem. Jego nowsze funkcje struktury wspierają bardziej złożone topologie, choć sama zgodność ze standardami nie zapewnia przewidywalnej wydajności centrum danych.
Meta wcześniej badała węższe zastosowanie produkcyjne. Jej układ rozszerzający pamięć Vistara łączy odzyskaną pamięć DDR4 z nowszymi serwerami za pośrednictwem CXL. Urządzenie przedstawia dodaną pojemność jako oddzielny węzeł NUMA, czyli region pamięci o innych charakterystykach dostępu.
To wdrożenie dotyczy pojemności i ponownego wykorzystania sprzętu, a nie spójności w skali całego centrum danych. Pokazuje jednak, dlaczego hyperskalerzy interesują się CXL. Pamięć podłączona do jednej generacji sprzętu serwerowego nie musi stawać się bezużyteczna wraz ze zmianą platformy hosta.
Meta ma łączyć lokalną pamięć DDR5 z wolniejszą pamięcią DDR4 dołączoną przez CXL w projekcie MemServer. Linux może utrzymywać często używane strony w pamięci lokalnej, przenosząc rzadziej używane strony do rozszerzonej warstwy. Takie rozwiązanie zależy od zachowania obciążenia roboczego, ponieważ częsty dostęp do wolniejszej pamięci może obniżać wydajność.
Panmnesia przedstawiła kolejny zestaw wyników na International Symposium on Computer Architecture w czerwcu 2026 r. Według jej podsumowania wdrożenia z ISCA Meta ustaliła, że pamięć CXL zmniejszyła zapotrzebowanie serwerowe dla rozproszonej inferencji AI nawet o 25 procent.
Ten sam komunikat firmy podaje, że Meta skróciła średni czas odpowiedzi rozproszonej pamięci podręcznej o około 29 procent. Wyniki te dotyczą konkretnych usług produkcyjnych i konfiguracji. Nie potwierdzają pełnej architektury między-szafowej opisanej w przeglądzie.
Mimo to liczby te łączą szerszą propozycję z konkretnym problemem ekonomicznym. Niewykorzystana pamięć może blokować wydajność obliczeniową, a niedobory pamięci mogą zmuszać operatorów do dodawania serwerów. Lepsze współdzielenie zasobów może ograniczyć tę nierównowagę bez konieczności wyposażania każdej maszyny w maksymalną możliwą pojemność.
Natychmiastowa presja dotyczy zatem infrastruktury zbudowanej wokół sztywnych granic serwerów. Obejmuje też zastrzeżone systemy scale-up, które zapewniają szybką komunikację akceleratorów w ograniczonej domenie fizycznej. Nabywcy chcą rozszerzyć te korzyści na większe instalacje bez utraty przewidywalnej wydajności.
Sprzętowa spójność staje naprzeciw sieci koordynowanych programowo
Główna rywalizacja toczy się między kontrolowaną strukturą sprzętową a elastycznymi sieciami, które koordynują rozproszone zasoby za pośrednictwem oprogramowania.
Ethernet i InfiniBand już dziś łączą bardzo duże klastry AI. Wspierają dojrzały routing, operacje, bezpieczeństwo i zarządzanie awariami. Ich skala czyni je niezbędnymi, a architektura CXL Panmnesia i Meta nie czyni ich przestarzałymi.
Propozycja koncentruje się natomiast na pracy, która cierpi, gdy zmienia się czas działania sieci. Tradycyjna komunikacja scale-out często wymaga, by oprogramowanie zidentyfikowało zdalny bufor, zleciło transfer i wykryło jego zakończenie. Każdy krok może zwiększać narzut lub zmienność opóźnień.
Struktura CXL może zachować model wspólnej przestrzeni adresowej między dołączonymi urządzeniami. Sprzęt może również uczestniczyć w utrzymywaniu spójności. Taki projekt sprawia, że zdalna pamięć lub akceleratory wydają się bardziej ściśle zintegrowane z procesorem zgłaszającym żądanie.
Różnicę można porównać do dwóch sposobów organizacji projektu. W jednym zespoły przesyłają formalne wiadomości między niezależnymi grupami. W drugim uczestnicy pracują w jednym współdzielonym, stale zsynchronizowanym środowisku. Drugie podejście może ograniczać liczbę kroków koordynacyjnych, ale tworzy też silniejsze zależności.
Proponowany przez Panmnesia przełącznik jest istotny, ponieważ wczesne CXL odziedziczył kilka cech strukturalnych po PCI Express. Routing oparty na hierarchii zwykle organizuje urządzenia w drzewo. Drzewa są łatwe w zarządzaniu, lecz ich kształt może ograniczać ścieżki, stopień rozgałęzienia i projekty dużych struktur.
Routing oparty na portach kieruje ruch przy użyciu identyfikatorów przypisanych do portów struktury. Umożliwia bardziej elastyczne topologie i może zapewniać alternatywne ścieżki. Panmnesia twierdzi, że jej przełącznik obsługuje zarówno routing oparty na portach, jak i na hierarchii, zachowując kompatybilność przy jednoczesnym poszerzeniu możliwości wdrożeniowych.
Jednostka przyspieszania łącza zajmuje się pracą wykonywaną blisko punktu końcowego. Ma ograniczać opóźnienia związane z przetwarzaniem spójności i inną aktywnością protokołu. Kontroler struktury koordynuje następnie konfigurację i przydzielanie zasobów w całym systemie.
Łącznie komponenty te mają stabilizować ścieżki, a nie po prostu obniżać średnie opóźnienie w jednym benchmarku. Przegląd przekonuje, że sprzęt musi kontrolować zmienność wprowadzoną przez routing, kolejki, kontrolery i konkurencyjny ruch. Przewidywalność staje się właściwością architektury, a nie przypadkowym wynikiem testu porównawczego.
Panmnesia twierdzi, że jej kontroler struktury CXL i PCIe oraz jednostka przyspieszania łączy przeszły walidację krzemową. Firma podaje również, że jej przełącznik struktury został wyprodukowany, a wczesne wersje krzemu są dostarczane. Te deklaracje wykraczają poza symulację programową, ale nie oznaczają jeszcze kompletowego wdrożenia centrum danych.
Publicznie dostępne informacje opisują dostęp między serwerami w zakresie kilkuset nanosekund dla proponowanej konstrukcji. Konwencjonalny dostęp oparty na sieci może działać w skali mikrosekund. Kategorie te obejmują wiele konfiguracji, dlatego porównanie należy traktować jako wskazówkę architektoniczną, a nie uniwersalny benchmark.
Deklarowana domena 960 akceleratorów obrazuje zamierzoną skalę. Nie potwierdza jednak przepustowości aplikacji, wykorzystania zasobów ani odporności systemu w tej skali. Nabywcy potrzebowaliby wyników na poziomie obciążeń obejmujących trening, inferencję, pulowanie pamięci i odzyskiwanie po awarii.
Własnościowe interkonekty akceleratorów pozostają drugim ważnym punktem odniesienia. NVLink i NVSwitch zapewniają komunikację GPU o wysokiej przepustowości w obsługiwanych systemach Nvidia. Inni dostawcy akceleratorów stosują porównywalne technologie skalowania w górę wokół własnych produktów.
Łącza te często zapewniają ścisłą integrację i dojrzałą obsługę komunikacji zbiorowej. Mogą jednak wiązać nabywców z jedną rodziną akceleratorów lub jednym projektem systemu. Atrakcyjność CXL wynika z tego, że jest to standardowy w branży interfejs dla procesorów, pamięci i heterogenicznych urządzeń.
Otwarte standardy nie tworzą automatycznie interoperacyjności. Kontrolery, przełączniki, oprogramowanie sprzętowe, systemy operacyjne i akceleratory nadal muszą działać zgodnie. Wydajność może się również różnić, nawet gdy każdy komponent przejdzie testy zgodności z protokołem.
Z tego powodu proponowaną strukturę należy postrzegać jako dodatkową warstwę infrastruktury. Ethernet i InfiniBand nadal obsługiwałyby ruch korzystający z szerokiego zasięgu i niezależnych domen awarii. Wyspecjalizowane łącza akceleratorów pozostałyby użyteczne wewnątrz ściśle zintegrowanych systemów.
CXL zajmowałby pozycję pośrednią. Rozszerzałby dostęp podobny do pamięci i spójność poza serwer, szafę rack lub konwencjonalną obudowę skalowania w górę. Wartość zależy od tego, czy operatorzy zyskają ściślejsze powiązanie bez przenoszenia wrażliwości na awarie na poziomie układu na całe centrum danych.
Prawdziwym testem są zmienność, odległość i ograniczanie skutków awarii
Spójna domena staje się mniej użyteczna, jeśli długie łącza, przeciążenia lub awaria jednego komponentu czynią cały system nieprzewidywalnym.
Sygnalizacja elektryczna tworzy najbardziej oczywiste fizyczne ograniczenie tej propozycji. Szybkie łącza elektryczne tracą jakość sygnału wraz ze wzrostem odległości. Retimery mogą odtwarzać sygnały, lecz każdy dodatkowy komponent zwiększa opóźnienie, zużycie energii, koszt i złożoność operacyjną.
CXL początkowo zaprojektowano dla względnie krótkich połączeń wewnątrz serwerów i pobliskich systemów. Rozciągnięcie go między szafami rack wymaga starannego projektu kanału. Rozszerzenie go na całe centrum danych wymaga innego podejścia fizycznego.
Przegląd wskazuje łącza optyczne i CXL-over-optics jako drogę poza ograniczenia elektryczne. CXL-over-optics przesyła ruch CXL za pośrednictwem komunikacji optycznej, próbując zachować jego semantykę pamięci i spójności. Transmisja optyczna może pokonywać większe odległości niż porównywalne łącza elektryczne.
Optyka nie eliminuje jednak wszystkich opóźnień. Konwersja elektryczno-optyczna, przełączanie, obsługa protokołu i dłuższa droga fizyczna wpływają na czas odpowiedzi. Wyzwaniem jest wystarczająco ścisłe kontrolowanie całej tej ścieżki dla zsynchronizowanych obciążeń AI.
Architektura rozszerza również zasięg skutków awarii. Konwencjonalny system rozproszony zakłada, że węzły i ścieżki sieciowe zawodzą niezależnie. Oprogramowanie może ponawiać próby, replikować pracę lub izolować ją od takich awarii.
Duży spójny system tworzy więcej współdzielonego stanu. Utrata przełącznika, urządzenia pamięci, kontrolera lub ścieżki optycznej może wpłynąć na wielu uczestników. Odzyskiwanie musi zachować poprawność, jednocześnie zapobiegając zatrzymaniu zbyt dużej części systemu przez jedną usterkę.
Przegląd Nature wyraźnie wskazuje spójność, hierarchię pamięci, kontrolę struktury i integrację optyczną jako obszary dalszych badań. Jego kluczowe punkty stwierdzają również, że architektura pozostaje ograniczona limitami łączy elektrycznych. To sformułowanie jest ostrożniejsze, niż sugeruje metafora „jednego układu”.
Bezpieczeństwo rodzi kolejne otwarte pytanie. Systemy współdzielonej pamięci wymagają ścisłej izolacji między obciążeniami i najemcami. Duża struktura CXL musi chronić przestrzenie adresowe, interfejsy zarządzania i zawartość pamięci w większej liczbie urządzeń.
Oprogramowanie operacyjne będzie miało równie duże znaczenie jak krzem przełączników. Kontrolery struktury muszą wykrywać zasoby, stosować polityki, monitorować przeciążenia, izolować usterki i koordynować konserwację. Operatorzy potrzebują również widoczności, która ścieżka spowodowała odstające opóźnienie.
Propozycja nie eliminuje oprogramowania. Przenosi większą część koordynacji wrażliwej na czas do sprzętu, jednocześnie przypisując konfigurację i polityki płaszczyźnie zarządzania. Taki podział może zmniejszyć narzut w czasie działania, ale tworzy wymagający problem sterowania.
Zachowanie aplikacji stanowi kolejne ograniczenie. Obciążenia z przewidywalną lokalnością mogą utrzymywać często używane dane blisko obliczeń i wykorzystywać pojemność puli dla rzadziej używanych danych. Obciążenia o losowych wzorcach dostępu mogą generować większy ruch w strukturze i ponosić większe kary opóźnień.
Przykład warstwowania pamięci Meta odzwierciedla ten kompromis. Lokalna DDR5 zapewnia znacznie większą przepustowość niż dołączona warstwa DDR4. Umieszczanie stron działa, gdy oprogramowanie potrafi zidentyfikować stabilny zestaw roboczy i utrzymać go blisko procesora.
Podobna zasada dotyczy akceleratorów. Pamięć CXL może zwiększać pojemność, ale nie jest w stanie odtworzyć przepustowości i bliskości pamięci o wysokiej przepustowości zamontowanej obok GPU. Właściwym porównaniem nie jest zdalna pojemność CXL zestawiona w izolacji z lokalną HBM.
Operatorzy muszą natomiast określić, które dane należą do każdej warstwy. Wagi modeli, pamięci podręczne klucz-wartość, embeddingi, punkty kontrolne i wyniki pośrednie mają różne wzorce dostępu. Niektóre tolerują większą odległość, podczas gdy inne zależą od lokalnej przepustowości.
Niezależne testy będą musiały mierzyć więcej niż korzystną średnią. Użyteczne oceny powinny raportować opóźnienia ogonowe, zachowanie przy przeciążeniu, energię na przesłany bajt, odzyskiwanie po awarii oraz czas ukończenia aplikacji. Testy powinny również zmieniać topologię i rozmieszczenie obciążeń.
Najważniejsza luka dowodowa dotyczy skali. Panmnesia opisała walidację krzemową centralnych komponentów. Meta opisała produkcyjne wykorzystanie pamięci CXL. Żaden z tych wyników nie stanowi publicznego, kompleksowego testu 960 spójnych akceleratorów w wielu szafach rack.
Opublikowane porównanie architektur trafnie charakteryzuje projekt jako proponowany kierunek. Zwraca również uwagę, że wartości rzędu kilkuset nanosekund nie powinny być odczytywane jako niezależna walidacja dla każdego wdrożenia.
Ta ostrożność nie umniejsza wartości artykułu. Artykuły przeglądowe często porządkują rozwijającą się dziedzinę i wskazują kierunek badań. Wartość publikacji leży w jej argumentacji na poziomie systemu, a nie w dowodzie, że jeden produkt komercyjny spełnia już wszystkie wymagania.
CXL przechodzi od rozszerzania pamięci do przetwarzania opartego na strukturze
Szersza zmiana przekształca CXL z połączenia dla dodatkowej pamięci w potencjalny szkielet kompozycyjnej infrastruktury AI.
CXL początkowo zyskał uwagę jako praktyczny sposób rozszerzania pamięci serwera. Urządzenia Type 3 mogą dodawać pojemność pamięci przez spójny interfejs hosta. Pulowanie pozwala następnie kilku hostom korzystać ze współdzielonej pojemności zamiast rezerwować identyczną pamięć w każdym serwerze.
Rozwiązuje to powszechny problem wykorzystania zasobów. Niektórym serwerom brakuje pamięci, podczas gdy inne pozostawiają pojemność niewykorzystaną. Wspólna pula może przesunąć zasoby bliżej rzeczywistego zapotrzebowania, ograniczając niewykorzystany sprzęt.
Firmy z całej branży półprzewodników opracowały kontrolery CXL, ekspandery pamięci, przełączniki i retimery. Intel i AMD obsługują CXL za pośrednictwem procesorów serwerowych. Dostawcy pamięci i infrastruktury wprowadzili urządzenia oparte na tych samych standardach.
Architektura Panmnesia Meta CXL wykracza poza wykorzystanie na poziomie komponentów. Traktuje strukturę jako ustrukturyzowany system obliczeniowy z przewidywalnymi ścieżkami. Pulowanie pamięci staje się jedną z funkcji wewnątrz większej spójnej domeny.
Ten kierunek zmienia również sposób, w jaki nabywcy oceniają infrastrukturę. Kartę pamięci CXL można ocenić na podstawie pojemności, opóźnienia, przepustowości i kompatybilności. Struktura centrum danych potrzebuje dodatkowych miar obejmujących topologię, trasowanie, zarządzanie, izolację i zachowanie przy awariach.
Projekt Vistara Meta stanowi użyteczny krok historyczny. Niestandardowy układ CXL 2.0 łączy pamięć DDR4 z nowszymi systemami zbudowanymi wokół DDR5. Publiczne szczegóły implementacji Vistara opisują zorientowany na produkcję projekt rozszerzania pamięci, a nie strukturę akceleratorów między szafami rack.
To węższe zastosowanie jest istotne, ponieważ udane standardy często rozpowszechniają się poprzez stopniowe wdrożenia. Operatorzy mogą zacząć od rozszerzania pamięci, dodać pulowanie, wdrożyć przełączanie, a następnie testować bardziej ambitne spójne domeny. Każdy krok buduje wiedzę operacyjną.
Strategia Panmnesia obejmuje kilka punktów na tej ścieżce rozwoju. Jej portfolio zawiera własność intelektualną kontrolerów, projekty punktów końcowych, przełączniki, retimery i zarządzanie strukturą. Firma pozycjonuje się jako dostawca architektury, a nie producent pojedynczego, odizolowanego komponentu.
Jednak pozycjonowanie komercyjne pozostaje odrębne od wdrożenia. Artykuł Nature ma autorów z Panmnesia i Meta, lecz współautorstwo nie oznacza zawarcia umowy dostawczej. Nie potwierdza również, że Meta wdroży pełną strukturę Panmnesia.
Meta ma mocne powody, by badać otwarte interkonekty. Hiperskaler obsługuje zróżnicowane procesory, akceleratory, systemy pamięci masowej i generacje pamięci. Standaryzowane podłączanie może ograniczyć zależność od jednej rodziny urządzeń i wspierać bardziej elastyczne wykorzystanie zasobów.
Jednocześnie hiperskalerzy często tworzą niestandardowy krzem, gdy standardowe produkty nie spełniają ich wymagań. Vistara pokazuje, że Meta potrafi zbudować wyspecjalizowane urządzenie CXL dla wewnętrznego przypadku użycia. Panmnesia musi więc wykazać wartość wykraczającą poza sam protokół.
Jej wyróżniki opierają się na sterowaniu o niskich opóźnieniach, elastycznym trasowaniu, większych strukturach i przyspieszaniu punktów końcowych. Te twierdzenia wymagają porównań z alternatywnymi przełącznikami CXL i własnościowymi systemami skalowania w górę. Nabywcy będą również oceniać integrację oprogramowania i gotowość produkcyjną.
Wynik konkurencji nie wyłoni jednego uniwersalnego zwycięzcy. Centra danych AI już łączą wiele warstw interkonektów, ponieważ żadna pojedyncza struktura nie optymalizuje każdej odległości i każdego wzorca ruchu. Prawdopodobne pytanie dotyczy tego, gdzie zaczyna się i kończy każda warstwa.
Wewnątrz serwera lokalne łącza i magistrale pamięci pozostają niezbędne. W obudowie akceleratorów własnościowe struktury skalowania w górę mogą zapewniać bardzo wysoką przepustowość. Między szafami rack Ethernet i InfiniBand oferują ugruntowany zasięg oraz niezależność operacyjną.
CXL mógłby utworzyć nowy spójny obszar pomiędzy tymi warstwami. Obszar ten może obejmować pulowaną pamięć, urządzenia klasy pamięci masowej, CPU i wybrane akceleratory. Jego rozmiar będzie określony przez tolerancję opóźnień, granice awarii i ekonomikę.
Review Article nadaje temu obszarowi spójne słownictwo architektoniczne. Tace grupują pobliskie komponenty. Pody łączą większe zestawy zasobów. Warstwa struktury łączy te grupy, próbując zachować regularne ścieżki.
Model ten przypomina projektowanie układów, ponieważ nowoczesne procesory również organizują zasoby hierarchicznie. Rdzenie, pamięci podręczne, kontrolery pamięci i interkonekty zajmują ustrukturyzowane obszary. Propozycja stosuje podobne zasady rozmieszczania i trasowania w skali centrum danych.
Analogia w końcu osiąga swoje granice. Centrum danych obejmuje większe odległości, zawiera wymienialne urządzenia i obsługuje niezależne obciążenia. Nie może zaakceptować każdego ograniczenia, które projektanci układów tolerują wewnątrz jednego pakietu.
Najbardziej wiarygodna interpretacja nie zakłada więc dosłownie procesora wielkości pomieszczenia. Chodzi raczej o centrum danych z większymi obszarami zarządzanymi sprzętowo, bardziej bezpośrednim dostępem do zasobów i ściślejszą kontrolą czasu niż zapewniają konwencjonalne sieci.
Trzy sygnały pokażą, czy projekt może wyjść poza papier
Kolejny etap zależy od demonstracji end-to-end, walidacji optycznej oraz dowodów, że operatorzy potrafią ograniczać awarie wewnątrz dużej, spójnej fabric.
Pierwszym sygnałem będzie demonstracja obciążenia wieloszafowego z użyciem kompletnej architektury. Powinna łączyć proponowany przełącznik, jednostki przyspieszające łącza, kontroler fabric, pamięć, procesory CPU i akceleratory. Walidacja komponentów nie ujawnia wszystkich interakcji pojawiających się przy współdzielonym ruchu.
Przekonujący test uruchomiłby zsynchronizowane trenowanie lub inferencję AI na istotnej liczbie akceleratorów. Powinien raportować medianę i opóźnienia ogonowe, osiągniętą przepustowość, wykorzystanie oraz całkowity czas ukończenia zadania. Wyniki powinny obejmować przeciążenia i mieszany ruch, a nie tylko nieobciążoną fabric.
Dowody zbliżone do proponowanej skali 960 akceleratorów mocno wsparłyby główną tezę artykułu. Znacznie mniejsza demonstracja nadal mogłaby mieć znaczenie, jeśli pokazałaby przewidywalne skalowanie między szafami. Dalsze poleganie na wynikach na poziomie komponentów pozostawiłoby największe twierdzenie niezweryfikowane.
Drugim sygnałem będzie prototyp CXL-over-optics działający end-to-end. Łącza elektryczne ograniczają zasięg spójnej fabric. Transport optyczny nie jest więc opcjonalnym dodatkiem do wizji pełnego centrum danych.
Użyteczny prototyp musi zachowywać właściwości CXL, jednocześnie mierząc opóźnienie konwersji, stabilność łącza, pobór mocy oraz odzyskiwanie sprawności po awariach optycznych. Powinien również pokazać, jak przełączniki i kontrolery utrzymują spójne ścieżki na większych odległościach.
Udana walidacja optyczna wzmocniłaby argument, że domeny spójności mogą wykraczać poza sąsiadujące szafy. Nadmierne opóźnienia lub złożoność operacyjna zepchnęłyby CXL z powrotem do mniejszych podów. Ethernet i InfiniBand zachowałyby wtedy większą część swojej roli w komunikacji między szafami.
Trzecim sygnałem będą dowody produkcyjne dotyczące izolacji awarii i operacji programowych. Duże spójne fabric potrzebują jasnych procedur odzyskiwania sprawności, gdy zawiedzie urządzenie lub ścieżka. Potrzebują także monitoringu, który wykrywa przeciążenia i zmienność opóźnień, zanim obciążenia zostaną zatrzymane.
Warto śledzić publiczne informacje o telemetrii fabric, zachowaniu hot-plug, granicach bezpieczeństwa i odzyskiwaniu sprawności po częściowych awariach. Komunikaty o wdrożeniach powinny odróżniać ograniczone testy od usług produkcyjnych. Relacje z dostawcami należy też oddzielać od współpracy badawczej.
Ten sygnał może wzmocnić lub osłabić architekturę szybciej niż kolejne twierdzenie dotyczące opóźnień. Operatorzy nie będą rozszerzać domen spójności, jeśli awarie staną się trudniejsze do ograniczenia. Przewidywalność musi obejmować odzyskiwanie sprawności, a nie tylko normalne działanie.
Architektura Panmnesia Meta CXL oferuje poważną odpowiedź na rzeczywisty problem infrastruktury AI. Większa liczba akceleratorów nie może zapewnić proporcjonalnych korzyści, gdy opóźnienia komunikacyjne pozostawiają je bezczynne. Spójność zarządzana sprzętowo daje projektantom systemów kolejny sposób na ograniczenie tego kosztu koordynacji.
Znaczenie propozycji wynika z jej mechanizmu i wciąż istniejącej luki. Panmnesia i Meta połączyły recenzowany argument architektoniczny z krzemem komponentowym i węższymi dowodami produkcyjnymi. Nie pokazały jeszcze kompletnego centrum danych działającego jak jeden układ.
Deweloperzy i nabywcy korporacyjni powinni teraz patrzeć dalej niż na maksymalną liczbę akceleratorów. Warto pytać, gdzie znajdują się dane, jak często się przemieszczają, które łącza je przenoszą i co dzieje się, gdy jedna ścieżka zwalnia. Śledź trzy powyższe sygnały, gdy dostawcy publikują wyniki. Jeśli testy wieloszafowe potwierdzą stabilne opóźnienia ogonowe i ograniczone awarie, CXL przejdzie od technologii współdzielonej pamięci w kierunku definiującej fabric AI.



