NVIDIA Vera Rubin NVL72 deklaruje 67-krotnie lepszą wydajność na dolara, ale punkt pracy ma znaczenie
NVIDIA Vera Rubin NVL72 uzyskał deklarowaną 67-krotną przewagę pod względem wydajności na dolara nad GB300 NVL72 we wczesnym teście wnioskowania agentowego. Liczba ta jest rzeczywista w ramach wybranego porównania benchmarkowego, ale nie stanowi uniwersalnego mnożnika. Przy bardziej typowych prędkościach obsługi zmierzona przewaga była znacznie mniejsza.
Wyniki z 14 września dają nabywcom infrastruktury pierwsze niezależne spojrzenie na Rubin w obciążeniu obejmującym długi kontekst i wiele tur. Sprawiają też, że wcześniejsza prognoza wydajności CEO NVIDIA, Jensena Huanga, wygląda konserwatywnie. Największy mnożnik zależy jednak od wymagającego punktu pracy, w którym porównywana konfiguracja Blackwell zbliża się do granicy swojej wydajności.
Główne starcie nie dotyczy więc po prostu Rubin kontra Blackwell. Chodzi o zestawienie nagłośnionej deklaracji z wydajnością, którą operatorzy mogą odtworzyć w różnych modelach, silnikach obsługi, celach opóźnień i ruchu produkcyjnym. NVIDIA najwyraźniej przesunęła całą tę krzywą wydajności, ale odległość na niej gwałtownie się zmienia.
NVIDIA Vera Rubin NVL72 przechodzi od prognoz do zmierzonej pracy agentowej
Istotna zmiana polega na tym, że Rubin ma teraz zmierzone wyniki wnioskowania agentowego, a nie tylko specyfikacje architektury lub prognozy NVIDIA.
SemiAnalysis opublikował pierwsze zweryfikowane wyniki Rubin z AgentX, swojego benchmarku dla ruchu agentów programistycznych z długim kontekstem. Testy wykorzystywały sesje o charakterystyce produkcyjnej, z narastającym kontekstem, przerwami na narzędzia, ponownym użyciem prefiksów i seriami równoległych subagentów.
Taki ruch różni się od konwencjonalnego benchmarku chatbota. Podstawowe zapytanie czatowe często obejmuje jeden prompt i jedną odpowiedź. Agent może prowadzić setki tur, wywołując narzędzia, konsultując subagentów i wielokrotnie przesyłając rosnącą historię rozmowy.
Te wzorce stawiają przed systemem wnioskowania inne wymagania. Długie historie zużywają pojemność pamięci podręcznej klucz-wartość, która przechowuje wcześniej obliczone dane uwagi. Ponownie używane prefiksy premiują skuteczne buforowanie, natomiast serie subagentów sprawdzają harmonogramowanie i współbieżność.
Publiczna metodologia AgentX opiera się na 393 sesjach programistycznych typu opt-in, zawierających 135 282 żądania. Mediana zrekonstruowanego żądania obejmuje 142 016 tokenów wejściowych i 444 tokeny wyjściowe.
AgentX usuwa prompty, kod, argumenty narzędzi i wyniki narzędzi. Zachowuje długości żądań, czas, relacje współdzielonych prefiksów i strukturę subagentów, a następnie zastępuje je deterministycznymi syntetycznymi tokenami.
Taka konstrukcja zapewnia bardziej realistyczne kształty ruchu bez ujawniania oryginalnej treści. AgentX nie testuje jednak, czy model tworzy poprawny kod ani czy skutecznie wykonuje zadanie agenta. Mierzy system obsługi, a nie inteligencję modelu.
Nowe wyniki wykorzystały DeepSeek V4 Pro i wczesny stos TensorRT-LLM. TensorRT-LLM to środowisko wykonawcze NVIDIA do wnioskowania, służące optymalizacji działania modeli na jej akceleratorach.
Według analizy benchmarku Rubin, Vera Rubin NVL72 zapewnił około 67 razy większą całkowitą przepustowość na modelowany koszt posiadania niż GB300 NVL72 przy 170 tokenach na sekundę.
W porównaniu wykorzystano TensorRT-LLM i NVFP4, czterobitowy format numeryczny NVIDIA do obliczeń AI o niższej precyzji. Zmierzono też pełną konfigurację sprzętowo-programową, zamiast porównywać teoretyczne specyfikacje układów.
W tym samym punkcie pracy Rubin osiągnął uderzającą przewagę, ponieważ wybrana krzywa GB300 TensorRT-LLM znajdowała się blisko najszybszego zmierzonego punktu końcowego. SemiAnalysis podał znacznie mniejszą przewagę Rubin nad GB300 działającym na SGLang, innym frameworku obsługującym.
Wynik nadal ma znaczenie. Rubin nie wygrał wyłącznie dlatego, że benchmark wybrał przestarzałą generację lub podstawowy serwer z pojedynczym GPU. Pokonał system NVIDIA Blackwell Ultra w skali szafy rack, obsługując ten sam duży model i utrzymując dopasowany cel prędkości odpowiedzi.
Jednak wartość 67x opisuje jeden punkt na krzywej wydajności. Nie oznacza, że każda implementacja Rubin generuje 67 razy więcej tokenów przy tym samym całkowitym koszcie.
W zakresie od 60 do 100 tokenów na sekundę, który SemiAnalysis opisuje jako bardziej reprezentatywny dla dostawców obsługujących to obciążenie, Rubin zapewnił około 1,4 do trzech razy większą przepustowość na całkowity koszt.
To mniej spektakularne niż 67x, ale istotne z handlowego punktu widzenia. Utrzymywany dwukrotny wzrost może zmienić planowanie pojemności, gdy energia, sieć, chłodzenie i dostępna przestrzeń centrum danych już ograniczają rozbudowę.
Wyniki pokazują także wyższą maksymalną interaktywność. Rubin osiągnął około 276 tokenów P90 na sekundę, wobec około 172 dla GB300 przy użyciu wybranej konfiguracji TensorRT-LLM.
Interaktywność P90 mierzy szybkość strumieniowania osiąganą przez 90 procent odpowiedzi. Pomaga operatorom określić, czy wynik przepustowości zapewnia także akceptowalne doświadczenie użytkownika.
Przewaga Rubin nie była identyczna w różnych stosach oprogramowania. SemiAnalysis stwierdził, że GB300 działający na SGLang może osiągać interaktywność podobną do Rubin, choć Rubin zachował inne przewagi w zakresie przepustowości i opóźnień.
Ta zmienność ustanawia główne napięcie artykułu. NVIDIA Vera Rubin NVL72 wydaje się znacząco szybszy, lecz jego największa raportowana przewaga wynika z określonej kombinacji modelu, środowiska wykonawczego, precyzji i celu poziomu usługi.
Dlaczego wnioskowanie agentowe czyni energię zasobem deficytowym
Najbardziej istotnym zyskiem Rubin nie jest szczytowa wydajność obliczeniowa, lecz ilość użytecznego ruchu agentowego, który może obsłużyć w ramach stałego limitu mocy.
Agent zużywa więcej tokenów niż prosta interakcja czatowa, ponieważ każdy krok może stać się kontekstem dla kolejnego. Agenci badawczy, programistyczni i wsparcia mogą przeszukiwać bazy danych, uruchamiać narzędzia, analizować wyniki i delegować pracę przed udzieleniem odpowiedzi.
NVIDIA podaje, że żądania agentowe zużywają około 15 razy więcej tokenów niż proste żądania czatowe, na podstawie danych OpenRouter. Wartość ta będzie różnić się w zależności od aplikacji, ale ogólny kierunek jest jasny.
Wraz ze wzrostem kontekstu system wielokrotnie przetwarza lub pobiera informacje z wcześniejszych tur. Wiele subagentów może także powodować krótkie, intensywne serie współbieżnych żądań.
Te cechy sprawiają, że pojemność pamięci, przepustowość pamięci, opóźnienia interconnectu, zarządzanie pamięcią podręczną i koordynacja CPU stają się ograniczeniami pierwszego rzędu. Surowa wydajność tensorowa pozostaje ważna, ale nie wyjaśnia już całego wyniku obsługi.
Dostęp do energii elektrycznej stanowi kolejne ograniczenie. Operator może być w stanie kupić dodatkowe akceleratory, lecz nie mieć wystarczającej przepustowości sieci energetycznej, aby je zasilić. Budowa nowych stacji transformatorowych, przyłączy przesyłowych, systemów chłodzenia i hal danych trwa dłużej niż instalacja serwerów.
Przepustowość na megawat mierzy zatem więcej niż efektywność energetyczną. Przybliża, ile rozliczalnej pracy operator może uzyskać z deficytowego zasobu infrastruktury.
Przy 100 tokenach na sekundę SemiAnalysis zmierzył dla Rubin około 59,4 mln całkowitych tokenów na sekundę na megawat mocy użytkowej. Najmocniejsza zmierzona konfiguracja GB300 osiągnęła 28,5 mln przy tym samym celu.
To czyni Rubin około 2,09 razy szybszym niż najmocniejszy silnik GB300 w tym praktycznym punkcie pracy. GB300 działający na TensorRT-LLM osiągnął 21,1 mln tokenów na sekundę na megawat.
Wielkość przewagi zmieniała się wraz ze wzrostem wymagań dotyczących prędkości. Przy 150 tokenach na sekundę Rubin utrzymał prawie 37 mln tokenów na sekundę na megawat, czyli około 7,2 razy więcej niż zmierzony wynik GB300 SGLang.
Przy 170 tokenach na sekundę przewaga Rubin pod względem przepustowości na megawat wyniosła 62,9 razy nad GB300 TensorRT-LLM. W porównaniu z GB300 SGLang mnożnik wyniósł jednak 5,56.
Ta różnica pokazuje, dlaczego każda duża deklaracja wydajności wymaga etykiety silnika. Nabywca porównujący wyłącznie nazwy akceleratorów przeoczyłby, jak bardzo środowisko wykonawcze zmienia wynik.
Wcześniejsze dane NVIDIA pokazywały inny obraz tego samego trendu. Firma zgłosiła do 30 razy większą przepustowość na megawat niż GB300 przy 160 tokenach na sekundę.
NVIDIA podała, że testy wykorzystywały obciążenie AgentX DeepSeek V4 Pro. W chwili publikacji firma zaznaczyła także, że wyniki oczekiwały na weryfikację SemiAnalysis i nie obejmowały wydajności Vera CPU dla wywołań narzędzi.
Późniejsza weryfikacja potwierdza znaczącą przewagę Rubin, ale nie jeden stały mnożnik. Dane NVIDIA dotyczące wydajności agentowej pokazują wzrost przewagi z około dwukrotnej przy 110 tokenach na sekundę do 30-krotnej przy 160.
Ta krzywa ma większe znaczenie niż pojedynczy wykres słupkowy. Dostawca wnioskowania wybiera równowagę między współbieżnością, szybkością odpowiedzi, czasem do pierwszego tokena, całkowitym opóźnieniem i kosztem.
Konfiguracja zoptymalizowana pod maksymalną łączną przepustowość może sprawić, że każdy użytkownik będzie czekał zbyt długo. System zoptymalizowany pod ekstremalną interaktywność może pozostawiać kosztowną pojemność niewykorzystaną.
Produkty agentowe wprowadzają kolejną komplikację. Wykonywanie narzędzi, kompilacja kodu, pobieranie danych i zewnętrzne wywołania API mogą pozostawiać GPU w oczekiwaniu na CPU lub usługi zdalne.
Rubin rozwiązuje ten problem dzięki 36 procesorom Vera CPU obok 72 GPU Rubin w każdej szafie NVL72. NVIDIA zaprojektowała te procesory do obsługi orkiestracji agentów, wywołań narzędzi, przetwarzania danych i wykonywania w izolowanym środowisku.
Argument ekonomiczny staje się silniejszy, jeśli te komponenty ograniczają czas bezczynności w całym przepływie pracy. Słabnie, jeśli zewnętrzne narzędzia, wywołania sieciowe lub logika aplikacji pozostają dominującym wąskim gardłem.
Dla dostawców chmurowych i laboratoriów modeli presja jest natychmiastowa. Duża przewaga Rubin utrudniłaby uzasadnienie dalszej rozbudowy Blackwell pod nową, ograniczoną dostępnością mocy pojemność wnioskowania.
Istniejące wdrożenia Blackwell nie staną się nagle nieekonomiczne. Ich sprzęt jest już zainstalowany, oprogramowanie dojrzałe, a wiele obciążeń nie potrzebuje najwyższego zakresu interaktywności Rubin.
Wymuszona odpowiedź jest bardziej selektywna. Operatorzy muszą zdecydować, które obciążenia powinny najpierw trafić na Rubin, które powinny pozostać na Blackwell, a które można przenieść na konkurencyjne akceleratory.
Ekstremalna współoptymalizacja jest mechanizmem stojącym za zyskiem Rubin
Wynik NVIDIA wynika z koordynacji GPU, CPU, pamięci, interconnectu, środowiska wykonawczego i infrastruktury, a nie z działania pojedynczego szybszego układu.
NVIDIA nazywa tę strategię ekstremalną współoptymalizacją. Vera Rubin NVL72 integruje 72 GPU Rubin i 36 procesorów Vera CPU za pośrednictwem NVLink szóstej generacji w jednej domenie obejmującej skalę szafy rack.
GPU Rubin zawiera 288 GB pamięci HBM4 o przepustowości 22 TB na sekundę. Pamięć o wysokiej przepustowości znajduje się blisko procesora i dostarcza dane modelu szybciej niż konwencjonalna pamięć serwerowa.
NVLink zapewnia 3,6 TB na sekundę przepustowości dla każdego GPU oraz 260 TB na sekundę w całej szafie. Ta struktura pozwala 72 GPU zachowywać się bardziej jak jeden duży zasób obliczeniowy.
Architektura ta przynosi korzyści modelom mixture-of-experts. Takie modele aktywują wybrane sieci ekspertów dla każdego tokena, zamiast używać każdego parametru w każdej operacji.
Ich efektywna obsługa wymaga szybkiego routingu między procesorami. Opóźnienia w przenoszeniu aktywacji między ekspertami mogą marnować moc obliczeniową, która na arkuszu specyfikacji wygląda imponująco.
Rubin usprawnia także operacje synchronizacji wykorzystywane podczas rozproszonego wnioskowania. Mniejszy narzut komunikacyjny oznacza, że procesory spędzają więcej czasu na obliczeniach i mniej na oczekiwaniu na koordynację.
Architektura rackowa NVIDIA łączy Rubin z siecią ConnectX-9, jednostkami przetwarzania danych BlueField-4, przełącznikami NVLink i platformą Ethernet Spectrum-6.
Firma opisuje obecnie szerszy system jako architekturę siedmiu układów po dodaniu Groq 3 LPU. LPU to procesor zaprojektowany z myślą o przewidywalnym wykonywaniu modeli językowych z niskimi opóźnieniami.
Rubin obsługuje wymagające obliczeniowo przetwarzanie kontekstu, nazywane również prefill. Raki LPX zbudowane z procesorów Groq 3 mogą koncentrować się na wrażliwym na opóźnienia generowaniu tokenów, określanym jako decode.
Ten podział jest znany jako rozdzielone serwowanie. Umożliwia operatorom niezależne skalowanie zasobów prefill i decode, zamiast wymuszać realizację obu faz na identycznym sprzęcie.
Obciążenia agentowe czynią ten podział atrakcyjnym, ponieważ ich żądania zawierają długie historie wejściowe, ale mogą wymagać szybkich, interaktywnych odpowiedzi. Prefill potrzebuje pojemności pamięci i równoległej mocy obliczeniowej, podczas gdy decode zyskuje na niskich opóźnieniach.
Dopasowanie przepływności równoważy następnie tempo wymiany pracy między obiema pulami. Słabe dopasowanie może pozostawić jedną grupę bezczynnie, gdy druga staje się przeciążona.
Oprogramowanie obsługujące spina te komponenty. TensorRT-LLM dostarcza zoptymalizowane jądra, natomiast NVIDIA Dynamo koordynuje inferencję w rozproszonych zasobach.
Wyniki AgentX pokazują, dlaczego oprogramowanie należy traktować jako część produktu. Różnica między GB300 korzystającym z TensorRT-LLM a GB300 korzystającym z SGLang sięgnęła kilkudziesięciokrotności w jednym punkcie końcowym.
Nie oznacza to, że jeden silnik jest uniwersalnie lepszy. Najmocniejszy silnik dla GB300 zmieniał się w zależności od testowanego zakresu prędkości: TensorRT-LLM prowadził przy jednym celu, a SGLang przy wyższych celach.
Wczesny wynik Rubina pojawił się, zanim jego stos oprogramowania w pełni dojrzał. Stwarza to pole do poprawy, ale wprowadza również niepewność wdrożeniową.
NVIDIA twierdzi, że platforma jest w pełnej produkcji i ma zostać wysłana w drugiej połowie 2026 roku. Wcześniejsze twierdzenie firmy dotyczące platformy mówiło o nawet dziesięciokrotnie lepszej wydajności inferencji na wat niż Blackwell.
SemiAnalysis stwierdziło nawet siedmiokrotnie lepszą przepustowość na megawat w pobliżu badanego obszaru pracy w porównaniu z wcześniejszą, trzykrotną ilustracją Huanga z GTC. Przy niektórych dopasowanych punktach końcowych zmierzona wielokrotność była znacznie wyższa.
Wspiera to interpretację „sandbaggingu”, ale tylko w wąskim sensie. Prezentacja Huanga obejmowała szerokie oczekiwania wobec platformy, podczas gdy nowy wynik dotyczy jednego obciążenia agentowego i konkretnych konfiguracji.
Projekt Rubina atakuje również problem zasilania. Centra danych zwykle wymiarują systemy elektryczne pod maksymalny możliwy pobór mocy przez rack, nawet gdy obciążenia inferencyjne rzadko stale zużywają tę maksymalną moc.
NVIDIA DSX MaxLPS wykorzystuje dynamiczną alokację mocy, aby odzyskać niewykorzystany zapas w GPU i rackach. System próbuje umieścić więcej mocy obliczeniowej w ramach tego samego limitu lokalizacji, nie przekraczając budżetu zasilania obiektu.
Dokumentacja MaxLPS opisuje przykładowe wdrożenie inferencyjne o mocy jednego megawata z 400 GPU. W tym przykładzie dynamiczne zarządzanie zwiększa przepustowość tokenów do 1,35 raza względem statycznej wartości bazowej maksymalnej mocy.
NVIDIA twierdzi, że połączenie planowania obiektu i kontroli mocy może obsłużyć nawet o 40 procent więcej GPU w stałym budżecie. To twierdzenie dotyczące planowania, a nie gwarantowany wynik dla każdej lokalizacji.
Operatorzy muszą zweryfikować rzeczywisty profil zużycia energii przez swoje obciążenia, wydajność chłodzenia, margines bezpieczeństwa i wpływ na opóźnienia. Flota, która często osiąga szczytowy pobór mocy, zaoferuje mniej możliwego do odzyskania zapasu.
Mechanizm ma zatem charakter multiplikatywny. Szybsze GPU, szersza pamięć, łącza o niższych opóźnieniach, lepsze harmonogramowanie, wyspecjalizowane CPU i dynamiczne zarządzanie energią usuwają różne wąskie gardła.
Jeśli te warstwy współdziałają, Rubin może generować więcej użytecznych tokenów w tym samym budynku. Jeśli jedna warstwa nie skaluje się odpowiednio, teoretyczny zysk maleje, zanim dotrze do klientów.
Twierdzenie o 67x Maleje Poza Wybranym Punktem Pracy
Benchmark potwierdza przewagę Rubina, ale pokazuje też, dlaczego maksymalna wartość wydajności na dolara nie powinna stać się założeniem planowania dla całej floty.
Pierwszym ograniczeniem jest wybrany punkt końcowy. Przy 170 tokenach na sekundę porównywana konfiguracja GB300 TensorRT-LLM znajdowała się blisko zmierzonego pułapu interaktywności.
Niewielkie zwiększenie celu prędkości może gwałtownie zmniejszyć ilość ruchu obsługiwanego przez system blisko tej granicy. Rubin wciąż miał niewykorzystany zakres wydajności, co stworzyło niezwykle dużą proporcję.
Porównanie Rubina z GB300 SGLang przy tym samym celu zmniejszyło przewagę przepustowości na megawat z 62,9 raza do 5,56 raza. To nadal dużo, ale opowiada inną historię zakupową.
Drugim ograniczeniem jest model całkowitego kosztu. SemiAnalysis oblicza koszt posiadania, uwzględniając sprzęt, sieć, energię, finansowanie, kolokację, okres użytkowania oraz zakładane warunki zakupowe hyperscalerów.
Mniejszy dostawca będzie mieć inne warunki finansowania, wykorzystania i infrastruktury. Najemca chmury zobaczy również inną relację między wydajnością sprzętu a zakontraktowaną pojemnością.
Wydajność na dolara zależy od utrzymywania sprzętu w ciągłym użyciu. Akcelerator o znakomitej ekonomice szczytowej może rozczarować, jeśli popyt napływa nierównomiernie lub oprogramowanie uniemożliwia wysokie wykorzystanie.
Trzecim ograniczeniem jest zakres obciążenia. Opublikowany wynik Rubina koncentruje się na DeepSeek V4 Pro przy kształcie ruchu agentów programistycznych AgentX.
Klient obsługujący krótsze prompty, generowanie obrazów, wyszukiwanie, wideo, modele gęste lub zadania wsadowe offline napotka inne wąskie gardła. Samo SemiAnalysis zauważa, że porównawcze zyski Rubina są mniejsze w przypadku inferencji wsadowej offline i trenowania.
AgentX wykorzystuje również syntetyczne ładunki. Zachowuje długości, współdzielone prefiksy, harmonogram i rozgałęzienia, ale nie może zachować semantycznej treści prywatnych sesji.
Dekodowanie spekulatywne stanowi szczególne wyzwanie. Ta technika wykorzystuje mniejszy lub szybszy model roboczy do proponowania kilku przyszłych tokenów, a następnie prosi model główny o ich zaakceptowanie lub odrzucenie.
Syntetyczny tekst może powodować nierealistyczne zachowanie akceptacji. AgentX radzi sobie z tym, używając długości akceptacji zmierzonych na osobnym zbiorze danych programistycznych i rejestrując te ustawienia.
Ta kontrola poprawia porównywalność, ale nadal pozostaje przybliżeniem. Benchmark nie może odtworzyć szablonów własnościowych dostawców, ukrytego rozumowania, narzędzi po stronie serwera, obrazów ani każdej transformacji tokenizera.
Wykonanie w zamkniętej pętli wprowadza kolejny niuans. Szybsze systemy przechodzą dalej przez próbkowane sesje w czasie testu, więc mogą napotkać nieco inny miks żądań.
Żadna z tych kwestii nie unieważnia wyniku. Określają one, co wynik mierzy i gdzie nabywcy powinni wymagać dodatkowych dowodów.
Czwartym ograniczeniem jest wczesne oprogramowanie. SemiAnalysis użyło przedpremierowej wersji TensorRT-LLM, a późniejsze wydania powinny poprawić efektywność Rubina.
Wczesne oprogramowanie może również zawierać regresje, niekompletne funkcje i zachowania operacyjne, które nie pojawiają się w kontrolowanym benchmarku. Dojrzałe stosy Blackwell miały więcej czasu na uwzględnienie poprawek produkcyjnych.
Niezawodność ma znaczenie w skali racka. Kompletny rack NVL72 zawiera 1,3 miliona komponentów i niemal 1 300 układów, według NVIDIA.
Operator centrum danych potrzebuje trwałej efektywnej przepustowości, czyli użytecznego wyniku po uwzględnieniu awarii, konserwacji, ponownych prób i niedostępnego sprzętu. Szczytowa przepustowość benchmarku nie mierzy całego tego bilansu operacyjnego.
Piątym ograniczeniem jest reakcja konkurencji. AMD wprowadziło akcelerator Instinct MI455X w lipcu 2026 roku dla platformy rackowej Helios.
Oficjalne specyfikacje MI455X wymieniają 40,3 petaflopa szczytowej wydajności MXFP4 i architekturę CDNA5. Szczytowych wartości arytmetycznych nie można bezpośrednio porównywać z wynikami AgentX.
SemiAnalysis uwzględniło wcześniejszy MI355X w nowych pomiarach. Przy 100 tokenach na sekundę najsilniejsza testowana konfiguracja MI355X osiągnęła około 2,01 miliona tokenów na sekundę na megawat.
Rubin osiągnął w tym punkcie 59,4 miliona, co dało zgłoszoną przewagę 29,5 raza. Według SemiAnalysis AMD zobowiązało się do współpracy przy przyszłych testach AgentX dla MI455X.
To przyszłe porównanie będzie znacznie bardziej istotne niż Rubin zestawiony z MI355X. Sprawdzi dwie aktualne platformy rackowe przy tym samym obciążeniu, modelu, kształcie ruchu i docelowym poziomie usług.
TPU7x Ironwood Google również celuje w duże modele gęste i mixture-of-experts. Jego dostępność przez Google Cloud daje klientom kolejną ścieżkę, łączącą niestandardowy krzem z pionowo zintegrowaną platformą programową.
NVIDIA zachowuje przewagę pod względem głębi ekosystemu. CUDA, TensorRT-LLM, Dynamo, NVLink i sieć partnerów zapewniają firmie kontrolę nad większą częścią ścieżki wdrożenia.
Ta kontrola może poprawić optymalizację, ale może również pogłębiać zależność klientów od jednego dostawcy. Ekstremalne współprojektowanie działa najlepiej, gdy nabywcy akceptują cały stos.
Wiarygodna interpretacja nie brzmi, że Rubin jest wszędzie 67 razy lepszy. Chodzi o to, że Rubin przesuwa granicę użytecznej inferencji, zwłaszcza dla dużych obciążeń agentowych o rygorystycznych wymaganiach interaktywności.
Więcej Tokenów na Gigawat Nie Oznacza Automatycznie Większego Zysku
Rubin może poprawić ekonomię centrów danych, ale zysk zależy od wykorzystania, popytu, niezawodności i cen sprzedaży, których benchmark nie może ustalić.
SemiAnalysis szacuje, że Rubin może generować ponad dwukrotnie większy roczny zysk na gigawat niż Blackwell. Firma oczekuje, że różnica ta będzie się zwiększać wraz z dojrzewaniem jąder i oprogramowania obsługującego.
Szacunek ten wynika z rozsądnego mechanizmu. Jeśli jeden megawat generuje więcej rozliczalnych tokenów, rośnie potencjał przychodów, podczas gdy przydział sieci energetycznej obiektu pozostaje stały.
Niższy koszt jednostkowy może także zwiększać marże lub wspierać niższe stawki dla klientów. Dostawcy mogą wybierać między zatrzymaniem zysku z efektywności a wykorzystaniem go do pozyskania większego popytu.
Przepustowość reprezentuje jednak pojemność, a nie sprzedaż. Dostawca zarabia więcej tylko wtedy, gdy klienci wykorzystują tę dodatkową pojemność po zrównoważonych stawkach.
Profil popytu musi odpowiadać sprzętowi. Największe przewagi Rubina pojawiają się w długokontekstowych, interaktywnych obciążeniach agentowych, a nie w każdej formie obliczeń AI.
Tworzy to problem alokacji. Dostawcy potrzebują wystarczającego ruchu agentowego, aby utrzymać nowe racki w użyciu, bez przenoszenia obciążeń, które działają bardziej ekonomicznie gdzie indziej.
Efektywność modeli może także zmniejszyć zapotrzebowanie infrastrukturalne na zadanie. Lepsze architektury, krótsze ślady rozumowania, ulepszone buforowanie i mniejsze wyspecjalizowane modele mogą obniżyć zużycie tokenów.
Równie prawdopodobny jest efekt przeciwny. Tańsze tokeny mogą zachęcić programistów do tworzenia dłużej działających agentów, używania większej liczby subagentów i automatyzowania zadań, które wcześniej były nieekonomiczne.
To znany efekt odbicia w informatyce. Efektywność obniża koszt operacji, a następnie oprogramowanie rozszerza się, aby wykorzystać nową pojemność.
NVIDIA mocno stawia na ten scenariusz. Jej narracja traktuje centra danych jako fabryki AI, których produktem są tokeny, a nie konwencjonalne usługi obliczeniowe.
Metafora ma swoje ograniczenia. Tokeny znacząco różnią się wartością. Token, który przyczynia się do ukończenia zadania programistycznego, jest wart więcej niż token wygenerowany podczas nieudanego cyklu rozumowania.
Benchmarki agentowe nadal mają trudności z połączeniem efektywności infrastruktury z ukończoną pracą. AgentX celowo pozostawia zachowanie modelu poza swoim zakresem i nie ocenia jakości wyników.
Pełny test ekonomiczny mierzyłby koszt na pomyślnie ukończone zadanie, a nie tylko koszt na milion tokenów. Obejmowałby dokładność modelu, ponowne próby, awarie narzędzi oraz wysiłek człowieka potrzebny do przeglądu wyników.
Opóźnienia również pośrednio wpływają na przychody. Szybszy agent może ukończyć więcej zadań i utrzymać zaangażowanie użytkowników, ale tylko wtedy, gdy aplikacja i narzędzia zewnętrzne odpowiadają z porównywalną szybkością.
Zgłaszane wyniki opóźnień end-to-end Rubina są zachęcające. Przy jednym porównywalnym poziomie efektywności kosztowej SemiAnalysis zmierzyło około 20 sekund dla Rubina oraz 60 sekund dla B200 lub B300.
Przy wyższym poziomie przepustowości w relacji do kosztu firma podała około 20 sekund dla Rubina i 120 sekund dla porównywanych systemów Blackwell.
Pomiary te wzmacniają argument za Rubinem, ponieważ łączą wyższą przepustowość z krótszym czasem realizacji. Nadal są jednak wynikami benchmarków zależnymi od konkretnej konfiguracji.
Zysk zależy również od szybkości wdrożenia. Opóźnione uruchomienie szafy rack nie generuje żadnych tokenów, niezależnie od prognozowanej efektywności.
NVIDIA zaprojektowała Rubin wokół formatu rack MGX trzeciej generacji, aby ułatwić instalację i serwis. Taca obliczeniowa wykorzystuje wewnętrzną konstrukcję bez kabli, węży i wentylatorów.
Firma twierdzi, że czas montażu i serwisowania tacy skrócił się z niemal dwóch godzin do pięciu minut. Praktyka eksploatacyjna pokaże, czy te zmiany konstrukcyjne poprawiają dostępność floty.
Chłodzenie i gęstość mocy pozostają poważnymi kwestiami infrastrukturalnymi. Rubin koncentruje znaczne zapotrzebowanie elektryczne w pojedynczej szafie rack, co wymaga kompatybilnego chłodzenia cieczą i dystrybucji zasilania.
Operatorzy starszych obiektów nie uzyskają tej korzyści wyłącznie przez wymianę serwerów. Mogą potrzebować nowego wyposażenia elektrycznego, dystrybucji chłodziwa, sieci oraz procedur operacyjnych.
To sprawia, że Rubin jest najbardziej atrakcyjny dla hyperscalerów, laboratoriów modeli i wyspecjalizowanych dostawców chmury, którzy już budują nowe kampusy AI. Mniejsi nabywcy mogą efektywniej uzyskać do niego dostęp za pośrednictwem usług chmurowych.
„Im więcej kupujesz, tym więcej zarabiasz” dobrze zapada w pamięć jako podsumowanie argumentacji sprzedażowej NVIDIA. Nie jest jednak prawem ekonomicznym.
Dokładniejsza wersja jest warunkowa. Im więcej wydajnej mocy operator wdroży, wypełni zadaniami, zasili i utrzyma w dostępności, tym większy przychód może obsłużyć ten stały obiekt.
Na co kupujący powinni zwracać uwagę po wyniku NVIDIA Vera Rubin NVL72
Trzy sygnały zdecydują, czy wczesna przewaga Rubina w benchmarkach przełoży się na trwałą przewagę produkcyjną.
Pierwszym sygnałem są niezależnie powtarzalne dane AgentX w różnych silnikach obsługi. Rubin potrzebuje publicznych wyników z TensorRT-LLM, SGLang i vLLM, wykorzystujących identyczne modele oraz cele poziomu usług.
To porównanie pokaże, jaka część obecnej przewagi wynika ze sprzętu Rubin, a jaka z wyjątkowo korzystnego zestawienia oprogramowania.
Historyczne wyniki powinny pozostawać widoczne wraz z ulepszaniem środowisk uruchomieniowych. W przeciwnym razie kupujący nie będą mogli odróżnić rzeczywistych zysków sprzętowych od zmian w oprogramowaniu, które przynoszą korzyści także starszym systemom.
Odtworzenie wyników przez dostawców chmury dodatkowo wzmocniłoby ten argument. Ich wdrożenia obejmują harmonogramowanie, sieci, monitorowanie, wielodzierżawność oraz ograniczenia niezawodności, których nie ma w kontrolowanych środowiskach testowych.
Jeśli Rubin utrzyma dużą przewagę w różnych silnikach i u różnych operatorów, wartość 67x będzie wyglądała na skrajny przykład szerszej zmiany. Jeśli różnica gwałtownie się zmniejszy, dominującym czynnikiem był wybór oprogramowania.
Drugim sygnałem jest wydajność MI455X i TPU7x w tym samym obciążeniu AgentX. Obecne porównania zestawiają Rubin z akceleratorami z różnych cykli produktowych albo korzystają z odmiennych metodologii benchmarkowych.
Platforma Helios firmy AMD jest najbardziej bezpośrednim rywalem, ponieważ łączy aktualne GPU, CPU, sieć i integrację w skali racka. Porównywalny test pokaże, czy stos oprogramowania NVIDIA nadal pozostaje jej decydującą przewagą.
TPU7x oferuje inną ścieżkę konkurencyjną. Google kontroluje akcelerator, kompilator, usługę chmurową i części stosu modeli, co daje firmie własną formę współprojektowania.
Jeśli którykolwiek z konkurentów zbliży się do wydajności Rubina na megawat przy użytecznej interaktywności, kupujący zyskają większą siłę negocjacyjną i więcej możliwości architektonicznych. Szeroka przewaga Rubina wzmocniłaby kontrolę NVIDIA nad infrastrukturą agentową.
Trzecim sygnałem jest ekonomika produkcyjna po uwzględnieniu wykorzystania i niezawodności. Kupujący powinni śledzić utrzymywany goodput, czas do pierwszego tokenu, opóźnienie end-to-end, pobór energii, wskaźniki awarii oraz koszt ukończonego zadania.
Powinni także oddzielać szczytową interaktywność od zakresu używanego przez rzeczywistych klientów. Przedział od 60 do 100 tokenów na sekundę może mieć większe znaczenie komercyjne niż imponujący punkt krańcowy.
DSX MaxLPS zasługuje na podobną analizę. Uruchamianie większej liczby GPU w ramach stałego limitu mocy jest wartościowe tylko wtedy, gdy system respektuje ograniczenia obiektu, nie pogarszając opóźnień ani żywotności sprzętu.
Zweryfikowany wzrost gęstości o 40 procent zwielokrotniłby sprzętową przewagę Rubina. Mniejszy wynik w warunkach rzeczywistej eksploatacji ograniczyłby prognozowaną poprawę zysku na gigawat.
Deweloperzy powinni się tym interesować, ponieważ ekonomika infrastruktury ostatecznie kształtuje projektowanie produktów. Niższe koszty obsługi agentów mogą umożliwić dłuższe sesje, szersze wykorzystanie wyszukiwania oraz więcej równoległych subagentów.
Pracownicy umysłowi odczują tę zmianę pośrednio. Szybsi i tańsi agenci mogą przetwarzać większe historie projektów, ale wartościowy rezultat nadal zależy od wiarygodnych materiałów źródłowych.
Dobrze utrzymywana osobista baza wiedzy może dostarczyć tego kontekstu, nie traktując większej liczby generowanych tokenów jako substytutu lepszych dowodów.
Wstępny werdykt jest jasny, lecz ograniczony. NVIDIA Vera Rubin NVL72 zapewnił znaczącą przewagę w agentowym wnioskowaniu, a wcześniejsza prognoza Jensena Huanga wydaje się zachowawcza.
Wartość 67x stanowi skraj krzywej, a nie jej średnią. Praktyczny zysk jest bliższy dwu- lub trzykrotności w typowych zakresach pracy, przy większych przewagach pod bardziej rygorystycznymi celami interaktywności.
To wciąż wystarcza, by wywrzeć presję na każdego dużego dostawcę infrastruktury AI. Kolejne pytanie brzmi, czy Rubin zdoła zachować tę ekonomikę, gdy benchmarki staną się wdrożeniami, a tokeny będą musiały przełożyć się na ukończoną pracę.



