Finansowanie Positron AI wspiera wyzwanie dla Nvidia oparte na pamięci
Finansowanie Positron AI osiągnęło 875 mln dolarów 10 września, zapewniając startupowi nowy kapitał do podjęcia wyzwania wobec sposobu, w jaki systemy skoncentrowane wokół Nvidia obsługują inferencję AI. Finansowanie wycenia Positron na 5 mld dolarów, zgodnie z jego ogłoszeniem o finansowaniu. Jednak procesor stojący za tą wyceną, nazwany Asimov, nie wszedł jeszcze do produkcji.
Ta luka definiuje całą historię. Positron nie oferuje po prostu kolejnego akceleratora z inną mieszanką rdzeni obliczeniowych. Firma twierdzi, że generatywna inferencja AI stała się problemem przemieszczania danych w pamięci, a nie wyłącznie wyścigiem o większą moc arytmetyczną.
Firma zaprojektowała Asimov wokół LPDDR5X, technologii pamięci o niższym poborze energii, powszechnie kojarzonej z urządzeniami mobilnymi. Wiodące akceleratory Nvidia dla centrów danych wykorzystują natomiast pamięć o wysokiej przepustowości, czyli HBM, umieszczoną blisko procesora dla szybkiego dostępu do danych.
Positron twierdzi, że ta architektura stawiająca pamięć na pierwszym miejscu zapewni większą użyteczną pojemność i lepszą ekonomikę energetyczną dla dużych modeli. Firma twierdzi również, że projekt może ominąć część ograniczeń podaży i pakowania HBM.
Obietnice te pozostają niezweryfikowane w produkcyjnym krzemie. Planowane zakończenie projektu Asimov w formie tapeout, czyli przekazanie ukończonego projektu do produkcji, ma nastąpić pod koniec 2026 roku. Produkcja jest planowana na drugą połowę 2027 roku.
Rzeczywistą rywalizacją są więc układy AI stawiające pamięć na pierwszym miejscu kontra ugruntowane systemy GPU zbudowane wokół HBM. Positron pozyskał kapitał, aby wejść do tej rywalizacji, ale nie dostarczył jeszcze dowodów z produkcji potrzebnych do jej rozstrzygnięcia.
Finansowanie Positron AI przekształca tezę architektoniczną w zakład na produkcję
Runda finansowania wspiera konkretną transformację: przeniesienie Asimov z projektu technicznego do wyprodukowanego krzemu i systemów komercyjnych.
Finansowanie napłynęło w dwóch transzach. Positron poinformował o pozyskaniu 375 mln dolarów w rundzie Series C przy wycenie pre-money wynoszącej 3,5 mld dolarów. Następnie przeprowadzono Series C-1 o wartości do 500 mln dolarów, co podniosło ogłoszoną łączną kwotę do 875 mln dolarów.
NEA, Atreides Management, Valor Equity Partners, Andra Capital, SemiAnalysis Capital i Jim Clark znaleźli się wśród liderów rundy. Wśród innych uczestników były Qatar Investment Authority, Cisco Investments, Naver Ventures i Hudson River Trading.
Do rady dyrektorów firmy dołączyli również przedstawiciele kilku inwestorów. Te zmiany bezpośrednio łączą pozyskanie finansowania z kolejną fazą produkcji i komercjalizacji.
Positron podał, że kapitał wesprze tapeout Asimov oraz zwiększanie produkcji Titan, planowanego serwera do inferencji. Firma rozszerzy także moce produkcyjne związane ze swoim portfolio sprzętowym.
Firma pozyskała wcześniej 230 mln dolarów w lutym 2026 roku przy wycenie przekraczającej 1 mld dolarów. Reuters podał, że PitchBook oszacował tę wcześniejszą wycenę na około 1,06 mld dolarów. Najnowsza runda zwiększa więc wycenę Positron kilkukrotnie w ciągu siedmiu miesięcy.
Ten wzrost pokazuje, jak wysoko inwestorzy wyceniają potencjalną wartość infrastruktury inferencyjnej. Nie dowodzi jednak, że Asimov działa zgodnie z zapowiedziami.
Positron ma już system pierwszej generacji o nazwie Atlas. Firma twierdzi, że ponad 50 szaf Atlas jest wdrażanych w Oracle Cloud Infrastructure. Parasail wykorzystuje tę pojemność dla swojej usługi inferencyjnej, a Jump Trading i i3d.net również wskazano jako klientów produkcyjnych.
Atlas ma znaczenie, ponieważ daje Positron doświadczenie operacyjne przed pojawieniem się Asimov. Nie eliminuje jednak ryzyka wykonawczego związanego z nowym niestandardowym procesorem, podsystemem pamięci, interconnectem, kompilatorem i platformą serwerową.
Asimov oznacza znacznie większe zobowiązanie techniczne. Positron planuje zbudować układ w zaawansowanym procesie produkcyjnym i zintegrować go z serwerami Titan zawierającymi cztery lub osiem układów.
Udany tapeout zakończyłby jedynie jeden etap. Powstały krzem musi następnie spełnić cele dotyczące częstotliwości, zużycia energii, uzysku, pamięci, sieci i oprogramowania w rzeczywistych obciążeniach.
Positron musi także zapewnić wystarczającą liczbę komponentów i odpowiednie moce produkcyjne, aby dostarczać systemy na skalę komercyjną. Zaawansowane układy mogą napotykać opóźnienia, nawet gdy ich założenia architektoniczne wydają się solidne.
Inwestorzy finansują więc dwie powiązane tezy. Po pierwsze, popyt na inferencję uzasadni nową kategorię sprzętu. Po drugie, Positron potrafi przełożyć swoją tezę dotyczącą pamięci na niezawodny sprzęt, zanim platformy obecnych liderów znów zrobią postępy.
Druga z tych tez jest trudniejsza. Nvidia będzie nadal rozwijać swoją roadmapę GPU, podczas gdy Positron przechodzi od projektu do produkcji układów.
Wielkość rundy daje Positron większą przestrzeń do absorbowania problemów inżynieryjnych. Nie może jednak uczynić rozwoju półprzewodników przewidywalnym.
Dlaczego pamięć stała się wąskim gardłem inferencji
Główny argument Positron brzmi: wiele generatywnych obciążeń AI poświęca zbyt dużo czasu na przenoszenie danych modelu, a zbyt mało na wykorzystywanie dostępnej mocy obliczeniowej.
Inferencja AI to proces uruchamiania już wytrenowanego modelu w celu wygenerowania odpowiedzi, obrazu, prognozy lub działania. Różni się od trenowania, które dostosowuje model za pomocą rozbudowanych zbiorów danych i powtarzanych obliczeń.
Inferencja dużych modeli językowych zwykle obejmuje dwa etapy. Pierwszy przetwarza dane wejściowe użytkownika, a drugi generuje tokeny wyjściowe jeden po drugim.
Etap generowania tokenów często silnie zależy od przepustowości pamięci. Akcelerator wielokrotnie pobiera wagi modelu, czyli wartości numeryczne kodujące to, czego model się nauczył.
Układ może dysponować znaczną mocą arytmetyczną, a mimo to pozostawiać część jej niewykorzystaną, gdy wartości te nie docierają wystarczająco szybko. Większa teoretyczna moc obliczeniowa nie rozwiązuje automatycznie problemu przemieszczania danych.
Dłuższe prompty dodają kolejny punkt presji. Systemy inferencyjne utrzymują pamięć podręczną klucz-wartość, powszechnie nazywaną KV cache, która przechowuje pośrednie dane uwagi z wcześniejszych tokenów.
Ta pamięć podręczna rośnie wraz z wydłużaniem się rozmów, dokumentów i historii agentów. Może zużywać znaczną ilość pamięci przy wielu równoczesnych użytkownikach.
Positron zaprojektował swoją architekturę Asimov wokół zarówno pojemności, jak i użytecznej przepustowości. Firma wymienia konfiguracje od 288 GB do 2,3 TB pamięci LPDDR5X na układ.
Twierdzi, że osiąga 2,76 TB na sekundę możliwej do wykorzystania przepustowości pamięci oraz współczynnik TDP bliski 400 watów. Thermal design power opisuje poziom ciepła, z którym system chłodzenia musi być przygotowany sobie poradzić.
Positron twierdzi również, że Asimov może wykorzystać ponad 90% dostępnej przepustowości pamięci w obciążeniach transformerowych. Porównuje tę wartość z mniej niż 30% dla GPU uruchamiających te same modele.
Te wartości procentowe pochodzą od Positron, a nie z niezależnych benchmarków produkcyjnych. Należy je traktować jako deklaracje projektowe, dopóki zewnętrzni testerzy nie będą mogli ocenić wyprodukowanych układów.
Wybór LPDDR5X ma kluczowe znaczenie dla tego podejścia. LPDDR oznacza pamięć low-power double data rate, technologię zaprojektowaną w celu ograniczenia zużycia energii przy efektywnym przesyłaniu danych.
HBM zapewnia bardzo wysoką szczytową przepustowość dzięki pamięci ułożonej pionowo i umieszczonej blisko akceleratora. Stała się niezbędna dla czołowych GPU AI, ale wymaga wyspecjalizowanej produkcji i zaawansowanego pakowania.
LPDDR5X nie zapewnia takiej samej szczytowej przepustowości z pojedynczego konwencjonalnego pakietu pamięci. Odpowiedzią Positron jest użycie wielu kanałów pamięci i zrównoważenie otaczającej mocy obliczeniowej względem przepustowości, którą firma spodziewa się faktycznie uzyskać.
Nie jest to po prostu zastąpienie droższej pamięci tańszą. Procesor, kontrolery pamięci, układ fizyczny, interconnect i oprogramowanie muszą działać jako jedna architektura.
Asimov zawiera dwie operacyjne połówki, które Positron nazywa hemisferami. Każda ma własny podsystem pamięci i może obsługiwać odrębną pracę albo uczestniczyć w większym obciążeniu.
Układ obejmuje również konfigurowalną macierz systoliczną, czyli siatkę elementów przetwarzających, która przesuwa obliczenia przez regularny potok. Positron twierdzi, że macierz może zmieniać orientację dla różnych operacji transformerowych.
Dedykowany sprzęt obsługuje funkcje obejmujące normalizację, softmax i kodowanie pozycyjne. Operacje te występują w całej inferencji transformerowej i mogą tworzyć narzut, gdy są wielokrotnie kierowane przez ścieżki wykonawcze ogólnego przeznaczenia.
Rdzenie procesorowe oparte na Arm zapewniają drogę dla mniej przewidywalnych operacji. Ta mieszanka ma utrzymać typowe zadania na wyspecjalizowanym sprzęcie, nie czyniąc procesora całkowicie nieelastycznym.
Mechanizm jest wystarczająco wiarygodny, by zasługiwać na uwagę. Przemieszczanie danych zużywa czas i energię, podczas gdy rozmiary modeli oraz wymagania dotyczące kontekstu nadal rosną.
Mimo to efektywność architektoniczna zależy od zachowania obciążeń. System zoptymalizowany pod ograniczoną pamięciowo generację tokenów może oferować mniejszą przewagę w przypadku intensywnego obliczeniowo przetwarzania danych wejściowych lub innych klas modeli.
Positron przyznaje, że różne akceleratory mogą specjalizować się w różnych fazach inferencji. Teza firmy nie wymaga, by GPU stały się powszechnie przestarzałe.
Wymaga, by układy AI stawiające pamięć na pierwszym miejscu wygrywały wystarczająco wiele wartościowych obciążeń, aby nabywcy zaakceptowali kolejną platformę sprzętową i programową.
Asimov i Titan celują w modele obciążające pamięć GPU
Positron skupia się na dużych modelach, rozszerzonym kontekście i wysokiej współbieżności użytkowników, a nie na każdym obciążeniu inferencyjnym.
Planowany serwer Titan łączy cztery lub osiem procesorów Asimov. Specyfikacje Titan firmy Positron wymieniają do 18,4 TB pamięci akceleratorów i do 6 TB pamięci hosta.
Firma twierdzi, że serwer może obsługiwać modele zawierające nawet 32 biliony parametrów. Reklamuje również okna kontekstowe przekraczające 10 mln tokenów.
Są to deklaracje dotyczące pojemności, a nie dowód, że każdy model przy tych limitach zapewni akceptowalną szybkość lub dokładność. Sama liczba parametrów nie opisuje praktycznej wydajności systemu.
Na wynik wpływają także architektura modelu, precyzja numeryczna, batchowanie, wymagania pamięci podręcznej, ruch sieciowy i optymalizacja oprogramowania. Rzadki model mixture-of-experts zachowuje się również inaczej niż gęsty model o tej samej łącznej liczbie parametrów.
Docelowe przypadki użycia są jednak jasne. Przetwarzanie długich dokumentów, trwałe agenty AI, systemy multimodalne i generowanie wideo mogą stawiać wysokie wymagania wobec pamięci akceleratora.
Agent AI do programowania może potrzebować plików repozytorium, wyników narzędzi, wcześniejszych decyzji i rozbudowanej historii interakcji. Asystent badawczy dla przedsiębiorstwa mógłby przetwarzać tysiące dokumentów, zachowując materiał dowodowy podczas długiej sesji.
Modele wideo muszą działać na sekwencjach czasowych zamiast na odizolowanych tokenach tekstowych. Może to zwiększać ilość danych pośrednich, które system inferencyjny musi przechowywać i przenosić.
Pamięć o dużej pojemności może ograniczyć potrzebę dzielenia modelu między wiele urządzeń. Mniejsza liczba partycji może uprościć komunikację i uniknąć części narzutu sieciowego.
Positron twierdzi, że każdy procesor Asimov będzie oferował 16 Tb/s bezpośredniej przepustowości między układami. Proponowane klastry firmy mogą łączyć nawet 16 384 układy przy użyciu kilku topologii sieciowych.
Na poziomie serwera firma wymienia obsługę PCI Express 6 i Compute Express Link. Compute Express Link, czyli CXL, pozwala procesorom i akceleratorom uzyskiwać dostęp do podłączonej pamięci za pośrednictwem wspólnego protokołu.
Interfejsy te mają znaczenie, ponieważ inferencja nie odbywa się wyłącznie wewnątrz akceleratora. Hosty obsługują zadania takie jak tokenizacja, harmonogramowanie, próbkowanie, żądania i zarządzanie pamięcią podręczną.
Duża pula pamięci ma również wartość operacyjną wykraczającą poza możliwość uruchomienia jednego ogromnego modelu. Dostawcy mogliby ładować kilka modeli, obsługiwać więcej użytkowników lub utrzymywać większe pamięci podręczne bez częstego przenoszenia danych z pamięci masowej.
Jednak pojemność staje się wartościowa tylko wtedy, gdy oprogramowanie potrafi efektywnie ją alokować. Kompilatory, środowiska uruchomieniowe modeli, systemy harmonogramowania, narzędzia obserwowalności i mechanizmy odzyskiwania po awarii decydują o tym, czy operatorzy mogą niezawodnie korzystać ze sprzętu.
Przewaga Nvidia wykracza poza specyfikacje jej chipów. CUDA, zoptymalizowane biblioteki, sprawdzone narzędzia wdrożeniowe i duża społeczność deweloperów ograniczają pracę potrzebną do uruchamiania nowych modeli.
Positron musi zapewnić kompatybilne frameworki i niezawodne narzędzia. Nabywcy będą porównywać czas wymagany do wdrożenia i utrzymania obciążeń, a nie tylko liczbę tokenów na wat.
Startup twierdzi, że jego oprogramowanie będzie obsługiwać powszechnie używane interfejsy modeli. Istotny test nastąpi, gdy inżynierowie spoza firmy przeniosą reprezentatywne aplikacje bez bezpośredniej pomocy zespołu Positron.
Titan zaprojektowano zarówno dla instalacji chłodzonych powietrzem, jak i cieczą. Ta elastyczność odpowiada na praktyczne ograniczenie operatorów centrów danych, którzy mają ograniczony dostęp do nowej infrastruktury chłodzenia.
Jednak nominalny pobór mocy chipu na poziomie 400 watów nie odzwierciedla całego serwera ani szafy rackowej. Pamięć, procesory hosta, sieć, konwersja zasilania, wentylatory i sprzęt chłodzący również wpływają na zużycie energii przez obiekt.
Najbardziej miarodajne porównanie będzie zatem dotyczyć kompletnych systemów. Nabywcy potrzebują danych o przepustowości, opóźnieniach, wykorzystaniu zasobów, energii i kosztach operacyjnych, zmierzonych przy tym samym obciążeniu i celu usługowym.
Wąski benchmark akceleratora nie odpowie na te pytania. Nie odpowie na nie także teoretyczna wartość przepustowości pamięci.
Prawdziwym rywalem jest platforma Nvidia oparta na HBM
Positron musi przewyższyć kompletną platformę GPU, a nie jedynie wykazać przewagę w nieefektywnym fragmencie jednego benchmarku.
GPU Nvidia dla centrów danych łączą rozbudowane możliwości obliczeniowe z HBM i szybkimi interkonektami. Firma sprzedaje także systemy w skali rackowej, które łączą procesory, sieć, oprogramowanie i chłodzenie.
Taka integracja daje klientom jedną platformę z jasno określoną odpowiedzialnością za szkolenie i inferencję. Pozwala też zespołom infrastruktury wykorzystywać znajome narzędzia programistyczne w różnych obciążeniach.
Positron przyjmuje przeciwne podejście architektoniczne dla swojego docelowego segmentu. Zaczyna od wymagań pamięciowych inferencji generatywnej i dodaje wystarczającą moc obliczeniową, aby ta pamięć mogła pracować produktywnie.
To rozróżnienie tworzy ostrzejsze porównanie niż prosta narracja o startupie kontra zasiedziały gracz. Stawia pytanie, czy sprzęt do inferencji zaprojektowany w konkretnym celu może przezwyciężyć elastyczność i dojrzałość oprogramowania GPU.
Systemy Nvidia mogą obsługiwać szkolenie, przetwarzanie danych wejściowych, generowanie tokenów, obciążenia naukowe i inne przyspieszone aplikacje. Ta elastyczność pomaga operatorom utrzymywać kosztowną infrastrukturę w użyciu, gdy zmienia się popyt.
Asimov jest bardziej wyspecjalizowany. Specjalizacja może zwiększać efektywność, lecz może także ograniczać dostępne obciążenia, gdy zmieniają się priorytety klientów.
Kwestia HBM dodaje kolejny wymiar. HBM zapewnia wysoką przepustowość, jednak jego podaż zależy od ograniczonej grupy producentów pamięci i złożonych możliwości pakowania.
Positron argumentuje, że LPDDR5X daje mu dostęp do szerszego łańcucha dostaw pamięci o niższych wymaganiach energetycznych. Qatar Investment Authority wskazał ograniczenie zależności od ograniczonej podaży HBM i zaawansowanego pakowania w swoim oświadczeniu inwestycyjnym.
To twierdzenie dotyczące łańcucha dostaw ma znaczenie strategiczne. Akcelerator, który omija trudno dostępne komponenty, może być łatwiejszy w produkcji i skalowaniu, nawet jeśli nie wygrywa w każdej kategorii wydajności.
Jednak popyt na każdą alternatywną pamięć może się zmienić po dużym wdrożeniu. Positron musi zabezpieczyć odpowiedni wolumen LPDDR5X, utrzymać integralność sygnału w wielu kanałach i zwalidować cały projekt.
Technologia HBM również nie będzie stała w miejscu. Dostawcy pamięci nadal poprawiają pojemność, przepustowość i efektywność energetyczną, podczas gdy Nvidia może dostosowywać swoje architektury i konfiguracje systemów.
Nvidia dysponuje także przewagą wynikającą ze skali. Jej relacje z dostawcami, zobowiązania produkcyjne i zasięg wśród klientów mogą ograniczać ryzyka, którymi mniejsza firma musi zarządzać bezpośrednio.
Inni specjaliści od inferencji zwiększają presję z innej strony. Groq podkreśla deterministyczne wykonywanie i generowanie tokenów o niskich opóźnieniach. Cerebras wykorzystuje procesory w skali wafla z dużą pamięcią na chipie i rozległą wewnętrzną przepustowością.
SambaNova oferuje zintegrowane systemy zbudowane wokół własnej architektury przepływu danych. Dostawcy chmurowi również wdrażają własne akceleratory, w tym tensor processing units Google oraz chipy Inferentia Amazon.
Te alternatywy pokazują, że niezadowolenie z ekonomiki uniwersalnych GPU nie jest zjawiskiem wyjątkowym dla Positron. Jednocześnie utrudniają rynek, ponieważ klienci mają kilka wyspecjalizowanych opcji.
Założyciele Positron mają istotne doświadczenie operacyjne. Dyrektor generalny Mitesh Agrawal wcześniej pełnił funkcję dyrektora operacyjnego Lambda, a współzałożyciel Thomas Sohmers pracował w Groq i Lambda.
To doświadczenie łączy projektowanie chipów z realiami wdrażania infrastruktury. Nie gwarantuje jednak, że klienci przyjmą kolejną zastrzeżoną platformę.
Runda finansowania Positron AI daje firmie zasoby bliższe tym, których oczekuje się w zaawansowanym programie półprzewodnikowym. Jej wycena na poziomie 5 mld dolarów podnosi także oczekiwania, zanim powstanie decydujący produkt.
Inwestorzy w praktyce wycenili już pomyślną produkcję, konkurencyjną wydajność, popyt klientów i skalowanie produkcji. Niespełnienie któregokolwiek z tych kamieni milowych osłabiłoby argumentację stojącą za tą wyceną.
Nvidia nie musi pokonać Asimov w każdym benchmarku. Może utrzymać klientów, oferując wystarczającą efektywność przy niższym ryzyku migracji i szerszym zakresie obsługiwanych obciążeń.
Zadanie Positron jest bardziej wymagające. Firma musi dostarczyć korzyść wystarczająco dużą, by uzasadnić zmiany w oprogramowaniu, ryzyko zakupowe i zależność od młodszego dostawcy.
Czego twierdzenia Positron dotyczące wydajności jeszcze nie dowodzą
Największa niepewność nie dotyczy tego, czy pamięć ma znaczenie, lecz tego, czy symulowana przewaga Asimov przetrwa produkcję i wdrożenie u klientów.
Opublikowane przez Positron porównania Titan wskazują na istotne ograniczenie. Firma twierdzi, że wydajność Asimov opiera się na symulacjach dokładnych cykl po cyklu, które modelują zachowanie chipu przed powstaniem fizycznego krzemu.
Takie symulacje są normalnym elementem rozwoju półprzewodników. Inżynierowie wykorzystują je do testowania architektury, szacowania wydajności i znajdowania problemów projektowych przed kosztownym tapeoutem.
Nie są one równoważne pomiarom z wyprodukowanych chipów. Rzeczywiste urządzenia mierzą się ze zmiennością taktowania, ciepłem, dostarczaniem energii, zachowaniem pamięci, wadami produkcyjnymi i nieoczekiwanymi wąskimi gardłami oprogramowania.
Positron porównuje symulowane wyniki Asimov z danymi o GPU Nvidia z SemiAnalysis InferenceX. Ten framework może zapewniać szczegółowe modelowanie obciążeń, lecz porównanie wymaga ostrożnej interpretacji.
SemiAnalysis Capital współprowadził finansowanie Positron, a założyciel Dylan Patel dołączył do rady dyrektorów firmy. Ta relacja nie unieważnia danych, ale czytelnicy powinni ją uwzględnić.
Niezależna ocena powinna odtworzyć porównanie przy użyciu udokumentowanych modeli, precyzji numerycznych, długości promptów, długości odpowiedzi, zasad batchowania i wymagań dotyczących opóźnień.
Liczba tokenów na sekundę może wyglądać imponująco, gdy system obsługuje duże batch'e. Aplikacja interaktywna może priorytetowo traktować opóźnienie przed pierwszym tokenem oraz stałe opóźnienie dla każdego użytkownika.
Liczba tokenów na wat może także ukrywać granice systemu. Porównanie ograniczone do akceleratorów może pomijać hosty, pamięć, sieć i sprzęt chłodzący.
Liczba tokenów na dolara wymaga założeń dotyczących zakupu, wykorzystania, energii elektrycznej, finansowania, utrzymania i cyklu życia systemu. Różne założenia mogą prowadzić do odmiennych wyników dla identycznego sprzętu.
Jakość modelu wprowadza kolejną zmienną. Niższa precyzja numeryczna może zwiększyć szybkość i zmniejszyć wymagania pamięciowe, ale aplikacje muszą potwierdzić, że wyniki pozostają akceptowalne.
Dojrzałość oprogramowania stanowi odrębne ryzyko. Nowy akcelerator może dobrze działać na wybranych modelach, a jednocześnie mieć trudności z nietypowymi operacjami, szybkimi zmianami architektury lub niestandardowym kodem korporacyjnym.
Positron uwzględnia uniwersalne rdzenie Arm jako ścieżkę awaryjną dla nieobsługiwanych operacji. Może to poprawić kompatybilność, choć częste przełączanie na tę ścieżkę mogłoby zmniejszyć przewidywaną przewagę wydajnościową.
Niezawodność musi również zostać wykazana w dużych klastrach. Positron proponuje konfiguracje sięgające tysięcy chipów, gdzie awarie komponentów i zachowanie sieci stają się rutynowymi problemami operacyjnymi.
Klienci będą oczekiwać checkpointingu, monitorowania stanu, izolacji obciążeń, mechanizmów bezpieczeństwa i przewidywalnego odzyskiwania. Te funkcje rzadko pojawiają się w nagłówkowych wynikach benchmarków.
Harmonogram wdrożenia stwarza ryzyko czasowe. Tapeout Asimov ma nastąpić pod koniec 2026 roku, a następnie produkcja w drugiej połowie 2027 roku.
Pierwszy tapeout nie zawsze daje krzem gotowy do produkcji. Wykrycie poważnego problemu może wymagać poprawionego projektu i kolejnego cyklu produkcyjnego.
Tymczasem konkurenci będą wypuszczać nowy sprzęt i oprogramowanie. Cel wydajnościowy, który wygląda korzystnie wobec jednej generacji GPU, może być mniej przekonujący w momencie dostawy produktu.
Obecne wdrożenie Atlas zapewnia Positron rzeczywiste opinie klientów. Mimo to Asimov zmienia wystarczająco wiele elementów stosu, że wykorzystanie Atlas nie może potwierdzić jego końcowej wydajności.
Firma twierdzi, że Atlas działa w skali hyperscalera dzięki ponad 50 szafom rackowym w Oracle Cloud Infrastructure. Zewnętrzne informacje dotyczące wykorzystania, struktury obciążeń, poziomów usług i ekonomiki pozostają ograniczone.
Te informacje pomogłyby nabywcom odróżnić fizyczne wdrożenie od trwałego popytu produkcyjnego. Sama liczba szaf rackowych nie pokazuje, jak duży ruch obsługują systemy.
Żadna z tych niepewności nie podważa tezy o podejściu memory-first. Określają one, jakich dowodów wciąż brakuje.
Positron wyjaśnił, jak jego architektura powinna działać. Kolejny etap musi pokazać, jak zachowuje się poza modelami firmy i wybranymi wdrożeniami.
Trzy sygnały zdecydują, czy zakład memory-first się sprawdzi
Jakość tapeoutu, niezależne benchmarki i powtarzalne wdrożenia u klientów zdecydują, czy ta runda sfinansowała trwałą alternatywę dla Nvidia.
Pierwszym sygnałem będzie tapeout Asimov i początkowy krzem. Positron zakłada tapeout pod koniec 2026 roku, a następnie produkcję w drugiej połowie 2027 roku.
Istotną aktualizacją nie będzie uroczyste ukończenie projektu. Nabywcy powinni obserwować, czy pierwsze chipy się uruchamiają, obsługują docelowe modele i zbliżają się do zapowiedzianych parametrów częstotliwości oraz poboru mocy.
Pomyślny wynik pierwszego krzemu wzmocniłby argumentację Positron dotyczącą realizacji planu. Przeprojektowanie lub poślizg harmonogramu skróciłyby czas dostępny przed rozwojem konkurencyjnych platform.
Drugim sygnałem będzie niezależnie odtwarzalny benchmark. Powinien porównywać kompletne systemy Asimov i GPU przy identycznych modelach, długościach kontekstu, zasadach batchowania i celach dotyczących opóźnień.
Wyniki powinny obejmować czas do pierwszego tokenu, szybkość generowania, wykorzystanie pamięci, całkowity pobór mocy systemu i utrzymywaną przepustowość. Powinny także ujawniać precyzję numeryczną oraz wersje oprogramowania.
Korzystny wynik w kilku rodzajach obciążeń wspierałby tezę o chipie inferencyjnym Asimov. Dobre wyniki wyłącznie w jednym starannie wybranym scenariuszu sugerowałyby węższy rynek.
Trzecim sygnałem będzie powtarzalny popyt produkcyjny. Najbardziej użytecznym dowodem byliby kolejni klienci rozszerzający wdrożenia poza pilotaże po eksploatacji sprzętu Positron w rzeczywistych warunkach świadczenia usług.
Nabywcy powinni szukać szczegółów dotyczących obciążeń, wykorzystania, niezawodności usług i wzrostu wdrożeń. Wskazani z nazwy klienci mają większe znaczenie, gdy ich wykorzystanie trwa po początkowym ogłoszeniu.
Instalacja Atlas w Oracle daje Positron wiarygodny punkt wyjścia. Wdrożenie obejmujące 50 szaf rackowych tworzy również środowisko, w którym firma może zdobywać doświadczenie w zakresie planowania zadań, chłodzenia, konserwacji i integracji oprogramowania.
Najmocniejszym potwierdzeniem byłoby przełożenie tych doświadczeń na wdrożenia Titan. Gdyby obecni klienci wybierali systemy Asimov, wskazywałoby to, że Positron przekształcił zaufanie operacyjne w popyt na nową architekturę.
Dodatkowego kontekstu dostarczą reakcje konkurencji. Nvidia może poprawiać wydajność inferencji za pomocą nowych GPU, aktualizacji oprogramowania, formatów o niższej precyzji i wyspecjalizowanych konfiguracji systemowych.
Dostawcy chmury również mogą kierować klientów ku własnym akceleratorom. Inne startupy mogą celować w te same ograniczenia związane z pamięcią i opóźnieniami, stosując inne kompromisy techniczne.
Ta presja oznacza, że Positron nie ma niekwestionowanego pola do działania. Jego szansa zależy od dostarczenia rozwiązania, zanim zidentyfikowana przez firmę luka się zmniejszy.
Dla deweloperów praktycznym pytaniem jest przenośność. Wsparcie frameworków, obsługa modeli, narzędzia do debugowania i nakład pracy związany z wdrożeniem pokażą, czy Asimov jest dostępny także dla zespołów niespecjalistycznych.
Dla nabywców infrastruktury decydującą miarą jest pełna ekonomika świadczenia usług. Wydajność sprzętowa ma znaczenie tylko wtedy, gdy zapewnia niezawodną przepustowość przy akceptowalnych kosztach operacyjnych.
Dla zespołów tworzących produkty AI większa pojemność pamięci może umożliwić dłuższą historię agentów, większe konteksty pobierane z zewnętrznych źródeł oraz bardziej wymagające aplikacje multimodalne. Korzyści te nadal wymagają modeli, które potrafią efektywnie wykorzystać tę pojemność.
Runda finansowania Positron AI o wartości 875 mln dolarów zmieniła argument techniczny w dobrze finansowany program produkcyjny. Nie zamieniła jednak symulacji w układy krzemowe ani prognoz w wyniki klientów.
Warto obserwować pierwsze chipy, pierwsze niezależne pomiary i pierwsze ponowne zamówienia. Jeśli wszystkie trzy pojawią się zgodnie z harmonogramem, inferencja stawiająca pamięć na pierwszym miejscu stanie się poważną opcją zakupową. Jeśli którykolwiek z tych elementów zawiedzie, zintegrowana platforma GPU Nvidia pozostanie trudna do wyparcia.



