top of page

Qianhe Yibang pozyskuje ponad 2 mld RMB, ale teraz potrzebuje twardych dowodów

15 sie
12 minut(y) czytania

Qianhe Yibang podobno pozyskał ponad 2 mld RMB w rundzie finansowania serii B — to wyjątkowo duża kwota jak na młodą chińską firmę produkującą układy scalone. Finansowanie zapewnia poważny kapitał na jej działania mające połączyć 3D DRAM z obliczeniami dla obciążeń sztucznej inteligencji. Tworzy też wyraźne napięcie między zaufaniem finansowym a ograniczonymi publicznie dostępnymi dowodami dotyczącymi bazowego sprzętu.

Wśród zgłoszonych inwestorów znalazły się China Structural Reform Fund oraz fundusz branżowy China Mobile. Udział wzięły również Mountain View Capital, Starlink Capital, Shixi Capital, Muyan Capital, GP Capital, Nanshan Capital i Chaos Investment. Inni wymienieni inwestorzy to Chenyih Huizhi, Guoce Investment, Guoxin Venture Capital oraz Gezhi Capital.

Według pierwotnego raportu o finansowaniu wyłącznym doradcą finansowym był Muyan Capital. Nie ujawniono ani wyceny firmy, ani kwot poszczególnych inwestycji. W ogłoszeniu zabrakło także szczegółowych wyników testów produktów, informacji o wdrożeniach u klientów, partnerach produkcyjnych i harmonogramie produkcji.

To rozróżnienie ma znaczenie. Inwestorzy sfinansowali proponowaną alternatywę dla modelu GPU i pamięci o wysokiej przepustowości, a nie publicznie zademonstrowany zamiennik tego rozwiązania. Qianhe Yibang musi teraz przełożyć kapitał na systemy możliwe do przetestowania, dostępne oprogramowanie i powtarzalne wyniki u klientów.

Runda finansuje znacznie większą ambicję chipową

Finansowanie jest istotne, ponieważ Qianhe Yibang przedstawia się jako dostawca infrastruktury, a nie projektant wąsko wyspecjalizowanych komponentów.

Publicznie dostępne informacje opisują Qianhe Yibang jako firmę z Pekinu założoną w 2024 roku. Spółka twierdzi, że zatrudnia ponad 100 osób w sześciu miastach i posiada ponad 20 patentów. Dane te pochodzą z jej strony internetowej i nie zostały niezależnie zweryfikowane.

Jej publiczne materiały opisują dwa istniejące kierunki produktowe. Jeden dotyczy inteligentnych urządzeń końcowych, a drugi przyspieszania gier i streamingu w chmurze. Oba są dość odległe od znacznie większej obietnicy związanej z obliczeniami 3D DRAM dla modeli transformatorowych.

Firma opisuje G100 jako energooszczędny system-on-chip wykorzystujący niestandardowe układy i rekonfigurowalną architekturę przepływu danych. Twierdzi, że chip obsługuje przetwarzanie mowy i obrazu w czasie rzeczywistym w piórach tłumaczących oraz urządzeniach edukacyjnych. Takie wdrożenia wskazują na praktyczne zastosowanie w urządzeniach końcowych, choć firma nie identyfikuje klientów ani nie publikuje wielkości dostaw.

Qianhe Yibang promuje także rodzinę C100 dla gier w chmurze. Firma twierdzi, że dedykowany sprzęt przyspiesza przesyłanie wideo, przetwarzanie danych o niskich opóźnieniach i poprawę obrazu. Ponownie, materiały publiczne nie zawierają niezależnych pomiarów wydajności ani nazw klientów produkcyjnych.

Narracja wokół serii B wykracza poza te produkty. Opisy w bazach danych firm przedstawiają spółkę jako dostawcę pełnostosowej infrastruktury AI, łączącej niestandardową pamięć 3D DRAM, akcelerację transformatorów, chipy, systemy akceleratorów i usługi chmurowe. To szersze i trudniejsze przedsięwzięcie.

Strategia pełnego stosu wymaga kompetencji w zakresie projektowania krzemu, integracji pamięci, pakowania, kompilatorów, oprogramowania runtime, serwerów i optymalizacji obciążeń. Każda z tych warstw może decydować o tym, czy akcelerator dobrze działa poza kontrolowaną demonstracją. Kapitał może sfinansować tę pracę, ale nie usunie ciężaru integracji.

Jedno z niedawnych zgłoszeń patentowych daje bardziej konkretny obraz kierunku firmy. Patent dotyczący kompilatora opisuje optymalizacje paged attention dla wielordzeniowego akceleratora AI.

Paged attention zarządza pofragmentowanymi blokami pamięci podręcznej klucz-wartość podczas inferencji modelu językowego. Patent omawia bezpośredni dostęp do pamięci, podwójne buforowanie i dynamiczne harmonogramowanie wielu partii. Są to rozpoznawalne problemy infrastrukturalne związane z obsługą modeli transformatorowych.

Zgłoszenie patentowe nie dowodzi gotowości komercyjnej. Wskazuje jednak, że Qianhe Yibang pracuje nad czymś więcej niż odizolowanymi urządzeniami pamięciowymi. Opisana architektura łączy przemieszczanie danych, zachowanie kompilatora i harmonogramowanie akceleratora.

To połączenie sprawia, że finansowanie ma większe znaczenie. Akcelerator skoncentrowany na pamięci nie może konkurować wyłącznie dzięki krzemowi. Potrzebuje oprogramowania, które prawidłowo rozmieszcza dane, efektywnie planuje operacje i ukrywa nieuniknione transfery.

Runda daje więc Qianhe Yibang czas na rozwój platformy. Podnosi również standard, według którego klienci i inwestorzy będą oceniać postępy. Firma finansowana na taką skalę musi w końcu ujawnić więcej niż tylko intencje architektoniczne.

Najbardziej użytecznymi dowodami byłyby układy po tape-oucie, niezależne wyniki testów, obsługiwane rodziny modeli oraz zmierzona wydajność w rzeczywistych warunkach obsługi. Próby u klientów miałyby jeszcze większe znaczenie. Dopóki takie sygnały się nie pojawią, finansowanie pozostaje silniejszym dowodem przekonania inwestorów niż dojrzałości produktu.

Dlaczego obliczenia 3D DRAM przyciągają teraz kapitał

Qianhe Yibang celuje w przemieszczanie danych modelu, jeden z najbardziej uporczywych kosztów we współczesnych systemach AI.

Tradycyjne procesory utrzymują obliczenia i pamięć jako fizycznie oddzielne elementy. Dane muszą przemieszczać się między nimi, zanim operacje zostaną zakończone. To rozdzielenie tworzy ograniczenie przepustowości i energii powszechnie nazywane ścianą pamięci.

Często cytowany przegląd ściany pamięci opisuje transfer danych jako podstawowe ograniczenie konwencjonalnych systemów komputerowych. Przenoszenie danych zużywa czas i energię, nawet gdy jednostki arytmetyczne mogą je szybko przetwarzać.

Duże modele transformatorowe nasilają ten problem. Inferencja wielokrotnie odczytuje wagi modelu i zarządza rosnącymi pamięciami podręcznymi klucz-wartość, które zachowują informacje z wcześniejszych tokenów. Większa liczba użytkowników, dłuższe konteksty i większe modele zwiększają presję na pojemność oraz przepustowość pamięci.

Współczesne akceleratory AI odpowiadają na tę presję za pomocą pamięci o wysokiej przepustowości, zwykle nazywanej HBM. HBM układa warstwy pamięci blisko procesora i łączy je szerokimi interfejsami. Taka konfiguracja zapewnia znacznie większą przepustowość niż konwencjonalna pamięć serwerowa.

HBM nie eliminuje jednak przemieszczania danych. Skraca i poszerza ścieżkę między pamięcią a obliczeniami. Pojemność, złożoność pakowania, dostępność podaży, zachowanie termiczne i całkowity koszt systemu nadal pozostają istotnymi ograniczeniami.

Compute-in-memory wykorzystuje inne podejście. Wykonuje wybrane operacje wewnątrz macierzy pamięci lub blisko przechowywanych danych. Szersza klasyfikacja technologii pokazuje, że termin ten obejmuje kilka architektur, a nie jeden uniwersalny projekt.

Niektóre systemy używają komórek pamięci bezpośrednio w obliczeniach. Inne umieszczają logikę obok macierzy pamięci lub pod warstwami pamięci stosowej. Implementacje cyfrowe, analogowe, ulotne i nieulotne mają odmienne korzyści oraz ograniczenia.

Deklarowany kierunek Qianhe Yibang koncentruje się na dostosowanej pamięci 3D DRAM. Zasadniczo układanie DRAM ze ściśle zintegrowaną logiką może zwiększyć wewnętrzną przepustowość i ograniczyć transfery przez pakiet. Może także przybliżyć wybrane operacje transformatorowe do przechowywanych danych.

Pomysł ten różni się od zastąpienia wszystkich konwencjonalnych obliczeń pamięcią analogową. Projekty oparte na DRAM mogą zachować znane zachowanie cyfrowe, jednocześnie wykorzystując bliskość i równoległość. Nadal wymagają jednak starannych decyzji, które funkcje powinny znajdować się blisko pamięci.

Moment jest sprzyjający z trzech powodów. Po pierwsze, inferencja AI stała się większym priorytetem infrastrukturalnym. Firmy dbają teraz o powtarzalny koszt obsługi modeli, a nie tylko o koszt ich trenowania.

Po drugie, dłuższe okna kontekstowe wywierają większą presję na pamięć. System musi przechowywać i odczytywać więcej danych pamięci podręcznej klucz-wartość wraz z rozwojem rozmów, dokumentów lub przepływów pracy agentów. Zarządzanie pamięcią może stać się praktycznym ograniczeniem wcześniej niż sama surowa moc obliczeniowa.

Po trzecie, chińscy inwestorzy mają silne bodźce, by wspierać krajową infrastrukturę AI. Dostęp do zaawansowanych akceleratorów, HBM, mocy produkcyjnych i pakowania pozostaje strategicznie ważny. Alternatywne architektury oferują kolejną drogę do systemów kontrolowanych lokalnie.

Lista inwestorów odzwierciedla ten strategiczny wymiar. Fundusze powiązane z państwem i fundusz China Mobile występują obok prywatnych inwestorów venture capital. Ich udział sugeruje, że szansa jest oceniana jako infrastruktura, a nie jedynie spekulacyjna cecha chipu.

Obecność China Mobile jest szczególnie istotna, ponieważ grupy telekomunikacyjne obsługują duże sieci obliczeniowe. Takie organizacje mogą zapewnić wymagające środowiska wdrożeniowe dla inferencji, aplikacji chmurowych i usług brzegowych. Udział nie potwierdza jednak umowy zakupu.

Kluczowe pytanie ekonomiczne jest proste. Czy ściślejsza integracja może ograniczyć przemieszczanie danych na tyle, by poprawić użyteczną przepustowość, zużycie energii lub pojemność na poziomie systemu? Odpowiedź nie może wynikać wyłącznie z teoretycznej wartości przepustowości.

Rzeczywiste systemy poświęcają także czas na synchronizację, przepływ sterowania, komunikację, narzut oprogramowania i operacje, które nie odwzorowują się łatwo na pamięć. Projekt może wyróżniać się w jednej operacji macierzowej, a mimo to przynosić ograniczone korzyści w całym modelu.

Dlatego deklaracje Qianhe Yibang dotyczące kompilatora i pełnego stosu mają znaczenie. Firma wydaje się rozumieć, że sprzęt pamięciowy potrzebuje oprogramowania świadomego obciążeń. Jej wyzwaniem jest udowodnienie, że kompletny stos zapewnia znaczącą przewagę.

Qianhe Yibang rzuca wyzwanie domyślnemu modelowi GPU i HBM

Główna rywalizacja nie toczy się między Qianhe Yibang a jednym startupem, lecz między nowym systemem skoncentrowanym na pamięci a ugruntowaną platformą GPU i HBM.

GPU mają ogromną przewagę wykraczającą poza szybkość procesora. Deweloperzy mają dostęp do dojrzałych narzędzi programistycznych, zoptymalizowanych kerneli, frameworków modeli, systemów profilowania, dokumentacji i ugruntowanych praktyk wdrożeniowych. Dostawcy chmurowi już obsługują otaczającą je infrastrukturę.

HBM jest częścią tej dojrzałej platformy. Dostawcy akceleratorów projektują procesory, pakiety, interkonekty i oprogramowanie wokół jej właściwości. Producenci serwerów następnie walidują te systemy pod kątem środowisk produkcyjnych.

Qianhe Yibang faktycznie argumentuje, że taki układ pozostawia zbyt wiele wydajności i energii niewykorzystanych. Jego proponowana odpowiedź łączy 3D DRAM z akceleracją transformatorów. Celem jest ograniczenie zależności od ciągłego przemieszczania danych między oddzielnymi zasobami obliczeniowymi i pamięciowymi.

Argument ten ma wartość techniczną. Przemieszczanie danych jest uznanym problemem, a badacze od dekad badają przetwarzanie blisko pamięci. Duże modele językowe tworzą obciążenia, które czynią tę kwestię szczególnie widoczną.

Technicznie uzasadniony problem nie gwarantuje jednak komercyjnie lepszego rozwiązania. Platformy GPU nadal poprawiają pojemność pamięci, interkonekty, harmonogramowanie, obsługę kwantyzacji i oprogramowanie inferencyjne. Obecna architektura nie stoi w miejscu.

Alternatywny akcelerator musi więc zaoferować więcej niż odizolowany wzrost efektywności. Potrzebuje przekonującej przewagi w zakresie wdrożenia, obsługi modeli, niezawodności i całkowitych wymagań związanych z posiadaniem. Musi też pasować do istniejących operacji centrów danych.

Zgodność oprogramowania jest jedną z głównych przeszkód. Klienci zainwestowali w frameworki, biblioteki, systemy monitorowania i wiedzę inżynierską zbudowaną wokół konwencjonalnych akceleratorów. Nowa architektura może wymuszać kosztowne zmiany, nawet gdy jej chip działa dobrze.

Zakres obsługiwanych modeli tworzy kolejną przeszkodę. Obciążenia transformatorowe obejmują mechanizmy uwagi, mnożenie macierzy, normalizację, funkcje aktywacji, trasowanie, próbkowanie i przesyłanie danych. Różne konstrukcje modeli stawiają sprzętowi odmienne wymagania.

Modele mixture-of-experts wprowadzają nieregularne trasowanie i komunikację. Systemy multimodalne łączą tekst, obrazy, dźwięk lub wideo. Systemy agentowe mogą generować nieprzewidywalne długości kontekstu i interakcje z narzędziami. Sprzęt musi radzić sobie z tymi zmiennymi, nie tracąc swojej przewagi.

Znaczenie ma również precyzja. Niektóre obciążenia inferencyjne tolerują arytmetykę niskiej precyzji, podczas gdy inne wymagają większej stabilności numerycznej. Systemy skoncentrowane na pamięci muszą obsługiwać użyteczną precyzję, nie tracąc przez to korzyści energetycznych ani powierzchniowych.

Kompleksowy przegląd sprzętu wskazuje na trudność pogodzenia wydajności, wszechstronności i dokładności porównywalnej z oprogramowaniem. Badanie dotyczy pamięci rezystywnej, a nie deklarowanej przez Qianhe Yibang architektury DRAM. Szersze ostrzeżenie pozostaje jednak aktualne.

Kolejne pytanie dotyczy miejsca, w którym faktycznie odbywają się obliczenia. Określenie „compute-in-memory” może opisywać operacje wewnątrz komórek pamięci, logikę obok macierzy albo przetwarzanie pod warstwami ułożonej pamięci DRAM. Opcje te mają różne konsekwencje produkcyjne i programowe.

Qianhe Yibang nie podał publicznie wystarczających szczegółów architektonicznych, aby precyzyjnie sklasyfikować swoją implementację. Materiały firmy odnoszą się do dostosowanej pamięci 3D DRAM i akceleracji transformerów. Nie wyjaśniają jednak podziału pracy między macierze pamięci, warstwy logiki i zewnętrzne procesory.

Brak tych szczegółów uniemożliwia uczciwe porównania z GPU, systemami HBM lub innymi akceleratorami skoncentrowanymi na pamięci. Sprawia też, że twierdzenia o zastępowaniu HBM są przedwczesne. Wiarygodne porównanie wymaga identycznych modeli, rozmiarów batchy, długości kontekstu, precyzji i celów jakościowych.

Nawet wtedy nabywcy potrzebowaliby pomiarów systemowych. Przepustowość na układ może ukrywać zużycie energii, pojemność pamięci, wymagania wobec hosta lub koszty sieciowe. Specyfikacje szczytowe rzadko opisują zachowanie utrzymywane przy mieszanym ruchu produkcyjnym.

Najsilniejsza pozycja w krótkim terminie może być bardziej ograniczona niż zastąpienie akceleratorów ogólnego przeznaczenia. Qianhe Yibang może skoncentrować się na obciążeniach inferencyjnych, w których dominuje przesyłanie danych, a struktury modeli pozostają przewidywalne. Wyspecjalizowane wdrożenia mogą potwierdzić wartość rozwiązania, zanim gotowa będzie szersza platforma.

Cloud gaming stanowi możliwy precedens organizacyjny. Firma już opisuje współprojektowanie sprzętu i oprogramowania dla obciążeń strumieniowych. To doświadczenie może pomóc w infrastrukturze wrażliwej na opóźnienia, choć cloud gaming nie potwierdza skuteczności akceleracji transformerów.

Urządzenia edukacyjne stanowią kolejny ograniczony precedens. Pokazują, że firma interesuje się niskoenergetycznym przetwarzaniem na urządzeniach końcowych. Nie dowodzą jednak, że jej architektura skaluje się do centrów danych obsługujących modele językowe.

Runda Series B daje Qianhe Yibang zasoby, aby wypełnić te luki. Jednocześnie stawia firmę w bezpośrednim porównaniu z dojrzałą platformą. O wyniku rywalizacji zdecydują użyteczne systemy, a nie nowatorstwo konstrukcji pamięci.

Finansowanie nie eliminuje ryzyka komercjalizacji

Największą niewiadomą pozostaje to, czy Qianhe Yibang potrafi produkować, programować i wdrażać swoją architekturę w powtarzalnej skali.

Compute-in-memory od lat przyciąga zainteresowanie badawcze, lecz komercjalizacja postępuje powoli. Szczegółowy opis historii komercjalizacji przedstawia zatrzymane produkty, zmiany kierunku firm i utrzymujące się spory o najlepszą ścieżkę implementacji.

Produkcja jest jednym ze źródeł ryzyka. Produkt 3D DRAM wymaga skoordynowania pamięci, logiki, łączenia warstw, pakowania, testowania i zarządzania temperaturą. Problemy w dowolnej warstwie mogą obniżyć uzysk lub opóźnić dostawy.

Firma nie wskazała publicznie odlewni, dostawcy pamięci, partnera od pakowania ani procesu produkcyjnego. Nie ogłosiła też tape-outu dla proponowanego akceleratora 3D DRAM. Te pominięcia nie dowodzą opóźnienia, ale ograniczają zewnętrzną ocenę.

Na szczególną uwagę zasługuje uzysk. Układanie większej liczby komponentów może tworzyć dodatkowe punkty awarii. Konstrukcja musi też radzić sobie z ciepłem w ciasno połączonych warstwach, nie podważając niezawodności pamięci ani trwałej wydajności.

Niezależność łańcucha dostaw może być kolejnym ograniczeniem. Akcelerator zaprojektowany w kraju nadal może zależeć od narzędzi produkcyjnych, oprogramowania do projektowania elektroniki, procesów pamięciowych, sprzętu do pakowania lub technologii interfejsów spoza Chin. Publiczne ujawnienia nie pokazują jeszcze, jak Qianhe Yibang zarządza tymi zależnościami.

Oprogramowanie jest równie ważne. Kompilator musi mapować popularne modele na akcelerator, poprawnie planować użycie pamięci i generować wydajne operacje. Deweloperzy potrzebują też debuggerów, profilerów, bibliotek runtime, dokumentacji i integracji z frameworkami.

Patent Qianhe Yibang dotyczący paged attention sugeruje aktywne prace w tym obszarze. Zgłoszenie omawia fragmentowane bloki pamięci podręcznej klucz-wartość oraz dynamiczne planowanie batchy. Nie dowodzi jednak istnienia produkcyjnego kompilatora ani zestawu narzędzi dla deweloperów.

Klienci będą również pytać o przenośność modeli. System zoptymalizowany pod jedną strukturę transformera może tracić wydajność, gdy zmieniają się wzorce uwagi, zarządzanie kontekstem lub trasowanie. Rynek oprogramowania AI porusza się szybciej niż większość cykli rozwoju układów.

Ta niezgodność tworzy ryzyko strategiczne. Specyfikacje krzemu są ustalane na długo przed produkcją, podczas gdy architektury modeli mogą zmieniać się w ciągu kilku miesięcy. Zespoły sprzętowe potrzebują wystarczającej programowalności, aby absorbować takie zmiany.

Pełnostackowa usługa chmurowa mogłaby ograniczyć ekspozycję klientów na tę złożoność. Qianhe Yibang mógłby sam obsługiwać sprzęt i oferować znajomy interfejs inferencyjny. Takie podejście wymagałoby jednak również znacznych zdolności operacyjnych i niezawodnego oprogramowania usługowego.

Kwota finansowania pomaga, ale rozszerza zobowiązania wykonawcze. Rozwój układów jest kosztowny, a budowanie infrastruktury chmurowej wprowadza kolejny kapitałochłonny biznes. Obsługa zarówno urządzeń końcowych, jak i centrów danych może rozproszyć uwagę inżynieryjną między bardzo różne rynki.

Publiczne dowody dotyczące przychodów nadal nie istnieją. Qianhe Yibang nie ujawnia dostaw, sprzedaży, wykorzystania chmury, podpisanych kontraktów ani stałych klientów. Nie publikuje też niezależnie audytowanych wyników wydajności lub opóźnień.

Wcześniejsze zapisy wskazują, że inwestorzy wspierali firmę przed tą rundą. Dokument analityczny dotyczący rynku papierów wartościowych wymieniał nieujawnione finansowanie anielskie w styczniu 2025 roku. Inny raport branżowy odnotował rundę A w czerwcu 2025 roku, również bez ogłoszonej kwoty.

Wpisy te sugerują szybki ciąg finansowania dla firmy założonej w 2024 roku. Szybkie pozyskiwanie kapitału może wspierać agresywny rozwój, ale może też przesuwać oczekiwania przed dowody produkcyjne.

Lista inwestorów Series B jest zatem istotna, lecz nie rozstrzygająca. Udział instytucji może potwierdzać szansę strategiczną, dostęp do zarządzania lub oczekiwane wsparcie polityczne. Nie potwierdza niezależnie wydajności układu.

Potencjalni klienci powinni powstrzymać się od traktowania zgłoszonej rundy jako punktu odniesienia. Finansowanie mierzy dostęp do kapitału. Nie mierzy przepustowości, opóźnień, zużycia energii, uzysku, jakości oprogramowania ani niezawodności wdrożenia.

Ta sama ostrożność dotyczy języka firmy na temat HBM. Architektura 3D DRAM może ograniczać konkretne wąskie gardła, nie zastępując HBM na całym rynku. Różne obciążenia mogą jednocześnie wspierać kilka konstrukcji pamięci.

Niezależna ocena powinna obejmować inferencję w warunkach zbliżonych do produkcyjnych. Testy wymagają realistycznych promptów, długości kontekstu, zróżnicowania batchy, jakości odpowiedzi i opóźnień na poziomie usług. Powinny również uwzględniać zużycie energii, pojemność pamięci, wykorzystanie zasobów i narzut systemu hosta.

Wyniki należy porównać z obecnymi systemami przy zastosowaniu dopasowanej optymalizacji oprogramowania. Starsza baza odniesienia lub słabo dostrojony GPU dostarczyłby niewiele użytecznych informacji. Powtarzalne warunki testowe są ważniejsze niż efektowny wskaźnik w nagłówku.

W dyskusji pojawią się też ostatecznie kwestie bezpieczeństwa i niezawodności. Akceleratory skoncentrowane na pamięci mogą wprowadzać nowe ryzyka ekspozycji danych, zachowania przy błędach i ataków kanałami bocznymi. Nabywcy obsługujący wrażliwe modele będą wymagać izolacji i kontroli operacyjnych.

Żadne z tych ryzyk nie unieważnia kierunku obranej przez Qianhe Yibang. Określają one dowody potrzebne, aby przejść od interesującej architektury do zaufanej infrastruktury. Finansowanie jedynie czyni tę ocenę pilniejszą.

Trzy sygnały pokażą, czy zakład się sprawdza

Kolejny etap należy oceniać przez pryzmat krzemu, oprogramowania i wdrożeń klientów — w tej kolejności.

Pierwszym sygnałem będzie weryfikowalny kamień milowy dotyczący krzemu. Qianhe Yibang powinien wskazać układ po tape-oucie, próbkę inżynieryjną lub urządzenie produkcyjne powiązane ze swoją strategią 3D DRAM. Nazwa produktu bez zmierzonego sprzętu nie rozstrzygnęłaby tej kwestii.

Użyteczne ujawnienie obejmowałoby pojemność pamięci, formaty precyzji, obsługiwane operacje, szczegóły interfejsów i trwałe zużycie energii. Powinno też rozróżniać przetwarzanie wewnątrz pamięci od przetwarzania w pobliżu ułożonej warstwy pamięci.

Niezależne benchmarki wzmocniłyby znaczenie tego kamienia milowego. Najbardziej informacyjne testy obejmowałyby inferencję transformerów dla kilku długości kontekstu i rozmiarów batchy. Porównywałyby zarówno jakość wyników, jak i szybkość.

Jeśli Qianhe Yibang opublikuje powtarzalne wyniki na rzeczywistym krzemie, teza finansowania stanie się silniejsza. Jeśli firma nadal będzie omawiać architekturę bez danych sprzętowych, luka między kapitałem a dowodami będzie się powiększać.

Drugim sygnałem będzie użyteczne wydanie oprogramowania. Kompilator, runtime, biblioteka modeli lub endpoint chmurowy pokazałyby, że firma potrafi udostępnić swój sprzęt deweloperom. Dokumentacja i wsparcie frameworków ujawniłyby, ile pracy aplikacyjnej jeszcze pozostaje.

Patent dotyczący paged attention tworzy konkretny punkt obserwacji. Qianhe Yibang mógłby zademonstrować dynamiczne zarządzanie pamięcią podręczną klucz-wartość przy mieszanym ruchu inferencyjnym. Połączyłoby to jego własność intelektualną z obserwowalną zdolnością produktu.

Dostępność oprogramowania wyjaśniłaby również elastyczność architektury. Obsługa kilku rodzin modeli byłaby bardziej przekonująca niż jedna zoptymalizowana demonstracja. Narzędzia do profilowania i debugowania wskazywałyby na poważne przygotowanie dla zewnętrznych użytkowników.

Wydanie oprogramowania bez dostępnego sprzętu oferowałoby ograniczone potwierdzenie. Prywatna demonstracja nadal może ukrywać problemy z instalacją, planowaniem i niezawodnością. Dostęp próbny przez usługę chmurową dostarczyłby silniejszych dowodów.

Trzecim sygnałem będzie nazwane wdrożenie u klienta. Najbardziej przekonujące ogłoszenie wskazywałoby obciążenie, skalę wdrożenia i zmierzony powód wyboru Qianhe Yibang. Ogólna umowa partnerska miałaby mniejszą wagę.

China Mobile jest oczywistym podmiotem do obserwowania, ponieważ jeden z jego funduszy branżowych dołączył do rundy. Wdrożenie w sieci, chmurze lub na brzegu sieci mogłoby dostarczyć firmie cennych dowodów operacyjnych. Sama inwestycja nie oznacza, że takie wdrożenie istnieje.

Klienci z obszaru urządzeń edukacyjnych lub cloud gamingu również mogliby potwierdzić części stosu technologicznego. Rynki te wspierałyby twierdzenia dotyczące niskoenergetycznego przetwarzania lub akceleracji streamingu. Nie potwierdzałyby jednak automatycznie infrastruktury dla dużych modeli.

Dla nabywców korporacyjnych kluczową miarą jest niezawodna ekonomika obciążenia. Obejmuje ona przepustowość, opóźnienia, zużycie energii, pojemność, nakład pracy programistycznej i niezawodność operacyjną. Przed zmianą platform akceleratorów nabywcy potrzebują pełnego obrazu.

Dla deweloperów kompatybilność zadecyduje o praktyczności tej architektury. Technicznie wydajny układ może pozostać niedostępny, jeśli modele wymagają szeroko zakrojonego przepisywania. Znajome API i przejrzyste narzędzia zmniejszyłyby tę barierę.

Dla planistów infrastruktury ta runda finansowania jest kolejnym sygnałem, że architektura pamięci stała się kluczową kwestią inwestycyjną w AI. Moc obliczeniowa nie jest już oceniana w oderwaniu od rozmieszczenia pamięci, jej pojemności, sposobu pakowania i przepływu danych.

Qianhe Yibang pozyskała wystarczające, według doniesień, finansowanie, by realizować ambitną wizję. Nie przedstawiła jednak jeszcze wystarczających publicznych dowodów, by uznać ją za komercyjną alternatywę dla systemów GPU i HBM.

Właściwą reakcją nie jest ani odrzucenie, ani akceptacja. Najpierw należy obserwować rzeczywisty krzem, następnie oprogramowanie dostępne dla deweloperów, a na końcu mierzalne wdrożenia u klientów. Te sygnały pokażą, czy finansowanie stworzyło realną platformę, czy sfinansowało kolejną obiecującą drogę laboratoryjną.

W miarę pojawiania się kolejnych dowodów czytelnicy powinni porównywać każde twierdzenie z obecnymi systemami produkcyjnymi przy dopasowanych obciążeniach. Warto pytać, które operacje działają blisko pamięci, co pozostaje na konwencjonalnych procesorach oraz jak zachowuje się kompletny serwer. Ogłoszenie finansowania rozpoczyna to badanie. Nie kończy go.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page