top of page

Positron AI-Finanzierung unterstützt eine speicherorientierte Herausforderung für Nvidia

vor 6 Tagen
13 Min. Lesezeit

Die Finanzierung von Positron AI erreichte am 10. September 875 Millionen US-Dollar und verschafft dem Startup neues Kapital, um herauszufordern, wie Nvidia-zentrierte Systeme KI-Inferenz bewältigen. Die Finanzierung bewertet Positron laut seiner Finanzierungsankündigung mit 5 Milliarden US-Dollar. Doch der Prozessor hinter dieser Bewertung, Asimov genannt, ist noch nicht in die Produktion gegangen.

Diese Lücke prägt die Geschichte. Positron bietet nicht bloß einen weiteren Beschleuniger mit einer anderen Mischung aus Rechenkernen an. Das Unternehmen argumentiert, dass generative KI-Inferenz zu einem Problem der Speicherbewegung geworden ist und nicht lediglich zu einem Wettstreit um mehr Rechenleistung.

Das Unternehmen hat Asimov auf LPDDR5X ausgelegt, einer stromsparenden Speichertechnologie, die üblicherweise mit Mobilgeräten verbunden wird. Die führenden Rechenzentrumsbeschleuniger von Nvidia verwenden dagegen High-Bandwidth Memory, kurz HBM, der für schnellen Datenzugriff nah am Prozessor platziert wird.

Positron sagt, diese speicherorientierte Architektur werde für große Modelle mehr nutzbare Kapazität und bessere Energieeffizienz bieten. Das Unternehmen behauptet außerdem, dass das Design einige Beschränkungen bei HBM-Lieferungen und Packaging umgehen kann.

Diese Versprechen sind in Produktionssilizium noch nicht bestätigt. Asimov soll gegen Ende 2026 sein Tapeout erreichen, also den Abschluss des Designs und dessen Übergabe zur Fertigung. Die Produktion ist für die zweite Hälfte des Jahres 2027 vorgesehen.

Der eigentliche Wettbewerb lautet daher speicherorientierte KI-Chips gegen etablierte, auf HBM basierende GPU-Systeme. Positron hat das Kapital erworben, um in diesen Wettbewerb einzusteigen, aber noch nicht die Produktionsnachweise geliefert, die ihn entscheiden könnten.

Die Positron AI-Finanzierung verwandelt eine Architekturthese in eine Fertigungswette

Die Runde finanziert einen konkreten Übergang: Asimov vom technischen Design zu gefertigtetem Silizium und kommerziellen Systemen zu bringen.

Die Finanzierung erfolgte in zwei Tranchen. Positron erklärte, 375 Millionen US-Dollar in einer Series-C-Runde bei einer Pre-Money-Bewertung von 3,5 Milliarden US-Dollar eingeworben zu haben. Es folgte eine Series C-1 über bis zu 500 Millionen US-Dollar, womit sich die angekündigte Gesamtsumme auf 875 Millionen US-Dollar erhöht.

NEA, Atreides Management, Valor Equity Partners, Andra Capital, SemiAnalysis Capital und Jim Clark gehörten zu den führenden Investoren der Runde. Weitere Teilnehmer waren Qatar Investment Authority, Cisco Investments, Naver Ventures und Hudson River Trading.

Der Vorstand des Unternehmens erhielt zudem Vertreter mehrerer Investoren. Diese Ergänzungen verknüpfen die Finanzierungsrunde unmittelbar mit der nächsten Phase von Fertigung und Kommerzialisierung.

Positron erklärte, das Kapital werde Asimovs Tapeout und den Produktionshochlauf von Titan, seinem geplanten Inferenzserver, unterstützen. Außerdem soll es die Fertigungskapazität für das Hardwareportfolio des Unternehmens erweitern.

Das Unternehmen hatte zuvor im Februar 2026 230 Millionen US-Dollar bei einer Bewertung von über 1 Milliarde US-Dollar eingeworben. Reuters berichtete, dass PitchBook diese frühere Bewertung auf etwa 1,06 Milliarden US-Dollar bezifferte. Die jüngste Runde steigert Positrons Bewertung damit innerhalb von sieben Monaten um ein Vielfaches.

Diese Entwicklung zeigt, wie stark Investoren den potenziellen Wert von Inferenzinfrastruktur einpreisen. Sie belegt nicht, dass Asimov die versprochene Leistung erbringt.

Positron verfügt bereits über ein System der ersten Generation namens Atlas. Das Unternehmen sagt, dass mehr als 50 Atlas-Racks bei Oracle Cloud Infrastructure bereitgestellt werden. Parasail nutzt diese Kapazität für seinen Inferenzdienst, während Jump Trading und i3d.net ebenfalls als Produktionskunden genannt werden.

Atlas ist wichtig, weil er Positron operative Erfahrung verschafft, bevor Asimov erscheint. Atlas beseitigt jedoch nicht das Ausführungsrisiko, das mit einem neuen kundenspezifischen Prozessor, Speichersubsystem, Interconnect, Compiler und einer Serverplattform verbunden ist.

Asimov stellt ein deutlich größeres technisches Engagement dar. Positron plant, den Chip mit einem fortschrittlichen Fertigungsverfahren herzustellen und ihn in Titan-Server mit vier oder acht Chips zu integrieren.

Ein erfolgreiches Tapeout würde nur eine Phase abschließen. Das resultierende Silizium muss anschließend unter realen Workloads Ziele bei Taktfrequenz, Energieverbrauch, Ausbeute, Speicher, Vernetzung und Software erfüllen.

Positron muss außerdem ausreichend Komponenten und Fertigungskapazität sichern, um Systeme im kommerziellen Maßstab auszuliefern. Fortschrittliche Chips können Verzögerungen erfahren, selbst wenn ihre architektonischen Ideen überzeugend erscheinen.

Die Investoren finanzieren daher zwei miteinander verknüpfte Annahmen. Erstens wird die Inferenznachfrage eine neue Hardwarekategorie rechtfertigen. Zweitens kann Positron seine Speicherthese in zuverlässige Systeme verwandeln, bevor etablierte Plattformen erneut voranschreiten.

Die zweite Annahme ist die schwierigere. Nvidia wird seine GPU-Roadmap weiterentwickeln, während Positron vom Design zur Fertigung übergeht.

Die Größe der Runde verschafft Positron mehr Spielraum, technische Rückschläge aufzufangen. Sie kann die Halbleiterentwicklung nicht vorhersehbar machen.

Warum Speicher zum Engpass der Inferenz geworden ist

Positrons zentrales Argument lautet, dass viele generative KI-Workloads zu viel Zeit mit dem Verschieben von Modelldaten und zu wenig Zeit mit der Nutzung verfügbarer Rechenleistung verbringen.

KI-Inferenz ist der Prozess, bei dem ein bereits trainiertes Modell ausgeführt wird, um eine Antwort, ein Bild, eine Vorhersage oder eine Aktion zu erzeugen. Diese Arbeit unterscheidet sich vom Training, bei dem ein Modell mithilfe umfangreicher Datensätze und wiederholter Berechnungen angepasst wird.

Die Inferenz großer Sprachmodelle besteht üblicherweise aus zwei Phasen. Die erste verarbeitet die Eingabe eines Nutzers, während die zweite nacheinander Ausgabe-Token erzeugt.

Diese Token-Generierungsphase hängt häufig stark von der Speicherbandbreite ab. Der Beschleuniger ruft wiederholt Modellgewichte ab, also die numerischen Werte, die festhalten, was das Modell gelernt hat.

Ein Chip kann über beträchtliche Rechenkapazität verfügen und dennoch einen Teil davon ungenutzt lassen, wenn diese Werte nicht schnell genug eintreffen. Mehr theoretische Rechenleistung löst das Problem der Datenbewegung nicht automatisch.

Längere Eingaben schaffen einen weiteren Belastungspunkt. Inferenzsysteme führen einen Key-Value-Cache, üblicherweise KV-Cache genannt, der Zwischendaten der Aufmerksamkeit aus früheren Token speichert.

Dieser Cache wächst, wenn Gespräche, Dokumente und Agentenverläufe länger werden. Bei vielen gleichzeitigen Nutzern kann er erheblichen Speicher beanspruchen.

Positron hat seine Asimov-Architektur sowohl auf Kapazität als auch auf nutzbare Bandbreite ausgerichtet. Das Unternehmen nennt Konfigurationen von 288 Gigabyte bis 2,3 Terabyte LPDDR5X-Speicher pro Chip.

Es behauptet eine realisierbare Speicherbandbreite von 2,76 Terabyte pro Sekunde und eine Thermal Design Power von rund 400 Watt. Die Thermal Design Power beschreibt die Wärmemenge, für die ein Kühlsystem ausgelegt sein muss.

Positron behauptet zudem, Asimov könne bei Transformer-Workloads mehr als 90 % seiner verfügbaren Speicherbandbreite nutzen. Dies vergleicht das Unternehmen mit weniger als 30 % bei GPUs, die dieselben Modelle ausführen.

Diese Prozentwerte stammen von Positron und nicht aus unabhängigen Produktionsbenchmarks. Sie sollten als Designbehauptungen gelesen werden, bis externe Tester gefertigte Chips bewerten können.

Die Wahl von LPDDR5X ist für diesen Ansatz zentral. LPDDR steht für Low-Power Double Data Rate, eine Technologie, die den Energieverbrauch senken und gleichzeitig Daten effizient übertragen soll.

HBM liefert durch vertikal gestapelten Speicher nahe einem Beschleuniger eine sehr hohe Spitzenbandbreite. Er ist für führende KI-GPUs unverzichtbar geworden, erfordert jedoch spezialisierte Fertigung und fortschrittliches Packaging.

LPDDR5X liefert nicht dieselbe Spitzenbandbreite aus einem einzelnen herkömmlichen Speicherpaket. Positrons Antwort besteht darin, viele Speicherkanäle einzusetzen und die umgebende Rechenleistung auf die Bandbreite abzustimmen, die das Unternehmen tatsächlich erreichen will.

Es handelt sich nicht bloß um den Austausch durch günstigeren Speicher. Prozessor, Speichercontroller, physisches Layout, Interconnect und Software müssen als einheitliche Architektur zusammenarbeiten.

Asimov enthält zwei operative Hälften, die Positron Hemisphären nennt. Jede verfügt über ein eigenes Speichersubsystem und kann getrennte Aufgaben bearbeiten oder an einem größeren Workload teilnehmen.

Der Chip umfasst außerdem ein konfigurierbares systolisches Array, ein Raster aus Verarbeitungselementen, das Berechnungen durch eine regelmäßige Pipeline bewegt. Positron sagt, das Array könne seine Ausrichtung für verschiedene Transformer-Operationen ändern.

Dedizierte Hardware übernimmt Funktionen wie Normalisierung, Softmax und Positionskodierung. Diese Operationen treten in der gesamten Transformer-Inferenz auf und können Overhead verursachen, wenn sie wiederholt über universelle Ausführungspfade verarbeitet werden.

Arm-basierte Prozessorkerne bieten einen Weg für weniger vorhersehbare Operationen. Diese Mischung soll gängige Aufgaben auf spezialisierter Hardware halten, ohne den Prozessor vollständig unflexibel zu machen.

Der Mechanismus ist glaubwürdig genug, um Aufmerksamkeit zu verdienen. Datenbewegung verbraucht Zeit und Energie, während Modellgrößen und Anforderungen an den Kontext weiter steigen.

Dennoch hängt architektonische Effizienz vom Verhalten des Workloads ab. Ein für speichergebundene Token-Generierung optimiertes System könnte bei rechenintensiver Eingabeverarbeitung oder anderen Modellklassen einen geringeren Vorteil bieten.

Positron räumt ein, dass sich verschiedene Beschleuniger auf unterschiedliche Inferenzphasen spezialisieren können. Seine Argumentation setzt nicht voraus, dass GPUs universell obsolet werden.

Sie setzt voraus, dass speicherorientierte KI-Chips genügend wertvolle Workloads gewinnen, damit Käufer eine weitere Hardware- und Softwareplattform akzeptieren.

Asimov und Titan zielen auf Modelle, die den GPU-Speicher stark beanspruchen

Positron richtet sich auf große Modelle, ausgedehnte Kontexte und hohe Nutzerparallelität, nicht auf jeden Inferenz-Workload.

Der geplante Titan-Server kombiniert vier oder acht Asimov-Prozessoren. Positrons Titan-Spezifikationen nennen bis zu 18,4 Terabyte Beschleunigerspeicher und bis zu sechs Terabyte Host-Speicher.

Das Unternehmen sagt, ein Server könne Modelle mit bis zu 32 Billionen Parametern unterstützen. Zudem wirbt es mit Kontextfenstern von mehr als 10 Millionen Token.

Dies sind Kapazitätsangaben, kein Beweis dafür, dass jedes Modell an diesen Grenzen akzeptable Geschwindigkeit oder Genauigkeit liefern wird. Die Parameterzahl allein beschreibt nicht die praktische Leistung eines Systems.

Modellarchitektur, numerische Präzision, Batching, Cache-Anforderungen, Netzwerkverkehr und Softwareoptimierung beeinflussen allesamt das Ergebnis. Ein sparsames Mixture-of-Experts-Modell verhält sich zudem anders als ein dichtes Modell mit derselben Gesamtzahl an Parametern.

Die Zielanwendungen sind dennoch klar. Die Verarbeitung langer Dokumente, persistente KI-Agenten, multimodale Systeme und Videogenerierung können Beschleunigerspeicher stark beanspruchen.

Ein KI-Coding-Agent könnte Repository-Dateien, Tool-Ergebnisse, frühere Entscheidungen und einen umfangreichen Interaktionsverlauf benötigen. Ein Forschungsassistent für Unternehmen könnte Tausende Dokumente verarbeiten und dabei Belege über eine lange Sitzung hinweg erhalten.

Videomodelle müssen mit zeitlichen Sequenzen statt mit isolierten Text-Token arbeiten. Das kann die Menge an Zwischendaten erhöhen, die ein Inferenzsystem speichern und bewegen muss.

Speicher mit hoher Kapazität kann die Notwendigkeit verringern, ein Modell auf viele Geräte aufzuteilen. Weniger Partitionen können die Kommunikation vereinfachen und einigen Netzwerk-Overhead vermeiden.

Positron sagt, jeder Asimov-Prozessor werde 16 Terabit pro Sekunde an direkter Chip-zu-Chip-Bandbreite bieten. Die vorgeschlagenen Cluster können über mehrere Netzwerktopologien bis zu 16.384 Chips verbinden.

Auf Serverebene nennt das Unternehmen Unterstützung für PCI Express 6 und Compute Express Link. Compute Express Link, kurz CXL, ermöglicht Prozessoren und Beschleunigern den Zugriff auf angebundenen Speicher über ein gemeinsames Protokoll.

Diese Schnittstellen sind wichtig, weil Inferenz nicht vollständig im Beschleuniger stattfindet. Hosts übernehmen Aufgaben wie Tokenisierung, Planung, Sampling, Anfragen und Cache-Verwaltung.

Ein großer Speicherpool hat auch über die Aufnahme eines einzigen riesigen Modells hinaus operativen Wert. Anbieter könnten mehrere Modelle laden, mehr Nutzer bedienen oder größere Caches vorhalten, ohne Daten häufig aus dem Speicher verschieben zu müssen.

Doch Kapazität wird erst wertvoll, wenn Software sie effizient zuweisen kann. Compiler, Modell-Laufzeitumgebungen, Planungssysteme, Observability-Tools und Wiederherstellung nach Fehlern entscheiden darüber, ob Betreiber die Hardware zuverlässig nutzen können.

Nvidias Vorteil reicht über die Spezifikationen seiner Chips hinaus. CUDA, optimierte Bibliotheken, etablierte Bereitstellungstools und eine große Entwicklergemeinschaft verringern den Aufwand für den Betrieb neuer Modelle.

Positron muss kompatible Frameworks und zuverlässige Toolchains bereitstellen. Käufer werden nicht nur Tokens pro Watt vergleichen, sondern auch die Zeit, die für Bereitstellung und Wartung von Workloads benötigt wird.

Das Startup erklärt, seine Software werde weit verbreitete Modellschnittstellen unterstützen. Der aussagekräftige Test wird erfolgen, wenn externe Ingenieure repräsentative Anwendungen ohne direkte Hilfe von Positrons Team portieren.

Titan ist sowohl für luftgekühlte als auch für flüssigkeitsgekühlte Installationen ausgelegt. Diese Flexibilität adressiert eine praktische Einschränkung für Rechenzentrumsbetreiber mit begrenztem Zugang zu neuer Kühlinfrastruktur.

Ein Chip mit nominell 400 Watt repräsentiert jedoch nicht den gesamten Server oder das gesamte Rack. Speicher, Host-Prozessoren, Netzwerke, Stromumwandlung, Lüfter und Kühlanlagen tragen alle zum Energieverbrauch der Anlage bei.

Der aufschlussreichste Vergleich wird daher vollständige Systeme einbeziehen. Käufer benötigen Durchsatz, Latenz, Auslastung, Energie und Betriebskosten, gemessen unter derselben Arbeitslast und demselben Serviceziel.

Ein enger Accelerator-Benchmark kann diese Fragen nicht beantworten. Ebenso wenig kann dies eine theoretische Speicherbandbreitenzahl.

Der tatsächliche Gegner ist Nvidias HBM-zentrierte Plattform

Positron muss eine vollständige GPU-Plattform übertreffen, nicht lediglich eine ineffiziente Ecke eines einzelnen Benchmarks ausnutzen.

Nvidias Rechenzentrums-GPUs kombinieren umfangreiche Rechenkapazität mit HBM und schnellen Interconnects. Das Unternehmen verkauft zudem Systeme im Rack-Maßstab, die Prozessoren, Netzwerke, Software und Kühlung verbinden.

Diese Integration bietet Kunden eine Plattform mit klarer Verantwortlichkeit für Training und Inferenz. Sie ermöglicht Infrastrukturteams zudem, vertraute Programmierwerkzeuge über mehrere Workloads hinweg wiederzuverwenden.

Positron nimmt für sein Zielsegment die entgegengesetzte architektonische Position ein. Es beginnt mit den Speicheranforderungen generativer Inferenz und ergänzt gerade genug Rechenleistung, um diesen Speicher produktiv zu halten.

Der Unterschied schafft einen präziseren Vergleich als die einfache Erzählung eines Startups gegen einen etablierten Anbieter. Er stellt die Frage, ob speziell entwickelte Inferenzhardware die Flexibilität und Software-Reife von GPUs überwinden kann.

Nvidia-Systeme können Training, Eingabeverarbeitung, Token-Generierung, wissenschaftliche Workloads und andere beschleunigte Anwendungen ausführen. Diese Flexibilität hilft Betreibern, kostspielige Infrastruktur bei wechselnder Nachfrage auszulasten.

Asimov ist stärker spezialisiert. Spezialisierung kann die Effizienz verbessern, aber auch die verfügbaren Workloads einschränken, wenn sich Kundenprioritäten verschieben.

Die HBM-Frage fügt eine weitere Dimension hinzu. HBM liefert hohe Bandbreite, doch sein Angebot hängt von einer begrenzten Gruppe von Speicherherstellern und komplexen Packaging-Kapazitäten ab.

Positron argumentiert, dass LPDDR5X Zugang zu einer breiteren Speicherlieferkette bei geringerem Energiebedarf verschafft. Die Qatar Investment Authority verwies in ihrer investment statement auf die geringere Abhängigkeit von knappem HBM und fortschrittlichem Packaging.

Diese Lieferketten-Behauptung ist strategisch wichtig. Ein Accelerator, der knappe Komponenten vermeidet, kann leichter herzustellen und auszubauen sein, selbst wenn er nicht in jeder Leistungskategorie gewinnt.

Nach einer großen Bereitstellung kann sich die Nachfrage nach jedem alternativen Speicher jedoch ändern. Positron muss ausreichende LPDDR5X-Mengen sichern, die Signalintegrität über viele Kanäle hinweg erhalten und das vollständige Design validieren.

Auch die HBM-Technologie wird nicht stillstehen. Speicherlieferanten verbessern weiterhin Kapazität, Bandbreite und Energieeffizienz, während Nvidia seine Architekturen und Systemkonfigurationen anpassen kann.

Nvidia verfügt zudem über Hebel durch seine Größe. Seine Lieferantenbeziehungen, Produktionszusagen und Kundenreichweite können Risiken senken, die ein kleineres Unternehmen direkt bewältigen muss.

Andere Inferenzspezialisten erhöhen den Druck aus einer anderen Richtung. Groq betont deterministische Ausführung und Token-Generierung mit niedriger Latenz. Cerebras nutzt Wafer-Scale-Prozessoren mit großem On-Chip-Speicher und umfangreicher interner Bandbreite.

SambaNova bietet integrierte Systeme auf Basis seiner eigenen Dataflow-Architektur. Cloud-Anbieter setzen ebenfalls eigene Accelerators ein, darunter Googles Tensor Processing Units und Amazons Inferentia-Chips.

Diese Alternativen zeigen, dass die Unzufriedenheit mit der Wirtschaftlichkeit allgemeiner GPUs nicht auf Positron beschränkt ist. Sie erschweren den Markt auch, weil Kunden mehrere spezialisierte Optionen haben.

Positrons Gründer bringen relevante operative Erfahrung mit. CEO Mitesh Agrawal war zuvor Chief Operating Officer von Lambda, während Mitgründer Thomas Sohmers bei Groq und Lambda tätig war.

Dieser Hintergrund verbindet Chipdesign mit den Realitäten der Bereitstellung von Infrastruktur. Er garantiert nicht, dass Kunden eine weitere proprietäre Plattform übernehmen werden.

Die Finanzierungsrunde von Positron AI verschafft dem Unternehmen Ressourcen, die eher denen entsprechen, die für ein fortschrittliches Halbleiterprogramm erwartet werden. Die Bewertung von 5 Milliarden US-Dollar erhöht zudem die Erwartungen, bevor das entscheidende Produkt existiert.

Investoren haben faktisch erfolgreiche Fertigung, wettbewerbsfähige Leistung, Kundennachfrage und Produktionsskalierung eingepreist. Das Verfehlen auch nur eines dieser Meilensteine würde die Argumentation hinter der Bewertung schwächen.

Nvidia muss Asimov nicht in jedem Benchmark schlagen. Das Unternehmen kann Kunden halten, indem es ausreichende Effizienz bei geringerem Migrationsrisiko und breiterer Workload-Abdeckung bietet.

Positrons Aufgabe ist anspruchsvoller. Das Unternehmen muss einen Vorteil liefern, der groß genug ist, um Softwareänderungen, Beschaffungsrisiken und die Abhängigkeit von einem jüngeren Lieferanten zu rechtfertigen.

Was Positrons Leistungsversprechen bislang nicht belegen

Die größte Unsicherheit besteht nicht darin, ob Speicher wichtig ist, sondern darin, ob Asimovs simulierter Vorteil Fertigung und Kundeneinsatz übersteht.

Positrons veröffentlichte Titan-Vergleiche weisen auf eine wichtige Einschränkung hin. Das Unternehmen erklärt, dass die Asimov-Leistung auf zyklusgenauen Simulationen beruht, die das Chipverhalten modellieren, bevor physisches Silizium existiert.

Solche Simulationen sind während der Halbleiterentwicklung normal. Ingenieure nutzen sie, um Architektur zu testen, Leistung zu schätzen und Designprobleme vor einem kostspieligen Tape-out zu finden.

Sie sind nicht gleichbedeutend mit Messungen an gefertigten Chips. Reale Geräte sind mit Taktvariationen, Hitze, Stromversorgung, Speicherverhalten, Fertigungsfehlern und unerwarteten Softwareengpässen konfrontiert.

Positron vergleicht simulierte Asimov-Ergebnisse mit Nvidia-GPU-Daten aus SemiAnalysis InferenceX. Dieses Framework kann detaillierte Workload-Modellierung liefern, doch der Vergleich verdient eine sorgfältige Interpretation.

SemiAnalysis Capital führte Positrons Finanzierung gemeinsam an, und Gründer Dylan Patel trat dem Board des Unternehmens bei. Diese Beziehung entkräftet die Daten nicht, doch Leser sollten den Zusammenhang erkennen.

Eine unabhängige Bewertung sollte den Vergleich mit dokumentierten Modellen, Präzisionen, Prompt-Längen, Ausgabelängen, Batching-Richtlinien und Latenzanforderungen reproduzieren.

Tokens pro Sekunde können beeindruckend wirken, wenn ein System große Batches bedient. Eine interaktive Anwendung kann die Verzögerung bis zum ersten Token und eine konstante Latenz pro Nutzer priorisieren.

Tokens pro Watt können ebenfalls Systemgrenzen verschleiern. Ein auf Accelerators beschränkter Vergleich kann Hosts, Speicher, Netzwerke und Kühlanlagen auslassen.

Tokens pro Dollar erfordern Annahmen über Anschaffung, Auslastung, Strom, Finanzierung, Wartung und Systemlebensdauer. Unterschiedliche Annahmen können bei identischer Hardware zu unterschiedlichen Ergebnissen führen.

Die Modellqualität bringt eine weitere Variable ein. Geringere numerische Präzision kann Geschwindigkeit erhöhen und Speicheranforderungen senken, doch Anwendungen müssen bestätigen, dass die Ausgaben akzeptabel bleiben.

Die Software-Reife ist ein separates Risiko. Ein neuer Accelerator kann bei ausgewählten Modellen gut abschneiden, während er mit ungewöhnlichen Operationen, schnellen Architekturänderungen oder kundenspezifischem Enterprise-Code Schwierigkeiten hat.

Positron integriert universelle Arm-Kerne als Ausweichpfad für nicht unterstützte Operationen. Das kann die Kompatibilität verbessern, obwohl häufige Fallbacks den prognostizierten Leistungsvorteil verringern könnten.

Auch die Zuverlässigkeit muss über große Cluster hinweg nachgewiesen werden. Positron schlägt Konfigurationen mit Tausenden von Chips vor, bei denen Komponentenausfälle und Netzwerkverhalten zu routinemäßigen betrieblichen Herausforderungen werden.

Kunden werden Checkpointing, Zustandsüberwachung, Workload-Isolierung, Sicherheitskontrollen und vorhersehbare Wiederherstellung erwarten. Diese Merkmale erscheinen selten in Schlagzeilen-Benchmark-Ergebnissen.

Der Bereitstellungszeitplan schafft ein zeitliches Risiko. Asimov soll Ende 2026 den Tape-out erreichen, gefolgt von der Produktion in der zweiten Hälfte des Jahres 2027.

Ein erster Tape-out liefert nicht immer produktionsreifes Silizium. Die Entdeckung eines schwerwiegenden Problems kann ein überarbeitetes Design und einen weiteren Fertigungszyklus erforderlich machen.

Währenddessen werden Wettbewerber neue Hardware und Software veröffentlichen. Ein Leistungsziel, das gegenüber einer GPU-Generation vorteilhaft wirkt, kann bei der Markteinführung des Produkts weniger überzeugend sein.

Die aktuelle Atlas-Bereitstellung verschafft Positron echtes Kundenfeedback. Dennoch verändert Asimov ausreichend viele Ebenen des Stacks, sodass die Atlas-Nutzung seine endgültige Leistung nicht validieren kann.

Das Unternehmen erklärt, Atlas sei über mehr als 50 Racks bei Oracle Cloud Infrastructure im Hyperscaler-Maßstab in Betrieb. Externe Details zu Auslastung, Workload-Mix, Service-Leveln und Wirtschaftlichkeit bleiben begrenzt.

Diese Informationen würden Käufern helfen, zwischen physischer Bereitstellung und nachhaltiger Produktionsnachfrage zu unterscheiden. Die Zahl der Racks allein kann nicht zeigen, wie viel Traffic die Systeme bedienen.

Keine dieser Unsicherheiten widerlegt die Memory-First-These. Sie definieren, welche Belege noch fehlen.

Positron hat erläutert, wie seine Architektur funktionieren sollte. Die nächste Phase muss zeigen, wie sie sich außerhalb der Modelle des Unternehmens und ausgewählter Bereitstellungen verhält.

Drei Signale werden entscheiden, ob die Memory-First-Wette aufgeht

Die Qualität des Tape-outs, unabhängige Benchmarks und wiederholte Kundenbereitstellungen werden entscheiden, ob diese Runde eine dauerhafte Nvidia-Alternative finanziert hat.

Das erste Signal sind Asimovs Tape-out und das erste Silizium. Positron strebt Ende 2026 für den Tape-out an, gefolgt von der Produktion in der zweiten Hälfte des Jahres 2027.

Das wichtige Update wird keine zeremonielle Design-Fertigstellung sein. Käufer sollten darauf achten, ob die ersten Chips booten, Zielmodelle ausführen und sich der angekündigten Frequenz und dem angekündigten Leistungsrahmen annähern.

Ein erfolgreiches First-Silicon-Ergebnis würde Positrons Umsetzungsargument stärken. Eine Neuentwicklung oder Zeitplanverschiebung würde die verfügbare Zeit verkürzen, bevor konkurrierende Plattformen voranschreiten.

Das zweite Signal ist ein unabhängig reproduzierbarer Benchmark. Er sollte vollständige Asimov- und GPU-Systeme unter identischen Modellen, Kontextlängen, Batching-Regeln und Latenzzielen vergleichen.

Die Ergebnisse sollten die Zeit bis zum ersten Token, Generierungsgeschwindigkeit, Speicherauslastung, gesamte Systemleistung und nachhaltigen Durchsatz enthalten. Sie sollten außerdem numerische Präzision und Softwareversionen offenlegen.

Ein vorteilhaftes Ergebnis über mehrere Workload-Typen hinweg würde die Asimov-Inferenzchip-These stützen. Starke Ergebnisse aus nur einem sorgfältig ausgewählten Szenario würden auf einen engeren Markt hindeuten.

Das dritte Signal ist wiederholte Produktionsnachfrage. Der nützlichste Beleg wären zusätzliche Kunden, die nach dem Betrieb von Positron-Hardware unter realen Servicebedingungen über Pilotprojekte hinaus expandieren.

Käufer sollten auf Workload-Details, Auslastung, Servicezuverlässigkeit und Bereitstellungswachstum achten. Namentlich genannte Kunden sind wichtiger, wenn ihre Nutzung nach der ursprünglichen Ankündigung fortgesetzt wird.

Oracles Atlas-Installation verschafft Positron einen glaubwürdigen Ausgangspunkt. Die Bereitstellung mit 50 Racks schafft zudem ein Umfeld, in dem das Unternehmen Erkenntnisse über Planung, Kühlung, Wartung und Softwareintegration gewinnen kann.

Die stärkste Bestätigung wäre eine Verbindung dieser Erfahrung mit der Akzeptanz von Titan. Wenn bestehende Kunden sich für Asimov-Systeme entscheiden, würde dies zeigen, dass Positron operatives Vertrauen in Nachfrage nach seiner neuen Architektur umsetzen konnte.

Reaktionen der Wettbewerber werden zusätzlichen Kontext liefern. Nvidia kann die Inferenz-Effizienz durch neue GPUs, Software-Updates, Formate mit geringerer Präzision und spezialisierte Systemkonfigurationen verbessern.

Cloud-Anbieter können Kunden ebenfalls zu ihren eigenen Beschleunigern lenken. Andere Start-ups können dieselben Speicher- und Latenzengpässe mit anderen technischen Kompromissen angehen.

Dieser Druck bedeutet, dass Positron keinen unangefochtenen Vorsprung hat. Sein Zeitfenster hängt davon ab, ob das Unternehmen liefert, bevor die von ihm identifizierte Lücke kleiner wird.

Für Entwickler lautet die praktische Frage: Portabilität. Framework-Unterstützung, Modellabdeckung, Debugging-Tools und Bereitstellungsaufwand werden zeigen, ob Asimov auch über spezialisierte Teams hinaus zugänglich ist.

Für Infrastrukturkäufer ist die vollständige Wirtschaftlichkeit des Betriebs die entscheidende Kennzahl. Hardware-Effizienz zählt nur, wenn sie verlässliche Kapazität zu akzeptablen Betriebskosten liefert.

Für KI-Produktteams könnte eine größere Speicherkapazität längere Agentenverläufe, umfangreichere abgerufene Kontexte und anspruchsvollere multimodale Anwendungen ermöglichen. Diese Vorteile erfordern weiterhin Modelle, die die Kapazität effektiv nutzen.

Die Finanzierungsrunde von Positron AI über 875 Millionen US-Dollar hat aus einem technischen Argument ein gut finanziertes Fertigungsprogramm gemacht. Sie hat jedoch weder Simulationen in Silizium noch Prognosen in Kundenergebnisse verwandelt.

Beobachten Sie die ersten Chips, die ersten unabhängigen Messungen und die ersten Folgeaufträge. Treffen alle drei planmäßig ein, wird speicherorientierte Inferenz zu einer ernsthaften Beschaffungsoption. Scheitert eines davon, bleibt Nvidias integrierte GPU-Plattform schwer zu verdrängen.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page