Kurzfassung: d-Matrix will seinen kommenden Raptor-Beschleuniger über NVLink Fusion in NVIDIAs MGX-Racks integrieren. Vera-Rubin-GPUs sollen dabei rechenintensive Eingaben bearbeiten, Raptor die schrittweise Token-Ausgabe. Das erweitert die Chipauswahl, bindet alternative Siliziumanbieter aber enger an NVIDIAs restliche Infrastruktur.
Geteilte Arbeit im selben Rack
Die angekündigte Architektur trennt zwei Phasen der KI-Inferenz. Beim „Prefill“ verarbeitet ein Modell den gesamten Eingabekontext weitgehend parallel; d-Matrix sieht dafür NVIDIA Vera Rubin vor. Beim anschließenden „Decode“ entstehen Token nacheinander, wodurch Speicherzugriffe und Antwortlatenz stärker ins Gewicht fallen. Diese Phase soll Raptor übernehmen.
Der Raptor-Chip kombiniert laut d-Matrix einen DRAM-Speicherchip und einen SRAM-Rechenchip in einem gestapelten Paket. Er soll vor Ende 2026 erstmals zur Fertigung übergeben werden. Erste Raptor-XPUs in MGX-Racks erwartet das Unternehmen im vierten Quartal 2027. Astera Labs entwickelt dafür angepasste Verbindungen; zum Rack gehören außerdem Vera-CPUs, NVLink-Switches, BlueField-4-DPUs, ConnectX-9-Netzwerkkarten und Spectrum-X Ethernet.
NVLink Fusion öffnet NVIDIAs Verbindungstechnik und Rack-Referenzarchitektur für fremde CPUs und Beschleuniger. NVIDIA nennt für NVLink 6 bis zu 3,6 TB/s pro XPU in einer Domäne mit 72 Beschleunigern. Die d-Matrix-Mitteilung legt jedoch weder die konkrete NVLink-Generation noch die Bandbreite der geplanten Raptor-Konfiguration fest.
Was noch nicht belegt ist
d-Matrix verspricht sehr geringe Latenz, bessere Energieeffizienz und attraktive Token-Kosten. Unabhängige Messungen, Modellgrößen, Antwortlatenzen, Leistungsaufnahme und Gesamtbetriebskosten fehlen. Auch die Aufteilung von Prefill und Decode ist kein kostenloser Gewinn: Orchestrierung und Datentransfer zwischen unterschiedlichen Beschleunigern können Vorteile schmälern. Raptor ist zudem noch nicht gefertigt, die angekündigte Verfügbarkeit liegt mehr als ein Jahr entfernt.
Pandorex Analyse
Für d-Matrix ist der Zugang zu MGX-Racks und NVIDIAs Lieferkette wahrscheinlich wertvoller als eine einzelne Schnittstelle. Rechenzentren können alternative Inferenzchips einsetzen, ohne Stromversorgung, Kühlung, Netzwerk und Management vollständig neu zu planen. NVIDIA erweitert damit die Auswahl auf Chipebene und hält zugleich die Kontrolle über das umfassendere Rack- und Netzwerkmodell.
Pandorex Einschätzung: Die Kooperation macht Raptor leichter einsetzbar, beweist aber noch keinen wirtschaftlichen Vorteil gegenüber reinen GPU-Systemen. Entscheidend werden unabhängige Messungen für reale Modelle sowie die Kosten der Datenbewegung zwischen Prefill und Decode.
