
Nvidia erweitert seinen kompakten KI-Rechner DGX Spark um eine Variante mit 64 GB gemeinsamem Arbeitsspeicher. Die am 2. Oktober angekündigte Konfiguration soll ab dem 23. Oktober 2026 über Gerätepartner erhältlich sein, zu Preisen ab 4.999 US-Dollar. Für Entwickler ist daran vor allem interessant, ob ein kleineres System die eigene KI-Anwendung zuverlässig tragen kann: einen Assistenten für Dokumente, einen Programmierhelfer oder mehrere spezialisierte Modelle.
Das Wichtigste in Kürze
- Der DGX Spark mit 64 GB nutzt weiterhin den GB10 Grace Blackwell Superchip und Nvidias KI-Softwareumgebung.
- Nvidia nennt Acer, ASUS, Dell, Gigabyte, HP und MSI als Anbieter. Der angekündigte Dollarpreis ist kein bestätigter deutscher Endkundenpreis.
- Entscheidend ist der Speicherbedarf der gesamten Anwendung, einschließlich Gesprächskontext und parallel laufender Modelle.
- NVIDIA Sync erleichtert den Zugriff vom vorhandenen Rechner und die Verbindung mehrerer Spark-Systeme. Verteilter Betrieb bleibt von geeigneter Software abhängig.
Weniger Speicher, dieselbe Entwicklungsplattform
Die neue Variante reduziert die Speicherkapazität gegenüber der bekannten Konfiguration mit 128 GB. Der grundlegende Ansatz bleibt erhalten: Prozessor und Grafikteil greifen auf einen gemeinsamen Speicher zu. Die aktuelle Produktseite nennt für die Plattform eine Speicherbandbreite von 273 GB pro Sekunde. Kapazität und Bandbreite beantworten dabei unterschiedliche Fragen. Die eine begrenzt, was gleichzeitig hineinpasst; die andere beeinflusst, wie schnell die Recheneinheiten Daten daraus bekommen.
Daraus folgt kein pauschales Urteil über die Antwortgeschwindigkeit. Ein kleineres Modell kann für eine eng umrissene Aufgabe ausreichen, ein größeres kann mehr Speicher verlangen, ohne jede Antwort automatisch besser zu machen. Dass spezialisierte Modelle einen anderen Nutzen haben als allgemeine Chatbots, zeigt auch Cloudflares Ansatz mit Entscheidungsmodellen. Für die Hardwarewahl zählt daher zuerst die Aufgabe, danach die maximale Modellgröße.
Auch der Kontext braucht Platz. Gemeint sind die Textstücke, auf die das Modell während einer Anfrage zugreifen kann: Gesprächsverlauf, Dokumente oder Programmcode. Ollamas Dokumentation hält ausdrücklich fest, dass ein größeres Kontextfenster den Speicherbedarf erhöht. Wer nur prüft, ob die Modelldatei auf das Gerät passt, lässt einen Teil der späteren Belastung außer Acht. Mehrere gleichzeitig arbeitende Assistenten verschärfen diese Frage zusätzlich.
Eine vernünftige Planung beginnt deshalb mit einem repräsentativen Vorgang. Bei einem Dokumentenassistenten wären das typische Dateien und die erwartete Anzahl gleichzeitiger Nutzer; bei einem Programmierhelfer ein tatsächlicher Arbeitsauftrag mit dem benötigten Projektkontext. Die Schlussfolgerung ist eine praktische: Ein passend dimensioniertes System braucht Reserve für seine Anwendung. Die aufgedruckten 64 GB sind kein Versprechen, dass jede denkbare Agentenaufgabe hineinpasst.
Wie lokale KI am vorhandenen Arbeitsplatz nutzbar wird
Der Spark muss nicht den bisherigen Laptop oder Desktop ersetzen. NVIDIA Sync ist laut Benutzerhandbuch für Windows, macOS und Ubuntu vorgesehen und stellt die Verbindung zum KI-Rechner her. Es verwaltet unter anderem SSH-Verbindungen und Weiterleitungen im Hintergrund. Damit lässt sich die Rechenarbeit auf dem Spark ausführen, während die gewohnte Arbeitsoberfläche auf dem eigenen Rechner bleibt.
Zum Einstieg bietet sich eine begrenzte lokale Anwendung an, etwa das Zusammenfassen ausgewählter Dokumente. Ollama führt GB10 beziehungsweise DGX Spark ausdrücklich in seiner Hardwareunterstützung auf. Ein unterstütztes Modell und seine passende Laufzeit sind dennoch separat zu wählen. Die Unterstützung der Hardware ersetzt weder eine Prüfung der Modelllizenz noch die Frage, ob das Modell die gewünschte Sprache und Aufgabe gut beherrscht.
Für einen ersten Durchlauf sollte man wenige typische Dateien verwenden und Antwortqualität, Wartezeit und Speicherbelegung gemeinsam betrachten. Ollama dokumentiert dafür auch den Befehl ollama ps: Er zeigt geladene Modelle sowie Informationen zur Ausführung und zum Kontext. Das ist hilfreicher als allein eine gelungene kurze Chatantwort. Eine Anwendung muss auch dann funktionieren, wenn die Dokumente länger werden oder weitere Anfragen hinzukommen.
Der Datenschutzvorteil ergibt sich aus dem tatsächlich lokalen Betrieb. Ollama erklärt, dass lokal verarbeitete Eingaben nicht an den Anbieter zurückgesendet werden. Cloudmodelle sind ein anderer Betriebsmodus. Ebenso können angeschlossene Suchdienste oder externe Werkzeuge Informationen übertragen. Für vertrauliche Unterlagen muss deshalb die gesamte Anwendung betrachtet werden, nicht nur der Standort des Rechners. Lokale Ausführung ist eine Möglichkeit, den Datenweg zu verkürzen, keine automatische Eigenschaft jedes darauf gestarteten Agenten.
Was die Verbindung zweier Geräte leistet
Für größere Vorhaben ist die Verbindung mehrerer Systeme vorgesehen. Das Benutzerhandbuch beschreibt dafür die ConnectX-7-Anschlüsse und QSFP-Kabel; die Anschlüsse unterstützen bis zu 200 Gigabit pro Sekunde. NVIDIA Sync bietet einen Cluster Assistant, der die Einrichtung erleichtert. Ein Cluster ist hier ein Verbund mehrerer Rechner, auf den geeignete KI-Software ihre Arbeit verteilen kann.
Zwei Geräte mit jeweils 64 GB besitzen zusammen 128 GB Speicher. Das bedeutet jedoch nicht, dass jede einzelne Anwendung diesen Speicher ohne Anpassung wie den eines einzigen Rechners nutzt. Der Rechnerverbund benötigt eine Laufzeit und ein Modell, die verteilte Ausführung unterstützen. Die automatische Netzwerkeinrichtung und die Verteilung der Modellberechnung sind verschiedene Ebenen. Das Kabel allein macht aus einem ungeeigneten Programm kein verteiltes Programm.
Ein solcher Ausbau sollte deshalb eine konkrete Grenze lösen: etwa ein Modell, das auf einem Gerät nicht ausreichend Platz hat, oder eine gemessene Belastung durch parallele Anfragen. Wer noch keine solche Grenze kennt, kauft mit dem zweiten Gerät zunächst zusätzliche Möglichkeiten. Daraus lässt sich weder eine Verdopplung der Antwortgeschwindigkeit noch eine allgemeine Ersparnis gegenüber einer Cloud ableiten.
Für wen der kleinere Spark eine sinnvolle Option ist
Die neue Konfiguration ist vor allem für Entwickler und kleinere Teams interessant, die Nvidias Softwareumgebung lokal einsetzen wollen und ihren Speicherbedarf bereits abschätzen können. Für gelegentliche Chatnutzung bleibt der angekündigte Einstiegspreis eine erhebliche Investition. Wer lokale KI erst kennenlernen möchte, sollte zunächst eine geeignete kleine Anwendung auf vorhandener, unterstützter Hardware ausprobieren. Ollama unterstützt neben Nvidia auch andere Hardwareplattformen.
Vor einer Bestellung stehen somit drei überprüfbare Fragen: Passt der vollständige Arbeitsvorgang in den verfügbaren Speicher? Unterstützt die eingesetzte Software genau diese Plattform? Und rechtfertigt der lokale Betrieb Anschaffung, Strom und Betreuung? Nvidias Ankündigung erweitert die Auswahl, beantwortet diese Fragen aber nicht stellvertretend für den Käufer. Der Gewinn der 64-GB-Variante liegt in einer zusätzlichen Größenstufe für lokale KI, deren Nutzen sich am eigenen Arbeitsvorgang zeigen muss.

