Vera Rubin bei CoreWeave: Was der höhere KI-Durchsatz bringt

Offene Serverschränke mit Netzwerkgeräten und orangefarbenen Kabeln
Photo by Kevin Ache on Unsplash

CoreWeave öffnet Nvidias neue Vera-Rubin-Systeme für erste Kunden. Der Entwickler Cognition setzt sie bereits für seinen Programmieragenten Devin ein und meldet einen deutlich höheren Durchsatz. Die am 30. September angekündigte Verfügbarkeit zeigt, wie die nächste Hardwaregeneration in den Alltag von KI-Diensten rückt. Für Nutzer ist dabei entscheidend, welche Beschleunigung tatsächlich bei einer fertigen Aufgabe ankommt.

Das Wichtigste in Kürze

  • Vera Rubin NVL72 ist bei CoreWeave begrenzt verfügbar; Cognition nutzt die Systeme bereits im Produktionsbetrieb.
  • Für SWE-2 meldet Cognition gegenüber GB200 NVL72 bis zu 4,8-mal so viel gesamten Token-Durchsatz. Das misst Rechenleistung, nicht die Qualität fertiger Software.
  • Ein NVL72-System verbindet 72 Rubin-Grafikprozessoren mit 36 Vera-Hauptprozessoren. Beide erfüllen unterschiedliche Aufgaben.
  • Interessierte Teams können Kapazitäten anfragen oder einen ARENA Pass für eigene Arbeitslasten beantragen. Eine allgemeine Preis- oder Verfügbarkeitszusage folgt daraus nicht.

Was jetzt tatsächlich verfügbar ist

Die Nachricht betrifft einen konkreten Schritt: Laut CoreWeave laufen Kundenaufgaben auf Vera Rubin NVL72, statt dass die Plattform nur als künftige Ausbauplanung präsentiert wird. Der Anbieter spricht ausdrücklich von begrenzter Verfügbarkeit. Wer ein Rechenprojekt plant, muss deshalb weiterhin klären, wann und in welchem Umfang Kapazitäten bereitstehen. Eine Produktankündigung ist noch kein frei buchbares Kontingent für jeden Kunden.

Cognition ist der zuerst genannte Produktionskunde. Das Unternehmen hinter Devin nutzt CoreWeave für Training, verstärkendes Lernen und den laufenden Modellbetrieb. Bei verstärkendem Lernen werden Lösungsversuche bewertet, damit spätere Versuche bessere Ergebnisse liefern. Im laufenden Betrieb berechnet das bereits trainierte Modell Antworten; dafür steht der Fachbegriff Inferenz. Für einen Programmieragenten gehören außerdem Werkzeuge, ausführbare Arbeitsumgebungen und Rückmeldungen aus Tests dazu.

Diese Unterscheidung hilft, die Bedeutung der neuen Hardware einzuordnen. Ein Chat kann nach einer Antwort enden. Ein Agent, der einen Fehler in einer Anwendung beheben soll, muss womöglich erst Dateien lesen, eine Änderung schreiben, einen Test ausführen und auf dessen Ergebnis reagieren. Das ist ein Beispiel für einen möglichen Arbeitsablauf, keine Zusage darüber, wie Devin jede Aufgabe erledigt. Beschleunigt wird jeweils ein Teil dieses Ablaufs.

Was der gemeldete Faktor wirklich misst

Cognitions Ingenieure verglichen SWE-2-Inferenz auf Vera Rubin NVL72 mit einer GB200-NVL72-Basis. Die veröffentlichte Grafik beschreibt bis zu 4,8-mal höheren gesamten Token-Durchsatz pro Grafikprozessor bei gleicher Interaktivität. Tokens sind die Textbausteine, die ein Modell verarbeitet oder erzeugt. Der Wert ist ein kundenbezogener Benchmark, den CoreWeave veröffentlicht; er ersetzt keinen unabhängigen Vergleich sämtlicher Modelle und Anwendungen.

Mehr Durchsatz kann einem Dienst erlauben, mehr Arbeit parallel zu bearbeiten, ohne die Ausgabe pro Sitzung zu verlangsamen. Für den Betreiber ist das wertvoll. Wer vor seinem Bildschirm auf einen behobenen Fehler wartet, stellt aber eine andere Frage: Wie lange dauert die vollständige Aufgabe? Dazu gehören Wartezeiten auf Werkzeuge, wiederholte Versuche und die Prüfung des Ergebnisses. Aus einem höheren Token-Durchsatz lässt sich diese Gesamtzeit nicht unmittelbar errechnen.

Ebenso wenig ist damit belegt, dass der Agent mehr Aufgaben richtig löst. Eine schnellere Textberechnung kann dieselbe Antwort früher liefern oder mehr Versuche ermöglichen; deren Nutzen muss gesondert gemessen werden. Auch eine entsprechende Senkung des Abopreises ist nicht angekündigt. Hardwarekosten, Auslastung und die Kalkulation des Dienstes sind verschiedene Größen. Wer den Faktor als pauschale Beschleunigung seiner eigenen Programmierarbeit liest, überspringt diese Unterschiede.

Warum Grafikprozessoren allein nicht reichen

Nvidias Produktunterlagen nennen für NVL72 insgesamt 72 Rubin-Grafikprozessoren und 36 Vera-Hauptprozessoren. Die Grafikprozessoren übernehmen die stark parallelisierte Modellrechnung. Die Hauptprozessoren kümmern sich auch um Arbeit außerhalb des Modells, etwa Codeausführung, Datenverarbeitung und das Zusammenspiel der Werkzeuge. Schnellere Antworten helfen wenig, wenn die Umgebung, in der ein Agent seine Vorschläge ausprobiert, ständig zum Engpass wird.

CoreWeave kündigt zusätzlich Vera als eigenständiges CPU-Angebot an. Dieser geplante Dienst ist von der bereits gemeldeten Nutzung der kompletten NVL72-Systeme zu unterscheiden. Die allgemeine Vera-Produktseite und CoreWeaves konkrete Ausbauankündigung beschreiben unterschiedliche Angebote. Für die Bewertung zählt daher nicht nur ein Prozessorname, sondern die Frage, welches System ein Team tatsächlich bestellen und für seine Aufgaben einsetzen kann.

Zur gleichen Veranstaltung stellte CoreWeave Forge vor. Die Entwicklungsumgebung verbindet unter anderem Weights & Biases, OpenPipe und marimo mit eigenen Diensten. Experimente, Auswertungen und Modellstände sollen so in einem zusammenhängenden Arbeitsablauf liegen. Für Entwickler ist die dahinterstehende Idee nachvollziehbar: Ein Fehler im Betrieb sollte zu einem reproduzierbaren Testfall werden, an dem sich die nächste Änderung überprüfen lässt.

Eine schnelle Arbeitsumgebung beantwortet wiederum nicht automatisch, auf welche Daten ein Agent zugreifen darf. Die getrennte Aufgabe, Werkzeuge und Berechtigungen einzugrenzen, erläutert unser Beitrag zu Nvidias OpenShell und Sentry. Rechenleistung und abgesicherte Ausführung ergänzen sich; aus dem Vorhandensein neuer Hardware folgt noch keine Aussage über die Rechte einer konkreten Anwendung.

Für wen sich ein eigener Vergleich lohnt

Der unmittelbare Adressat sind Teams, die selbst Modelle betreiben oder viele Agentenaufgaben parallel ausführen. CoreWeave verweist auf eine Kapazitätsberatung und den ARENA Pass, mit dem Interessenten ihre eigene Arbeitslast auf Vera Rubin NVL72 erproben können. Sinnvoll wäre ein repräsentativer Ablauf mit demselben Modell, ähnlicher Zahl gleichzeitiger Aufgaben und einem klaren Erfolgskriterium. Dann lässt sich vergleichen, wie viel eine korrekt erledigte Aufgabe kostet und wie lange sie dauert.

Für Nutzer eines fertigen KI-Dienstes ist der Fortschritt indirekt: Der Betreiber erhält neue Möglichkeiten, seine Infrastruktur auszubauen. Ob daraus kürzere Wartezeiten, mehr Kapazität oder andere Preise werden, entscheidet sich im jeweiligen Produkt. Die relevante nächste Messung ist deshalb nicht nur die Zahl der erzeugten Tokens. Es ist der Weg vom Auftrag bis zum brauchbaren Ergebnis, einschließlich der Schritte, die außerhalb des Sprachmodells stattfinden.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen