Hardware-Test: Nvidia DGX Spark / GB10

Shownotes

Die Geräteklasse, die lokale KI-Inferenz aus dem Rechenzentrum holt.

Ein Würfel in Buchgröße, 128 GB Unified Memory, bürotauglich leise – und Modelle bis 30 bis 40 Milliarden Parameter laufen vollständig im Speicher. Diese Folge ordnet ein, was der GB10 kann, was er kostet und für wen er sich rechnet.

Themen der Folge:

Der Superchip erklärt: Warum Unified Memory gegenüber klassischen Server-GPUs den Unterschied macht – 273 GB/s Bandbreite gegen 3 TB/s bei einer H100, und warum das trotzdem eine eigene Liga ist Das Datenblatt der Klasse: 128 GB LPDDR5X, bis zu 1.000 TOPS, unter 240 W, aarch64-Architektur, Formfaktor 15 × 15 × 5 cm Die Anbieter: Nvidia DGX Spark (~4.800 €) und ASUS Ascent GX10 (~4.500 €) – gleiche Hardware, unterschiedlicher Channel und Service. Dell und HPE mit Pilotprogrammen für das zweite Halbjahr 2026 Der ehrliche Vergleich nach oben und unten: gegen H100-Server (drei- bis fünffacher Durchsatz, aber zehn- bis zwanzigfacher Preis) und gegen Workstation-GPUs wie die RTX A6000 (vergleichbarer Durchsatz, aber deutlich weniger Modellkapazität) Was nicht geht: Trainingsläufe, Feintuning großer Modelle, Reasoning-Modelle der GPT-5-Klasse Die unterschätzte Software-Hürde: aarch64-Linux, wo vLLM, llama.cpp und Ollama stabil laufen – und was man vor dem Kauf bei kommerziellen Inferenz-Engines prüfen sollte Drei Ausbaustufen: Single-Node-Pilot für 50 bis 150 Nutzer (5.000–8.000 €), Zwei-Node-Cluster für gemischte Workloads bis 300 Nutzer (8.500–10.000 €), Mehr-Node-Cluster für größere Häuser Wo die TCO-Kreuzung liegt: ab vier bis sechs Nodes lohnt der Blick auf einen Rechenzentrums-Server

Diese Folge enthält Werbung: contboxx Vault Tender – Ausschreibungen lesen, Antwortentwürfe aus dem eigenen Wissen, lokal verarbeitet. Mehr auf vault.contboxx.com

Prompt-Zeit ist ein KI-generierter Podcast: Stimmen, Recherche und Redaktion entstehen mit künstlicher Intelligenz.

Transkript anzeigen

00:00:00: Willkommen bei Promtzeit.

00:00:01: Wir kommen fast für KI in der Unternehmenswelt,

00:00:04: von Hardware bis Recht

00:00:05: Praxisner Deutschsprachig Von dir.

00:00:09: Es geht los!

00:00:14: Bevor es losgeht.

00:00:15: ein Hinweis in eigener Sache Bei Promt Zeit ist die KI nicht nur Thema sondern macht auch die Arbeit.

00:00:21: Stimmen, Recherche und Redaktion dieses Podcasts sind KI generiert.

00:00:26: In diesem Sinne viel Spaß mit Erfolge.

00:00:30: DGX Spark schrägstrich GB-X.

00:00:34: Vor zwei Jahren war lokale KI-Inferenz für den Mittelstand entweder ein Eigenbauprojekt mit drei H-Einhundertkarten und Serverschrank oder gar keine Option.

00:00:45: Mit dem Gb-X Grace Blackwell Superchip hat NVIDIA twenty-fünfundzwanzig eine Geräteklasse aufgemacht, die in den Werkraum eines mittelständischen Unternehmens passt.

00:00:56: Einhundert achtundzwantig Gigabyte Unified Memory unter Zweihundertvierzig Wattaufnahme.

00:01:02: Listenpreis Viertausend Fünfhundert bis Viertausend Achthundert Euro pro Gerät.

00:01:08: Vertrieben unter eigener Marke als Nvidia DGX Spark, gleichzeitig als OEM-Variante von ASUS unter dem Namen Ascent GX X. Beide tragen denselben Chip haben dasselbe Memory Subset leisten technisch das gleiche!

00:01:26: Was diese Klasse heute leistet, wofür sie passt und wo ihre Grenzen liegen.

00:01:31: Eine Bestandsaufnahme!

00:01:33: Der Chip.

00:01:34: Warum die Architektur den Unterschied macht?

00:01:38: Der GB-X ist ein Superchip – Ein System on chip in dem CPU, GPU und RAM auf einem einzigen Substrat sitzen und sich denselben Speicher teilen.

00:01:50: Das ist der entscheidende Unterschied zu klassischen Server-GPUs.

00:01:55: Bei einem H-Einhundert oder A-Einhundertserver bewegt sich die GPU über einen PCIe-Bus.

00:02:02: Der RAM ist getrennt, jede Datenübertragung ist ein expliziter Schritt.

00:02:08: Beim GB-X sitzt das Speichersubsystem unter dem gleichen Dach wie die Recheneinheit Unified Memory in der Praxis, onehundert-achtundzwanzig Gigabyte LPDDR VX mit rund zweihundertdrei und siebzig Gigabyte pro Sekunde Bandbreite.

00:02:25: Das klingt zunächst weniger spektakulär als die drei Terabyte pro sekunde einer H-Einhundert mit HBM III aber im Verhältnis von Leistung zu Stromaufnahme und Preis spielt er GB-Xen in einer eigenen Liga Die Konsequenz?

00:02:42: Modelle bis etwa dreißig bis vierzig Milliarden Parameter in Vier-Bit oder FP acht Quantisierung passen vollständig in den Speicher eines einzelnen GB zehn Geräts.

00:02:54: Größere Modelle laufen über mehrere Geräte im Cluster, was sich im realen Atlas Betrieb stabil umsetzen lässt.

00:03:02: Anbieter und Verfügbarkeit Die GB zehn Klasse ist im Frühjahr zwei tausend sechsundzwanzig Inzwei Marken Varianten am Markt NVIDIA DGX Spark Eigenmarke des Chip-Herstellers.

00:03:17: Listenpreis rund US-Dollar, ungefähr €.

00:03:25: Vertrieb über NVIDia Partner und ausgewählte Distributoren In Deutschland unter anderem Aspis, Bechtle, Pan da komm.

00:03:34: Lieferzeit typisch zwei bis vier Wochen.

00:03:37: Service über den jeweiligen Distributor Eignet sich für Häuser, die ohnehin in einer NVIDIA Beschaffungsstruktur arbeiten.

00:03:46: ASUS Ascent GX-Zen OEM-Variante auf identischer Hardwarebasis.

00:03:54: Listenpreis rund fourtausend fünfhundert Euro pro Note In Dachchannel über das ASUS Partnernetz und etablierte Systemhäuser.

00:04:02: breit verfügbar.

00:04:04: Stärke?

00:04:05: Vierundzwanzig sieben Serviceoptionen mit Vorortreaktion durch lokales Systemhaus Eine Struktur, die im Klinik- und Bankumfeldern häufig nachgefragt wird.

00:04:17: Die getestete Atlaskonfiguration auf den Seiten XXVI bis XXII läuft auf zwei dieser Geräte.

00:04:24: Beide Geräten sind technisch gleichwertig – die Wahl folgt selten dem Chip, häufiger dem Channel.

00:04:31: Wer ohnehin mit einem ASUS Vertriebspartner arbeitet bleibt dabei!

00:04:36: Wer in einer NVIDIA Direktlinie steht nimmt die Spark.

00:04:42: Eine dritte Variante wird für H.II.

00:04:45: ... ... von weiteren OEMs erwartet.

00:04:49: Dell, HPE haben Pilotprogramme angekündigt.

00:04:53: Die Chipbasis ist in allen Fällen identisch

00:04:58: Was die Klasse leistet und was nicht?

00:05:02: Die ehrlichste Einschätzung kommt aus dem Vergleich mit den Geräteklassen da rüber und darunter Im Vergleich zu einem Haar-Einhundertserver Rechenzentrumsklasse.

00:05:12: Eine einzelne H-Einhundertkarte mit Achtzig Gigabyte HBM III liefert in den meisten Inferenzszenarien etwa das drei bis fünffache an Durchsatz wie ein einzelnes GB-Zähngerät.

00:05:26: Sie kostet aber je nach Konfiguration auch das zehn bis zwanzigfache und braucht einen Rechenzentrum-Server samt Klima, Stromversorgung und IT Operations Team.

00:05:38: Der GB-Xen ist kein Mini H-Einhundert, er isst eine andere Geräteklasse mit anderem Einsatzzweck.

00:05:47: Im Vergleich zu klassischen Workstation GPUs RTX A-Sixthausend Elfvierzig S Eine RTX A sixtausend mit achtundvierzicht Gigabyte Speicher ist in Spitzenthroughput etwa gleichwertig zu einem GB-Zen In der Modellkapazität Einhundertundzwanzig Gigabyte Unified Memory beim GB-Zen, aber deutlich unterlegen.

00:06:14: Wer dreißig Milliarden Parametermodelle lokal fahren will kommt mit klassischen Workstation GPUs an die Speichergrenze – Mit dem GB-zen nicht!

00:06:26: Was Nicht geht?

00:06:28: Trainingsläufe großer Modelle sind auf dem GB ZEN nicht praktikabel.

00:06:33: Die Klasse ist eindeutig für Infarenz konzipiert.

00:06:37: Wer ein eigenes Modell trainieren oder Feintunen will, bleibt bei Cluster-GPUs H.Einhundert B.Zweihundert.

00:06:46: Auch reasoningintensive Premiummodelle der GPT V Klasse laufen nicht lokal auf der GBX Klasse.

00:06:54: Dafür reicht die Modellgröße nicht in den Speicher ohne Quantisierungsverluste in Kauf zu nehmen, die für Reasoning-Tasks problematisch werden.

00:07:07: Die

00:07:25: Antworten stehen längst irgendwo im Haus, in alten Angeboten und Referenzlisten.

00:07:32: Nur eben nicht an nur einer Stelle.

00:07:38: Sie laden die Unterlagen hoch.

00:07:40: Tender erkennt die Fragen geht sie einzeln durch und beantwortet sie aus ihrem eigenen Wissensbestand In der Originalnummerierung Im original Wortlaut Zu jeder Antwort sehen Sie, aus welchem Dokument sie stammt und wenn eine Frage offen bleibt sagt Ihnen Tender warum.

00:08:00: Entweder fehlen die Daten oder ihnen fehlt die Berechtigung.

00:08:05: Alles läuft auf Ihren eigenen Servern.

00:08:07: Kein Dokument verlässt Ihr Haus.

00:08:10: Abgeschickt wird nichts automatisch Die Abgabe.

00:08:13: entscheiden Sie Ihre Antwort, Ihr

00:08:24: Haus.

00:08:32: Software-Stack und Reifegrad.

00:08:35: Die GB-X-Klasse läuft auf Ehach-六zig Linux Ubuntu RHEL.

00:08:42: Das ist die kleinere Software-Hürde, die in der Planung gerne übersehen wird.

00:08:47: Manche kommerzielle Inferenz-Engines unterstützen Ahch- vierundsechzig noch nicht voll.

00:08:52: Manche Precompiled-Kernel sind nur für X- sechsund achtzig verfügbar.

00:08:58: Die ausgereifte Open-Source-Welt VLLM Lama.CPP OLAMA TGI läuft stabil auf der Plattform.

00:09:08: VLLm, die im Mittelstand am häufigsten gewählte Inferenz-Engine ist seit Version Null.Xen.Zwei mit nativer AHRCH-IV Unterstützung und Hermes Tool Calling auf der Platform stabil produktiv einsetzbar.

00:09:25: Bestimmte Quantisierungspfade, etwa Pre-Compiled FP-Acht sind auf ARCH-IV noch nicht vollständig.

00:09:33: Werden aber durch dynamische Quantisierung zur Laufzeit aufgefangen!

00:09:38: Wer eine offene Plattform fahren will hat den vollständigen Stack heute zur Verfügung.

00:09:44: Wer eine kommerzielle Inferenz Engine bevorzugt sollte vor dem Kauf die ARCH IV verfügbarkeit prüfen.

00:09:53: Was die Klasse für den Mittelstand bedeutet Die GBC-Klasse hat das Spielfeld verschoben.

00:10:01: Vor zwei Jahren bedeutete lokale KI im Mittelstand eine sechsstellige Hardware-Investition, einen klimatisierten Serverraum und ein dediziertes ML Ops Team.

00:10:13: Heute steht in derselben Investitionsklasse eines mittelgroßen Office-Drucker Parks – ein produktiv nutzbares Inferenzsetup auf dem Schreibtisch.

00:10:24: Was die nächsten Generationen bringen ist absehbar!

00:10:27: Nvidia hat für twenty-sevenundzwanzig eine Nachfolgerklasse angekündigt.

00:10:33: Weitere OEMs werden im Lauf des Jahres in das Segment einsteigen, aber die Kernbotschaft steht heute!

00:10:41: Wer eine Pilotplattform für fünfzig bis dreihundert Nutzer aufsetzen will kommt nicht mehr an der Frage vorbei ob er das in der Cloud oder lokal auf einem oder zwei kompakten Geräten tut.

00:10:55: Der Cluster-Test auf den nächsten beiden Seiten zeigt, was diese Geräte in einer realen Editorial Pipeline leisten.

00:11:26: Ein einzelner GB-Zähn trägt das ohne Klimakammer und ohne dedizierte Stromversorgung.

00:11:33: Investition für Gerät plus Software-Stack – fünftausend bis achttausende Euro.

00:11:39: Pilotzeit drei bis sechs Wochen.

00:11:42: Zwei Note Cluster für gemischte Workloads Ein Fast Tier mit kompakterem Modell etwa sieben bis neun B-Parameter Für leichte Klassifizierungs- und Extraktionsaufgaben ein Heavy-Tier mit einem größeren MOE-Modell etwa dreißig B für anspruchsvolle Reasoning und Generierungsstages.

00:12:05: Diese Konfiguration trägt mittlere Produktivlasten bis etwa dreihundert Nutzer in einem reinen Büroarbeitsszenario oder eine fortlaufende Editorial Pipeline wie auf den Seiten sechsundzwanzig bis siebenundzwantzig dokumentiert.

00:12:21: Investition Achttausendfünfhundert bis Zehntausendeuro für die Hardware.

00:12:27: Mehr Note-Cluster für größere Häuser, vier bis acht Geräte mit Load Balancing Front, HA Proxy oder Ähnliches decken Produktivsetups mit mehreren parallelen Workloads ab.

00:12:41: Ab dieser Größe lohnt die Auseinandersetzung mit der Frage ob nicht doch ein Rechenzentrumserver mit einer oder zwei H-Einhundertkarten effektiver ist?

00:12:52: Die TCO-Kreuzung liegt typischerweise bei vier bis sechs GBZ-Notes.

00:12:58: Das war's wieder für heute und wir hoffen, Sie konnten etwas Nützliches aus der Folge ziehen!

00:13:03: Wir das sind Ella...

00:13:04: ...und Helmut.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.