Lohnt sich der NVIDIA DGX Spark 64GB? 4.999 $ auf dem Schreibtisch und eine Cloud-GPU werden nicht gleich abgerechnet

Hardware  ·  2026.10.08  ·  etwa 12 Minuten

Kleiner Desktop-Rechner auf einem Schreibtisch, als Bild für eine lokale KI-Workstation neben gemieteten GPUs

Ein lokales KI-Gerät neben dem Monitor und eine stundenweise gemietete Cloud-GPU geben nicht dieselbe Sorte Geld aus. Zuerst stehen Speicher, Bandbreite und Software dieser 64-GB-Variante. Danach liegen drei Jahre bei vier Stunden, acht Stunden und Dauerbetrieb neben RTX 4090, L40S, A100 und H100. Welche Modelle passen, wo die Tokenrate stehen bleibt und welcher Teil bei einem Mac bleibt, folgt danach.

$4,999
Einstieg 64 GB
64 GB
Gemeinsamer Speicher
273
Bandbreite GB/s

Was an der 64-GB-Variante gleich bleibt

Im Oktober 2026 hat NVIDIA eine 64-GB-Ausführung des DGX Spark ergänzt. Der Chip bleibt der GB10 Grace Blackwell: 20 Arm-Kerne (10 Cortex-X925 und 10 Cortex-A725, mit MediaTek entworfen), Blackwell-GPU, Tensor Cores der fünften Generation und ConnectX-7 mit 200 Gbit/s auf der Platine. Der Systemspeicher ist 64 GB kohärentes LPDDR5X, das CPU und GPU gemeinsam adressieren, bei 273 GB/s. Das Netzteil leistet 240 W, die TDP des GB10 steht bei 140 W, das Gehäuse misst etwa 150 × 150 × 50,5 mm und wiegt 1,2 kg. Das System ist DGX OS mit dem CUDA-Stack. Es ist kein Windows-Desktop und kein macOS.

Ab dem 23. Oktober 2026 verkaufen Acer, ASUS, Dell, Gigabyte, HP und MSI. NVIDIAs Einstiegspreis liegt bei 4.999 $. Eine NVIDIA-eigene 64-GB-Founders-Version gibt es nicht. Die 128-GB-Variante bleibt im Angebot. The Register berichtete am 2. Oktober 2026, ihr Preis sei auf 6.950 $ gestiegen, deutlich über den ursprünglichen 3.999 $. Mehrere Berichte nennen außerdem halbierten Speicherplatz. Laufwerke und Kapazität stehen im Datenblatt des jeweiligen Herstellers. „Bis zu 4 TB“ ist das Maximum der Familie, nicht die Ausstattung jedes Geräts.

GerätSpeicherBandbreiteWas Sie tatsächlich kaufen
DGX Spark 64GB64 GB gemeinsam273 GB/sEin großes Modell, das auf dem Schreibtisch bleibt, samt Daten
RTX 4090 in der Cloud24 GBetwa 1 TB/sModelle, die in 24 GB passen, stundenweise
L40S48 GBetwa 864 GB/sEine Stufe über der 4090, weiter nach Stunde
A100 80GB / H100 80GB80 GB HBMetwa 2 TB/s / etwa 3,35 TB/sTraining, Parallelität, größere Modelle in höherer Präzision

1 PFLOP vergleicht das Gerät nicht mit einer H100

NVIDIA nennt bis zu 1 PetaFLOP FP4-KI-Leistung. Der Spitzenwert ordnet die Spark-Familie. Er ist nicht der BF16-Trainingsdurchsatz einer H100. Die Rate eines einzelnen Stroms ist die Bandbreite im nächsten Abschnitt.

Welche Modelle in 64 GB bleiben

NVIDIA sagt: Ein 64-GB-Gerät führt lokal Modelle bis etwa 100 Milliarden Parameter für Inferenz, Feintuning und Agenten aus. Zwei Geräte über ConnectX-7 bündeln 128 GB und reichen bis etwa 200 Milliarden. Das gilt nur zusammen mit der Präzision. Die Gewichtsgröße ist ungefähr Parameterzahl mal Byte je Parameter. GGUF Q4 liegt bei 0,55–0,6 Byte, FP8 oder Q8 bei etwa 1 Byte, BF16 bei etwa 2 Byte. Weitere 8–12 GB bleiben für System, Laufzeit und KV-Cache. Die Tabelle prüft die Kapazität, sie ist kein gemessener Tokens-pro-Sekunde-Wert aus einem Repository.

KlasseGewichte, grobPasst in 64 GB?Die praktische Grenze
8B, Q4etwa 5 GBbequemPlatz für langen Kontext und Werkzeugaufrufe
32B, Q4etwa 18 GBbequemDie übliche Größe eines lokalen Coding-Assistenten
32B, Q8 / FP8etwa 32–35 GBjaDie Kontextlänge müssen Sie selbst begrenzen
70B, Q4etwa 38–42 GBja, engEin längerer Kontext leert zuerst den KV-Cache
70B, FP8etwa 70 GBnein128-GB-Spark oder eine 80-GB-Cloud-GPU
etwa 100B, Q4etwa 55 GBan der genannten ObergrenzeFast kein KV-Budget. Kein Alltagsmodell
405B in nutzbarer Präzisionweit über 64 GBneinVerbund oder Cloud, nicht dieses Gerät

Feintuning verbraucht Speicher schneller als Inferenz. QLoRA von 8B bis 14B ist der bequeme Bereich. 32B-QLoRA geht mit sehr kleiner Batch-Größe. Volles Feintuning oder ein Adapter mit hohem Rang bei 70B passt nicht in 64 GB. Wenn NVIDIA Feintuning als 64-GB-Last nennt, sind die Modelle gemeint, die schon hineinpassen, nicht „70B nach Belieben trainieren“.

Zuerst die Gewichte messen

Rechnen Sie das Modell, das wirklich resident bleiben soll, einmal in Q4 und einmal in FP8. Landet das zwischen 20 und 45 GB, gehört dieses Gerät ins Gespräch. Acht Gigabyte oder 70B in FP8 schieben Sie in eine andere Spalte der Kostentabelle.

Die Tokenrate trifft zuerst auf die Bandbreite

Bei Batch-Größe 1 liest jedes neue Token die Gewichte ungefähr einmal. Eine Obergrenze ist Bandbreite geteilt durch Gewichtsgröße. Das ist eine Decke, kein Benchmark: Kernel-Overhead, KV-Cache und CPU liegen darunter.

  • 8B Q4, etwa 5 GB — 273 ÷ 5 ≈ 55 Token/s an Bandbreitenreserve
  • 32B Q4, etwa 18 GB — 273 ÷ 18 ≈ 15 Token/s
  • 70B Q4, etwa 40 GB — 273 ÷ 40 ≈ 6,8 Token/s

Dieselbe Skizze auf einer H100 SXM mit etwa 3,35 TB/s legt 40 GB Gewichte in die Nähe von 80 Token/s. Eine 4090 liegt bei etwa 1 TB/s, und ihre 24 GB halten kein 70B-Q4. Genau dort sitzt der Spark: Das Modell ist größer als eine Consumer-GPU, und Sie wollen den Durchsatz einer H100 nicht bezahlen. Sie kaufen „es passt, und die Daten bleiben hier“, nicht „es entspricht einer Rechenzentrums-GPU“.

Drei Jahre: Kauf und Stundenmesser sind verschiedene Einheiten

Die 4.999 $ sind nur die erste Zeile. Strom ist hier mit 160 W während der Inferenz und 0,15 $ je kWh angesetzt. 160 W liegen zwischen 140 W TDP und 240 W Netzteil. Das ist eine Planannahme, keine gemessene Kurve. Über 365,25 Tage sind drei Jahre 4.383 Stunden bei vier Stunden am Tag, 8.766 Stunden bei acht Stunden und 26.298 Stunden im Dauerbetrieb.

Die Cloud-Sätze sind Planwerte aus RunPods öffentlicher Stundenliste, wie sie Ende September 2026 noch zuordenbar war, nicht Markt-Untergrenzen. RTX 4090 zu 0,50 $/Stunde liegt zwischen Community Cloud 0,34 $ und Secure Cloud 0,74 $. L40S zu 0,90 $ liegt zwischen 0,79 $ und 1,09 $. A100 80 GB kostet 1,39 $, H100 SXM die Community-Rate von 2,69 $. Speicher, ausgehender Verkehr und Wartezeit fehlen. Die Sätze bewegen sich jede Woche. Rechnen Sie am Bestelltag neu.

Drei Jahre (eigene Stunden einsetzen)
# hours: Stunden mit echter Inferenz über drei Jahre
hours = hours_per_day * 365.25 * 3
cloud = hours * hourly_usd
# 0.160 kW und 0.15 USD/kWh sind Annahmen
spark = 4999 + (0.160 * hours * 0.15)
Muster über drei JahreSpark 64GB4090 · $0.50L40S · $0.90A100 · $1.39H100 · $2.69
4 Stunden am Tag$5,104$2,192$3,945$6,092$11,790
8 Stunden am Tag$5,209$4,383$7,889$12,185$23,581
Dauerbetrieb$5,630$13,149$23,668$36,554$70,742

4.999 $ geteilt durch den Stundensatz ergibt grob neun Stunden am Tag gegen eine 4090, fünf gegen eine L40S, 3,3 gegen eine A100 und 1,7 gegen eine H100. Strom und der Restwert nach drei Jahren verschieben die Linie. Einen Wiederverkaufspreis sagen wir nicht voraus: Das Gerät bleibt, die Mietstunden nicht. Brächte ein späterer Verkauf 1.500 $, lägen die versunkenen Hardwarekosten bei 3.499 $, und die Schwelle käme früher. Das ist eine Sensitivität, kein zugesagter Erlös.

64 GB, 128 GB und zwei Geräte an einem Kabel

64 GB und 128 GB teilen Chip, Bandbreite, DGX OS und ConnectX-7. Die Kapazität unterscheidet sich, und der Speicherplatz, den Berichte als halbiert beschreiben. Die zusätzlichen 1.951 $ der 128-GB-Variante zu 6.950 $ kaufen Platz für 70B in FP8, KV-Reserve bei einem Q4-70B und eine größere Feintuning-Batch. Liegt Ihre Gewichtstabelle schon bei 55 GB, kaufen Sie nicht 64 GB in der Hoffnung auf eine härtere Quantisierung.

Zwei 64-GB-Geräte verbindet ein QSFP-Kabel ohne Switch. NVIDIAs Cluster-Assistent übernimmt Erkennung und ConnectX-7. Der Pool hat 128 GB, Rechenleistung und Bandbreite verdoppeln sich ungefähr, der Einstieg liegt bei 9.998 $. Neben einem 128-GB-System für 6.950 $ ist das Paar kein Sparweg für Speicher. Es ist der Weg, ein zweites Gerät nachzurüsten, nachdem ein einzelnes 32B- bis 70B-Q4 seinen Platz verdient hat.

Wann die 4.999 $ die richtige Ausgabe sind

Kaufen Sie, wenn vier Dinge zugleich stimmen. Die residenten Gewichte liegen um 20–45 GB, eine 24-GB-Karte hält sie nicht. Das Gerät läuft an den meisten Arbeitstagen, nicht nur ein paar Nächte im Monat. Die Daten dürfen den Raum nicht verlassen. Und 70B Q4 im einstelligen Token-pro-Sekunde-Bereich ist für die Arbeit tragbar. Dann zahlen Sie für Residenz und eine Datengrenze. Drei Jahre A100 oder H100 liegen eine Größenordnung darüber.

Lassen Sie es in ebenso konkreten Fällen. Ein 8B- bis 32B-Modell für wenige Stunden am Tag ist über drei Jahre auf einer 4090 günstiger, und die Bandbreite ist höher. Training, hohe Parallelität, 70B in FP8 oder ein langer Kontext überfordern 64 GB und 273 GB/s. Mieten Sie eine 80-GB-GPU stundenweise oder sehen Sie sich den 128-GB-Spark für 6.950 $ an. Muss die Software macOS, Xcode oder Core ML sein, ist ein Arm-Linux-Gerät schon vor dem Preis das falsche System.

Schreiben Sie zuerst die echten Stunden der letzten Woche auf

Addieren Sie die Stunden, in denen ein Modell in den vergangenen zwei Wochen die GPU wirklich belegt hat, und multiplizieren Sie mit 26 für ein Jahr. Füllen Sie die Tabelle nicht mit „irgendwann läuft es vielleicht durch“. Aufgeblähte Stunden schieben Sie zu einem Gerät, das Sie nicht füllen.

Es steht nicht für einen Mac

Der DGX Spark beantwortet eine CUDA-Frage: Das Modell soll lokal bleiben und ist größer als eine Consumer-GPU. Die Ausführungsumgebung von Claude Code und Cursor, Xcode-Builds, der Simulator und Core ML sind eine andere Frage. Sie brauchen echtes macOS auf Apple Silicon, keinen GB10. Wer einen Spark für 4.999 $ als stärkeren Mac mini behandelt, verfehlt beide Aufgaben. Der CUDA-Stack bleibt unterbeschäftigt, die iOS-Pipeline startet nicht.

Liegt die schwere Arbeit bei nächtlicher CI, Repository-Index und langen Agentenläufen, passt ein dedizierter Remote-Mac oft besser als eine weitere Desktop-GPU. Auf der Preisseite von ZavCloud liegt die Monatsreferenz des Mac mini M4 mit 16 GB bei etwa 99,3 $ und die 24-GB-Stufe bei etwa 199,3 $. Sechsunddreißig durchgehende Monate sind etwa 3.575 $ und 7.175 $. Es gilt der Preis bei der Bestellung. Keine der beiden Stufen führt ein 70B aus, und keine gehört in einen CUDA-Vergleich mit dem Spark. Dazu passen der Drei-Jahres-Vergleich Kauf gegen Cloud Mac und die Aufteilung zwischen lokalem Mac und entferntem macOS. Das Modell bleibt auf dem Spark oder einer Cloud-GPU, Paketierung und Signierung auf einem Mac. Diese Trennung ist sauberer, als einer Maschine beides aufzuladen.

Fragen

Läuft ein 70B auf dem DGX Spark 64GB?
Q4 liegt bei etwa 40 GB, also ja, mit knappem Kontextbudget. FP8 liegt bei etwa 70 GB, also nein.

Was ist über drei Jahre günstiger?
Passt das Modell in 24 GB und brauchen Sie nur wenige Stunden am Tag, ist eine 4090-Miete meist günstiger. Brauchen Sie um die 40 GB an den meisten Arbeitstagen, bleibt der Kauf unter A100- oder H100-Stunden. Eine H100 drei Jahre durchlaufen zu lassen landet nahe siebzigtausend Dollar. Das ist eine andere Frage als dieses Gerät.

Bedeutet 1 PFLOP, dass es schneller ist als eine Rechenzentrums-GPU?
Nein. Das ist eine FP4-Spitze. Ein einzelner Strom endet bei 273 GB/s, bei einem 70B-Q4 etwa 7 Token/s an Bandbreitenreserve.

Machen zwei 64-GB-Geräte günstige 128 GB?
Nicht, wenn das Ziel Speicher ist. 9.998 $ gegen ein 128-GB-System für 6.950 $ bedeuten, dass Sie einen zweiten Rechensatz bezahlen. Kaufen Sie das zweite Gerät, wenn Sie die Rechenleistung brauchen.

Kann es Xcode oder Claude Code auf macOS tragen?
Nein. Das System ist DGX OS. Die macOS-Werkzeugkette gehört auf einen Mac oder auf einen dedizierten Remote-Mac, der Build und Agentenschleife übernimmt.

  • Daten und Einstiegspreis — NVIDIA DGX Spark, 64 GB über OEM-Partner
  • Preis und Verkaufsstart — Tom's Hardware, Oktober 2026
  • 128-GB-Preisanpassung und halbierter Speicher — The Register, 2. Oktober 2026
  • Cloud-GPU-Sätze — RunPod-Preise; die Tabelle nutzt öffentliche Stufen von Ende September 2026

ZavCloud Cloud Mac

Das Modell bleibt, wo es passt. Der Build gehört auf einen Mac.

Ein dedizierter Mac mini M4, echtes macOS, über SSH oder VNC. Für Xcode, Core ML und einen Agenten-Host, der anbleiben darf. Kein 64-GB-CUDA-Gerät.

Cloud-Mac-Preise ansehen
Cloud Mac Preise ansehen