Ein lokales KI-Gerät neben dem Monitor und eine stundenweise gemietete Cloud-GPU geben nicht dieselbe Sorte Geld aus. Zuerst stehen Speicher, Bandbreite und Software dieser 64-GB-Variante. Danach liegen drei Jahre bei vier Stunden, acht Stunden und Dauerbetrieb neben RTX 4090, L40S, A100 und H100. Welche Modelle passen, wo die Tokenrate stehen bleibt und welcher Teil bei einem Mac bleibt, folgt danach.
Was an der 64-GB-Variante gleich bleibt
Im Oktober 2026 hat NVIDIA eine 64-GB-Ausführung des DGX Spark ergänzt. Der Chip bleibt der GB10 Grace Blackwell: 20 Arm-Kerne (10 Cortex-X925 und 10 Cortex-A725, mit MediaTek entworfen), Blackwell-GPU, Tensor Cores der fünften Generation und ConnectX-7 mit 200 Gbit/s auf der Platine. Der Systemspeicher ist 64 GB kohärentes LPDDR5X, das CPU und GPU gemeinsam adressieren, bei 273 GB/s. Das Netzteil leistet 240 W, die TDP des GB10 steht bei 140 W, das Gehäuse misst etwa 150 × 150 × 50,5 mm und wiegt 1,2 kg. Das System ist DGX OS mit dem CUDA-Stack. Es ist kein Windows-Desktop und kein macOS.
Ab dem 23. Oktober 2026 verkaufen Acer, ASUS, Dell, Gigabyte, HP und MSI. NVIDIAs Einstiegspreis liegt bei 4.999 $. Eine NVIDIA-eigene 64-GB-Founders-Version gibt es nicht. Die 128-GB-Variante bleibt im Angebot. The Register berichtete am 2. Oktober 2026, ihr Preis sei auf 6.950 $ gestiegen, deutlich über den ursprünglichen 3.999 $. Mehrere Berichte nennen außerdem halbierten Speicherplatz. Laufwerke und Kapazität stehen im Datenblatt des jeweiligen Herstellers. „Bis zu 4 TB“ ist das Maximum der Familie, nicht die Ausstattung jedes Geräts.
| Gerät | Speicher | Bandbreite | Was Sie tatsächlich kaufen |
|---|---|---|---|
| DGX Spark 64GB | 64 GB gemeinsam | 273 GB/s | Ein großes Modell, das auf dem Schreibtisch bleibt, samt Daten |
| RTX 4090 in der Cloud | 24 GB | etwa 1 TB/s | Modelle, die in 24 GB passen, stundenweise |
| L40S | 48 GB | etwa 864 GB/s | Eine Stufe über der 4090, weiter nach Stunde |
| A100 80GB / H100 80GB | 80 GB HBM | etwa 2 TB/s / etwa 3,35 TB/s | Training, Parallelität, größere Modelle in höherer Präzision |
1 PFLOP vergleicht das Gerät nicht mit einer H100
NVIDIA nennt bis zu 1 PetaFLOP FP4-KI-Leistung. Der Spitzenwert ordnet die Spark-Familie. Er ist nicht der BF16-Trainingsdurchsatz einer H100. Die Rate eines einzelnen Stroms ist die Bandbreite im nächsten Abschnitt.
Welche Modelle in 64 GB bleiben
NVIDIA sagt: Ein 64-GB-Gerät führt lokal Modelle bis etwa 100 Milliarden Parameter für Inferenz, Feintuning und Agenten aus. Zwei Geräte über ConnectX-7 bündeln 128 GB und reichen bis etwa 200 Milliarden. Das gilt nur zusammen mit der Präzision. Die Gewichtsgröße ist ungefähr Parameterzahl mal Byte je Parameter. GGUF Q4 liegt bei 0,55–0,6 Byte, FP8 oder Q8 bei etwa 1 Byte, BF16 bei etwa 2 Byte. Weitere 8–12 GB bleiben für System, Laufzeit und KV-Cache. Die Tabelle prüft die Kapazität, sie ist kein gemessener Tokens-pro-Sekunde-Wert aus einem Repository.
| Klasse | Gewichte, grob | Passt in 64 GB? | Die praktische Grenze |
|---|---|---|---|
| 8B, Q4 | etwa 5 GB | bequem | Platz für langen Kontext und Werkzeugaufrufe |
| 32B, Q4 | etwa 18 GB | bequem | Die übliche Größe eines lokalen Coding-Assistenten |
| 32B, Q8 / FP8 | etwa 32–35 GB | ja | Die Kontextlänge müssen Sie selbst begrenzen |
| 70B, Q4 | etwa 38–42 GB | ja, eng | Ein längerer Kontext leert zuerst den KV-Cache |
| 70B, FP8 | etwa 70 GB | nein | 128-GB-Spark oder eine 80-GB-Cloud-GPU |
| etwa 100B, Q4 | etwa 55 GB | an der genannten Obergrenze | Fast kein KV-Budget. Kein Alltagsmodell |
| 405B in nutzbarer Präzision | weit über 64 GB | nein | Verbund oder Cloud, nicht dieses Gerät |
Feintuning verbraucht Speicher schneller als Inferenz. QLoRA von 8B bis 14B ist der bequeme Bereich. 32B-QLoRA geht mit sehr kleiner Batch-Größe. Volles Feintuning oder ein Adapter mit hohem Rang bei 70B passt nicht in 64 GB. Wenn NVIDIA Feintuning als 64-GB-Last nennt, sind die Modelle gemeint, die schon hineinpassen, nicht „70B nach Belieben trainieren“.
Zuerst die Gewichte messen
Rechnen Sie das Modell, das wirklich resident bleiben soll, einmal in Q4 und einmal in FP8. Landet das zwischen 20 und 45 GB, gehört dieses Gerät ins Gespräch. Acht Gigabyte oder 70B in FP8 schieben Sie in eine andere Spalte der Kostentabelle.
Die Tokenrate trifft zuerst auf die Bandbreite
Bei Batch-Größe 1 liest jedes neue Token die Gewichte ungefähr einmal. Eine Obergrenze ist Bandbreite geteilt durch Gewichtsgröße. Das ist eine Decke, kein Benchmark: Kernel-Overhead, KV-Cache und CPU liegen darunter.
- 8B Q4, etwa 5 GB — 273 ÷ 5 ≈ 55 Token/s an Bandbreitenreserve
- 32B Q4, etwa 18 GB — 273 ÷ 18 ≈ 15 Token/s
- 70B Q4, etwa 40 GB — 273 ÷ 40 ≈ 6,8 Token/s
Dieselbe Skizze auf einer H100 SXM mit etwa 3,35 TB/s legt 40 GB Gewichte in die Nähe von 80 Token/s. Eine 4090 liegt bei etwa 1 TB/s, und ihre 24 GB halten kein 70B-Q4. Genau dort sitzt der Spark: Das Modell ist größer als eine Consumer-GPU, und Sie wollen den Durchsatz einer H100 nicht bezahlen. Sie kaufen „es passt, und die Daten bleiben hier“, nicht „es entspricht einer Rechenzentrums-GPU“.
Drei Jahre: Kauf und Stundenmesser sind verschiedene Einheiten
Die 4.999 $ sind nur die erste Zeile. Strom ist hier mit 160 W während der Inferenz und 0,15 $ je kWh angesetzt. 160 W liegen zwischen 140 W TDP und 240 W Netzteil. Das ist eine Planannahme, keine gemessene Kurve. Über 365,25 Tage sind drei Jahre 4.383 Stunden bei vier Stunden am Tag, 8.766 Stunden bei acht Stunden und 26.298 Stunden im Dauerbetrieb.
Die Cloud-Sätze sind Planwerte aus RunPods öffentlicher Stundenliste, wie sie Ende September 2026 noch zuordenbar war, nicht Markt-Untergrenzen. RTX 4090 zu 0,50 $/Stunde liegt zwischen Community Cloud 0,34 $ und Secure Cloud 0,74 $. L40S zu 0,90 $ liegt zwischen 0,79 $ und 1,09 $. A100 80 GB kostet 1,39 $, H100 SXM die Community-Rate von 2,69 $. Speicher, ausgehender Verkehr und Wartezeit fehlen. Die Sätze bewegen sich jede Woche. Rechnen Sie am Bestelltag neu.
# hours: Stunden mit echter Inferenz über drei Jahre hours = hours_per_day * 365.25 * 3 cloud = hours * hourly_usd # 0.160 kW und 0.15 USD/kWh sind Annahmen spark = 4999 + (0.160 * hours * 0.15)
| Muster über drei Jahre | Spark 64GB | 4090 · $0.50 | L40S · $0.90 | A100 · $1.39 | H100 · $2.69 |
|---|---|---|---|---|---|
| 4 Stunden am Tag | $5,104 | $2,192 | $3,945 | $6,092 | $11,790 |
| 8 Stunden am Tag | $5,209 | $4,383 | $7,889 | $12,185 | $23,581 |
| Dauerbetrieb | $5,630 | $13,149 | $23,668 | $36,554 | $70,742 |
4.999 $ geteilt durch den Stundensatz ergibt grob neun Stunden am Tag gegen eine 4090, fünf gegen eine L40S, 3,3 gegen eine A100 und 1,7 gegen eine H100. Strom und der Restwert nach drei Jahren verschieben die Linie. Einen Wiederverkaufspreis sagen wir nicht voraus: Das Gerät bleibt, die Mietstunden nicht. Brächte ein späterer Verkauf 1.500 $, lägen die versunkenen Hardwarekosten bei 3.499 $, und die Schwelle käme früher. Das ist eine Sensitivität, kein zugesagter Erlös.
64 GB, 128 GB und zwei Geräte an einem Kabel
64 GB und 128 GB teilen Chip, Bandbreite, DGX OS und ConnectX-7. Die Kapazität unterscheidet sich, und der Speicherplatz, den Berichte als halbiert beschreiben. Die zusätzlichen 1.951 $ der 128-GB-Variante zu 6.950 $ kaufen Platz für 70B in FP8, KV-Reserve bei einem Q4-70B und eine größere Feintuning-Batch. Liegt Ihre Gewichtstabelle schon bei 55 GB, kaufen Sie nicht 64 GB in der Hoffnung auf eine härtere Quantisierung.
Zwei 64-GB-Geräte verbindet ein QSFP-Kabel ohne Switch. NVIDIAs Cluster-Assistent übernimmt Erkennung und ConnectX-7. Der Pool hat 128 GB, Rechenleistung und Bandbreite verdoppeln sich ungefähr, der Einstieg liegt bei 9.998 $. Neben einem 128-GB-System für 6.950 $ ist das Paar kein Sparweg für Speicher. Es ist der Weg, ein zweites Gerät nachzurüsten, nachdem ein einzelnes 32B- bis 70B-Q4 seinen Platz verdient hat.
Wann die 4.999 $ die richtige Ausgabe sind
Kaufen Sie, wenn vier Dinge zugleich stimmen. Die residenten Gewichte liegen um 20–45 GB, eine 24-GB-Karte hält sie nicht. Das Gerät läuft an den meisten Arbeitstagen, nicht nur ein paar Nächte im Monat. Die Daten dürfen den Raum nicht verlassen. Und 70B Q4 im einstelligen Token-pro-Sekunde-Bereich ist für die Arbeit tragbar. Dann zahlen Sie für Residenz und eine Datengrenze. Drei Jahre A100 oder H100 liegen eine Größenordnung darüber.
Lassen Sie es in ebenso konkreten Fällen. Ein 8B- bis 32B-Modell für wenige Stunden am Tag ist über drei Jahre auf einer 4090 günstiger, und die Bandbreite ist höher. Training, hohe Parallelität, 70B in FP8 oder ein langer Kontext überfordern 64 GB und 273 GB/s. Mieten Sie eine 80-GB-GPU stundenweise oder sehen Sie sich den 128-GB-Spark für 6.950 $ an. Muss die Software macOS, Xcode oder Core ML sein, ist ein Arm-Linux-Gerät schon vor dem Preis das falsche System.
Schreiben Sie zuerst die echten Stunden der letzten Woche auf
Addieren Sie die Stunden, in denen ein Modell in den vergangenen zwei Wochen die GPU wirklich belegt hat, und multiplizieren Sie mit 26 für ein Jahr. Füllen Sie die Tabelle nicht mit „irgendwann läuft es vielleicht durch“. Aufgeblähte Stunden schieben Sie zu einem Gerät, das Sie nicht füllen.
Es steht nicht für einen Mac
Der DGX Spark beantwortet eine CUDA-Frage: Das Modell soll lokal bleiben und ist größer als eine Consumer-GPU. Die Ausführungsumgebung von Claude Code und Cursor, Xcode-Builds, der Simulator und Core ML sind eine andere Frage. Sie brauchen echtes macOS auf Apple Silicon, keinen GB10. Wer einen Spark für 4.999 $ als stärkeren Mac mini behandelt, verfehlt beide Aufgaben. Der CUDA-Stack bleibt unterbeschäftigt, die iOS-Pipeline startet nicht.
Liegt die schwere Arbeit bei nächtlicher CI, Repository-Index und langen Agentenläufen, passt ein dedizierter Remote-Mac oft besser als eine weitere Desktop-GPU. Auf der Preisseite von ZavCloud liegt die Monatsreferenz des Mac mini M4 mit 16 GB bei etwa 99,3 $ und die 24-GB-Stufe bei etwa 199,3 $. Sechsunddreißig durchgehende Monate sind etwa 3.575 $ und 7.175 $. Es gilt der Preis bei der Bestellung. Keine der beiden Stufen führt ein 70B aus, und keine gehört in einen CUDA-Vergleich mit dem Spark. Dazu passen der Drei-Jahres-Vergleich Kauf gegen Cloud Mac und die Aufteilung zwischen lokalem Mac und entferntem macOS. Das Modell bleibt auf dem Spark oder einer Cloud-GPU, Paketierung und Signierung auf einem Mac. Diese Trennung ist sauberer, als einer Maschine beides aufzuladen.
Fragen
Läuft ein 70B auf dem DGX Spark 64GB?
Q4 liegt bei etwa 40 GB, also ja, mit knappem Kontextbudget. FP8 liegt bei etwa 70 GB, also nein.
Was ist über drei Jahre günstiger?
Passt das Modell in 24 GB und brauchen Sie nur wenige Stunden am Tag, ist eine 4090-Miete meist günstiger. Brauchen Sie um die 40 GB an den meisten Arbeitstagen, bleibt der Kauf unter A100- oder H100-Stunden. Eine H100 drei Jahre durchlaufen zu lassen landet nahe siebzigtausend Dollar. Das ist eine andere Frage als dieses Gerät.
Bedeutet 1 PFLOP, dass es schneller ist als eine Rechenzentrums-GPU?
Nein. Das ist eine FP4-Spitze. Ein einzelner Strom endet bei 273 GB/s, bei einem 70B-Q4 etwa 7 Token/s an Bandbreitenreserve.
Machen zwei 64-GB-Geräte günstige 128 GB?
Nicht, wenn das Ziel Speicher ist. 9.998 $ gegen ein 128-GB-System für 6.950 $ bedeuten, dass Sie einen zweiten Rechensatz bezahlen. Kaufen Sie das zweite Gerät, wenn Sie die Rechenleistung brauchen.
Kann es Xcode oder Claude Code auf macOS tragen?
Nein. Das System ist DGX OS. Die macOS-Werkzeugkette gehört auf einen Mac oder auf einen dedizierten Remote-Mac, der Build und Agentenschleife übernimmt.
- Daten und Einstiegspreis — NVIDIA DGX Spark, 64 GB über OEM-Partner
- Preis und Verkaufsstart — Tom's Hardware, Oktober 2026
- 128-GB-Preisanpassung und halbierter Speicher — The Register, 2. Oktober 2026
- Cloud-GPU-Sätze — RunPod-Preise; die Tabelle nutzt öffentliche Stufen von Ende September 2026
ZavCloud Cloud Mac
Das Modell bleibt, wo es passt. Der Build gehört auf einen Mac.
Ein dedizierter Mac mini M4, echtes macOS, über SSH oder VNC. Für Xcode, Core ML und einen Agenten-Host, der anbleiben darf. Kein 64-GB-CUDA-Gerät.
Cloud-Mac-Preise ansehen