Le NVIDIA DGX Spark 64 Go vaut-il 4 999 $ ? Le boîtier local et un GPU cloud ne sont pas facturés de la même façon

Matériel  ·  2026.10.08  ·  environ 12 minutes

Petit ordinateur de bureau, image d’un poste d’IA local à côté d’un GPU loué à distance

Un boîtier d’IA posé à côté de l’écran et un GPU cloud facturé à l’heure ne dépensent pas le même genre d’argent. Les sections qui suivent séparent d’abord la mémoire, la bande passante et la pile logicielle de cette version 64 Go, puis placent trois ans d’usage — quatre heures par jour, huit heures, et en continu — à côté d’une RTX 4090, d’une L40S, d’une A100 et d’une H100. Les modèles qui tiennent, l’endroit où le débit se bloque, et la part qui reste à un Mac viennent ensuite.

$4,999
Prix d’entrée 64 Go
64 GB
Mémoire unifiée
273
Bande passante, Go/s

Ce qui ne change pas dans la version 64 Go

En octobre 2026, NVIDIA a ajouté une configuration 64 Go du DGX Spark. La puce reste le superchip GB10 Grace Blackwell : CPU Arm 20 cœurs (10 Cortex-X925 et 10 Cortex-A725, conçus avec MediaTek), GPU Blackwell, Tensor Cores de cinquième génération, et un ConnectX-7 embarqué à 200 Gbit/s. La mémoire système est 64 Go de LPDDR5X cohérente, adressée ensemble par le CPU et le GPU, à 273 Go/s. L’alimentation fait 240 W, le TDP du GB10 est indiqué à 140 W, le boîtier mesure environ 150 × 150 × 50,5 mm et pèse 1,2 kg. Le système est DGX OS avec la pile CUDA. Ce n’est ni un bureau Windows ni macOS.

À partir du 23 octobre 2026, Acer, ASUS, Dell, Gigabyte, HP et MSI la vendent. Le prix de départ NVIDIA est de 4 999 $. Il n’y a pas de version Founders 64 Go signée NVIDIA. Le modèle 128 Go reste en vente. The Register indiquait le 2 octobre 2026 que son prix était passé à 6 950 $, bien au-dessus des 3 999 $ du lancement. Plusieurs articles précisent aussi que le stockage de la version 64 Go est réduit de moitié. Le nombre de disques et la capacité suivent la fiche de chaque constructeur. « Jusqu’à 4 To » est le maximum de la gamme, pas le contenu de chaque machine.

MachineMémoireBande passanteCe que vous achetez vraiment
DGX Spark 64 Go64 Go unifiés273 Go/sUn grand modèle qui reste sur le bureau, données comprises
RTX 4090 cloud24 Goenviron 1 To/sLes modèles qui tiennent dans 24 Go, à l’heure
L40S48 Goenviron 864 Go/sUn cran au-dessus d’une 4090, toujours à l’heure
A100 80 Go / H100 80 Go80 Go HBMenviron 2 To/s / environ 3,35 To/sEntraînement, concurrence, modèles plus grands à plus haute précision

1 PFLOP ne sert pas à comparer la machine à une H100

NVIDIA annonce jusqu’à 1 pétaFLOP de performance IA en FP4. Ce pic range la famille Spark. Ce n’est pas le débit d’entraînement BF16 d’une H100. Le débit d’un seul flux, c’est la bande passante de la section suivante.

Quels modèles tiennent dans 64 Go

NVIDIA indique qu’une unité 64 Go fait tourner localement des modèles jusqu’à environ 100 milliards de paramètres, pour l’inférence, l’affinage et les agents, et que deux unités reliées en ConnectX-7 mettent en commun 128 Go pour environ 200 milliards. Il faut lire cela avec la précision. La taille des poids est à peu près le nombre de paramètres fois les octets par paramètre. Un Q4 GGUF tourne autour de 0,55 à 0,6 octet, le FP8 ou le Q8 autour de 1 octet, le BF16 autour de 2 octets. Gardez encore 8 à 12 Go pour le système, le runtime et le cache KV. Le tableau juge la capacité, ce n’est pas un débit mesuré dans un dépôt précis.

ClassePoids, environTient dans 64 Go ?La limite pratique
8B, Q4environ 5 GolargementEncore de la place pour un long contexte et des appels d’outils
32B, Q4environ 18 GolargementLa taille habituelle d’un assistant de code local
32B, Q8 / FP8environ 32–35 GoouiIl faut plafonner vous-même la longueur du contexte
70B, Q4environ 38–42 Gooui, justeUn contexte plus long épuise le KV avant les poids
70B, FP8environ 70 GononSpark 128 Go, ou un GPU cloud de 80 Go
environ 100B, Q4environ 55 Gocontre le plafond annoncéPresque plus de budget KV. Pas un modèle du quotidien
405B à une précision utilebien au-delà de 64 GononUn groupe de machines ou le cloud

L’affinage dépense la mémoire plus vite que l’inférence. Le QLoRA de 8B à 14B est la zone confortable. Un QLoRA 32B est possible avec un lot très petit. L’affinage complet ou un adaptateur de rang élevé en 70B ne tient pas dans 64 Go. Quand NVIDIA cite l’affinage parmi les usages 64 Go, il s’agit des modèles qui entrent déjà, pas d’un 70B entraîné à volonté.

Mesurez les poids avant le prix

Calculez le modèle que vous voulez vraiment laisser résident, une fois en Q4 et une fois en FP8. S’il tombe entre 20 et 45 Go, cette machine entre dans la discussion. Huit gigaoctets, ou un 70B en FP8, vous envoient dans une autre colonne du tableau de coûts.

Le débit bute d’abord sur la bande passante

Avec un lot de 1, chaque nouveau token relit à peu près les poids une fois. Un plafond se calcule en divisant la bande passante par la taille des poids. C’est un plafond, pas un benchmark : le surcoût du noyau, le cache KV et le CPU restent en dessous.

  • 8B Q4, environ 5 Go — 273 ÷ 5 ≈ 55 tokens/s de marge de bande passante
  • 32B Q4, environ 18 Go — 273 ÷ 18 ≈ 15 tokens/s
  • 70B Q4, environ 40 Go — 273 ÷ 40 ≈ 6,8 tokens/s

Le même croquis sur une H100 SXM à environ 3,35 To/s place 40 Go de poids près d’un plafond de 80 tokens/s. Une 4090 tourne autour de 1 To/s, et ses 24 Go ne tiennent pas un 70B Q4. C’est l’intervalle du Spark : le modèle dépasse un GPU grand public, et vous ne voulez pas payer le débit d’une H100. Vous achetez « ça tient, et les données restent ici », pas « c’est équivalent à un GPU de centre de données ».

Trois ans : un achat et un compteur horaire ne sont pas la même unité

Les 4 999 $ ne sont que la première ligne. L’électricité est ici estimée à 160 W pendant la génération et 0,15 $ le kWh. 160 W se situe entre le TDP de 140 W et l’alimentation de 240 W. C’est une hypothèse de planification, pas une courbe mesurée. Sur 365,25 jours, trois ans font 4 383 heures à quatre heures par jour, 8 766 heures à huit heures, et 26 298 heures si la machine ne s’arrête pas.

Les tarifs cloud sont des valeurs de travail prises sur la grille horaire publique de RunPod telle qu’elle se lisait encore fin septembre 2026, pas les planchers du marché. La RTX 4090 à 0,50 $/h se place entre le cloud communautaire à 0,34 $ et le cloud sécurisé à 0,74 $. La L40S à 0,90 $ se place entre 0,79 $ et 1,09 $. L’A100 80 Go est à 1,39 $, la H100 SXM au tarif communautaire de 2,69 $. Le stockage, le trafic sortant et l’attente ne sont pas dans le tableau. Ces prix bougent chaque semaine. Recalculez le jour de la commande.

Dépense sur trois ans (mettez vos heures)
# hours : heures de génération réelle sur trois ans
hours = hours_per_day * 365.25 * 3
cloud = hours * hourly_usd
# 0.160 kW et 0.15 USD/kWh sont des hypothèses
spark = 4999 + (0.160 * hours * 0.15)
Rythme sur trois ansSpark 64 Go4090 · $0.50L40S · $0.90A100 · $1.39H100 · $2.69
4 heures par jour$5,104$2,192$3,945$6,092$11,790
8 heures par jour$5,209$4,383$7,889$12,185$23,581
En continu$5,630$13,149$23,668$36,554$70,742

Divisez 4 999 $ par le tarif horaire : le croisement approximatif est d’environ neuf heures par jour face à une 4090, cinq face à une L40S, 3,3 face à une A100 et 1,7 face à une H100. L’électricité et ce que vaudra le boîtier dans trois ans déplacent la ligne. Nous ne prévoyons pas de prix de revente : la machine reste, les heures louées non. Si une vente ultérieure rapportait 1 500 $, le matériel réellement engagé serait de 3 499 $, et le seuil arriverait plus tôt. C’est une sensibilité, pas un prix de reprise promis.

64 Go, 128 Go, et deux boîtiers sur un câble

Les versions 64 Go et 128 Go partagent la puce, la bande passante, DGX OS et le ConnectX-7. La capacité change, ainsi que le stockage que les articles décrivent comme réduit de moitié. Les 1 951 $ de plus du modèle 128 Go à 6 950 $ achètent la place pour un 70B en FP8, une marge KV sur un 70B Q4, et un lot d’affinage plus grand. Si votre table de poids est déjà près de 55 Go, n’achetez pas 64 Go en espérant qu’une quantification plus dure vous sauvera.

Deux unités 64 Go se relient par un câble QSFP, sans commutateur. L’assistant de cluster NVIDIA gère la découverte et le ConnectX-7. Le pool fait 128 Go, le calcul et la bande passante doublent à peu près, et le prix de départ est de 9 998 $. À côté d’une seule machine 128 Go à 6 950 $, la paire n’est pas une façon d’économiser sur la mémoire. C’est une façon d’ajouter une deuxième unité après qu’une seule machine 32B à 70B Q4 a justifié le calcul supplémentaire.

Quand les 4 999 $ sont la bonne dépense

Achetez quand quatre conditions sont vraies ensemble. Les poids résidents se situent autour de 20 à 45 Go, donc une carte de 24 Go ne les contient pas. La machine sera allumée la plupart des jours ouvrés, pas quelques nuits par mois. Les données ne peuvent pas quitter la pièce. Et vous pouvez vivre avec un 70B Q4 proche du simple chiffre en tokens par seconde. Dans ce cas, vous payez la résidence et une frontière de données. Trois ans d’A100 ou de H100 se situent un ordre de grandeur au-dessus.

Passez votre chemin dans des cas tout aussi concrets. Un modèle 8B à 32B utilisé quelques heures par jour coûte moins cher sur trois ans en 4090, et la bande passante est plus haute. L’entraînement, une forte concurrence, un 70B en FP8 ou un long contexte dépassent à la fois 64 Go et 273 Go/s. Louez un GPU de 80 Go à l’heure, ou regardez le Spark 128 Go à 6 950 $. Si le logiciel doit être macOS, Xcode ou Core ML, une machine Arm sous Linux est le mauvais système avant même le prix.

Écrivez d’abord les heures réelles de la semaine dernière

Additionnez les heures où un modèle occupait vraiment le GPU ces deux dernières semaines, puis multipliez par 26 pour une année. Ne remplissez pas le tableau avec « on le laissera peut-être allumé plus tard ». Des heures gonflées poussent cette feuille de trois ans vers une machine que vous ne remplirez pas.

Elle ne tient pas lieu de Mac

Le DGX Spark répond à un problème CUDA : le modèle doit rester local, et il est plus gros qu’un GPU grand public. L’environnement d’exécution de Claude Code et de Cursor, les builds Xcode, le simulateur et Core ML sont un autre problème. Ils demandent un vrai macOS sur Apple Silicon, pas un GB10. Traiter un Spark à 4 999 $ comme un Mac mini plus fort rate les deux tâches. La pile CUDA reste sous-employée, et le pipeline iOS ne démarre pas.

Quand le gros du travail est une CI de nuit, l’indexation d’un dépôt et de longues exécutions d’agent, un Mac distant dédié colle souvent mieux qu’un GPU de bureau de plus. Sur la page de tarifs ZavCloud, la référence mensuelle du Mac mini M4 16 Go est d’environ 99,3 $ et le palier 24 Go d’environ 199,3 $. Trente-six mois continus font environ 3 575 $ et 7 175 $, et le prix qui compte est celui de la commande. Aucun de ces deux paliers ne fait tourner un 70B, et aucun ne se compare au Spark sur le débit CUDA. Ils correspondent à la note achat d’un Mac mini contre Cloud Mac sur trois ans, et à la répartition entre un Mac local et un nœud macOS distant. Laissez le modèle sur le Spark ou un GPU cloud, et le paquetage ainsi que la signature sur un Mac. Cette coupe est plus nette que de tout demander à une seule machine.

Questions

Un 70B tourne-t-il sur le DGX Spark 64 Go ?
Le Q4 fait environ 40 Go, donc oui, avec un budget de contexte étroit. Le FP8 fait environ 70 Go, donc non.

Qu’est-ce qui coûte le moins cher sur trois ans ?
Si le modèle tient dans 24 Go et que vous n’avez besoin que de quelques heures par jour, une 4090 louée est en général moins chère. S’il vous faut autour de 40 Go la plupart des jours ouvrés, l’achat du Spark reste sous la location horaire d’une A100 ou d’une H100. Laisser une H100 allumée trois ans approche les soixante-dix mille dollars. Ce n’est plus la question de ce boîtier.

1 PFLOP veut-il dire plus rapide qu’un GPU de centre de données ?
Non. C’est un pic FP4. Un flux unique est plafonné par 273 Go/s, environ 7 tokens/s de marge sur un 70B Q4.

Deux unités 64 Go font-elles des 128 Go bon marché ?
Pas si le but est la mémoire. 9 998 $ contre une machine 128 Go à 6 950 $, c’est un second jeu de calcul que vous payez. Achetez la seconde unité quand le calcul est nécessaire.

Peut-elle héberger Xcode ou Claude Code sur macOS ?
Non. Le système est DGX OS. La chaîne macOS appartient à un Mac, ou à un Mac distant dédié qui prend le build et la boucle d’agent.

  • Fiche et prix de départ — NVIDIA DGX Spark, 64 Go vendu par les partenaires OEM
  • Prix et date de vente — Tom's Hardware, octobre 2026
  • Hausse du 128 Go et stockage réduit de moitié — The Register, 2 octobre 2026
  • Tarifs GPU cloud — tarifs RunPod ; le tableau reprend des paliers publics encore visibles fin septembre 2026

ZavCloud Cloud Mac

Laissez le modèle là où il tient. Mettez le build sur un Mac.

Un Mac mini M4 dédié, un vrai macOS, en SSH ou VNC. Pour Xcode, Core ML, et un hôte d’agent que vous pouvez laisser allumé. Ce n’est pas un boîtier CUDA de 64 Go.

Voir les tarifs Cloud Mac
Cloud Mac Voir les tarifs