NVIDIA DGX Spark 64GB 值得买吗?$4,999 的本地 AI 工作站,和云 GPU 比的是三年账单

硬件选型  ·  2026.10.08  ·  约 12 分钟阅读

桌面上的小型主机,用来示意本地 AI 工作站与远程 GPU 的分工

一台放在显示器旁边的本地 AI 盒子,和按小时租来的云 GPU,花的不是同一种钱。 下文先拆开这档 64GB 机器的内存、带宽和软件栈,再按每天 4 小时、8 小时和全天开机三档,把三年花费和 RTX 4090、L40S、A100、H100 的租金摊在一张表里。模型放不放得下、生成速度卡在哪里、以及它和 Mac 工作站各管哪一段,都在后面的小节里。

$4,999
64GB 版起价
64 GB
统一内存
273
带宽 GB/s

64GB 这档机器实际是什么

NVIDIA 在 2026 年 10 月给 DGX Spark 加了一档 64GB 配置。芯片仍是 GB10 Grace Blackwell 超芯片:20 核 Arm CPU(10 个 Cortex-X925 加 10 个 Cortex-A725,与联发科合作设计)、Blackwell GPU、第五代 Tensor Core,以及一块板载 ConnectX-7,对外 200 Gbps。系统内存是 64GB、可由 CPU 与 GPU 一致访问的 LPDDR5X,带宽 273 GB/s。整机电源 240W,GB10 的 TDP 标为 140W,体积大约 150 × 150 × 50.5 毫米,重 1.2 公斤。操作系统是 DGX OS,上面是 NVIDIA 的 CUDA 软件栈,不是 Windows 桌面,也不是 macOS。

这档从 2026 年 10 月 23 日起由 Acer、华硕、戴尔、技嘉、惠普和微星销售,NVIDIA 标的起价是 $4,999。没有单独的 NVIDIA 品牌 64GB 创始人版。128GB 版仍在卖;《The Register》在 2026 年 10 月 2 日报道,这一档的价格调到了 $6,950,较最初 $3,999 的上市价高出一截。多家报道同时提到,64GB 版的存储也砍半。盘位和具体容量以各品牌配置单为准,不要把「最高 4TB」理解成每一台都带满。

对照 可用内存 内存带宽 它真正买到的东西
DGX Spark 64GB 64GB 统一内存 273 GB/s 桌边常驻、数据不出门的大模型推理
RTX 4090 云实例 24GB 显存 约 1 TB/s 放得进 24GB 的模型,按小时开关
L40S 48GB 显存 约 864 GB/s 比 4090 更大一档,仍按小时计
A100 80GB / H100 80GB 80GB HBM 约 2 TB/s / 约 3.35 TB/s 训练、高并发、更高精度的大模型

1 PFLOP 不是和 H100 比速度的数字

NVIDIA 写的是最高 1 petaFLOP 的 FP4 AI 性能。这是规格表上的峰值,用来区分 Spark 家族内部还可以,不能拿去和 H100 的 BF16 训练吞吐对比。单路生成快慢,先看下一节的带宽。

64GB 能留下哪些模型

NVIDIA 的说法是:单台 64GB 可本地跑最大约 1000 亿参数的模型,用于推理、微调和 Agent;两台经 ConnectX-7 直连后,内存池到 128GB,口径变成最大约 2000 亿参数。这句话要和精度一起读。权重体积大约是「参数量 × 每参数字节数」。GGUF 的 Q4 大约 0.55–0.6 字节,FP8 或 Q8 大约 1 字节,BF16 大约 2 字节。系统和运行时再留 8–12GB 给 KV cache。下表是容量判断,不是某一仓库的实测吞吐。

模型量级 权重大约 64GB 是否放得下 实际边界
8B,Q4 约 5GB 宽裕 长上下文、工具来回调用都还有空
32B,Q4 约 18GB 宽裕 本地编码助手的常见档
32B,Q8 / FP8 约 32–35GB 可以 上下文长度要自己卡一下
70B,Q4 约 38–42GB 能跑,余量紧 上下文拉长时,先爆的是 KV,不是权重
70B,FP8 约 70GB 放不下 看 128GB 版或云上 80GB 卡
约 100B,Q4 约 55GB 贴着官方上限 几乎没有 KV 预算,不适合当日常档
405B 实用精度 远超 64GB 不能 多机或云,不在这台机器的范围内

微调比推理更吃内存。8B 到 14B 的 QLoRA 是这台机器舒服的区间;32B 的 QLoRA 能试,批次会很小;70B 的全参微调或高秩适配,64GB 不够。NVIDIA 也把微调列进 64GB 的用途,但那指的是放得进内存的那一档,不是「70B 随便训」。

先量权重,再谈值不值得

把你真正要常驻的模型用 Q4 和 FP8 各算一遍体积。结果落在 20–45GB,这台机器才有讨论空间。算出来 8GB 或 70GB FP8,后面的价格表会把你带到另一列。

生成速度先被带宽卡住

单路、批量是 1 的时候,每生成一个 token 大体要把权重读一遍。带宽上限可以粗算成「内存带宽 ÷ 权重体积」。这是天花板,不是跑分:内核开销、KV 和 CPU 都会让实际数字更低。

  • 8B Q4,约 5GB— 273 ÷ 5 ≈ 55 token/s 的带宽上限
  • 32B Q4,约 18GB— 273 ÷ 18 ≈ 15 token/s
  • 70B Q4,约 40GB— 273 ÷ 40 ≈ 6.8 token/s

同一条公式放到 H100 SXM 的约 3.35 TB/s 上,40GB 权重的上限大约是 80 token/s 这一量级。4090 的带宽大约 1 TB/s,但 24GB 显存放不下 70B 的 Q4。Spark 的位置就在这个夹缝里:模型大于消费级显存,你又不想为 H100 的吞吐付钱。它买的是「放得下并且数据留在桌上」,不是「和数据中心 GPU 一样快」。

三年账单:买断和按小时不是同一个单位

硬件标价 $4,999 只是第一行。电费按推理时整机 160W、电价 $0.15/kWh 来估——160W 夹在 140W 的芯片 TDP 和 240W 电源之间,是规划假设,不是实验室测过的功耗曲线。三年的小时数按 365.25 天计算:每天 4 小时是 4,383 小时,每天 8 小时是 8,766 小时,全天开机是 26,298 小时。

云侧用 2026 年 9 月底仍能在 RunPod 价目上对上的公开按时价格作规划价,不取市场地板价:RTX 4090 取 $0.50/小时(社区云 $0.34、安全云 $0.74 之间),L40S 取 $0.90($0.79 与 $1.09 之间),A100 80GB 取 $1.39,H100 SXM 取社区云的 $2.69。存储、出站流量和排队都没算进去。这些单价每周都会动,换供应商之前用当天价重算一遍。

三年花费(把你的小时数代进去)
# hours:三年里真正在做推理的小时数
hours = hours_per_day * 365.25 * 3
cloud = hours * hourly_usd
# 0.160 kW 与 0.15 美元/kWh 都是假设
spark = 4999 + (0.160 * hours * 0.15)
三年使用强度 Spark 64GB 4090 · $0.50 L40S · $0.90 A100 · $1.39 H100 · $2.69
每天 4 小时 $5,104 $2,192 $3,945 $6,092 $11,790
每天 8 小时 $5,209 $4,383 $7,889 $12,185 $23,581
全天开机 $5,630 $13,149 $23,668 $36,554 $70,742

只拿 $4,999 除以单价,大约的分界是:4090 要开满约 9 小时/天才和买机器打平,L40S 约 5 小时,A100 约 3.3 小时,H100 约 1.7 小时。电费和三年后的残值会把线再挪一挪。残值这里不预报具体数字——机器三年后还在,租金不会留下硬件。若转手能收回 $1,500,真正沉没的硬件成本是 $3,499,分界小时数会更短。这是敏感度,不是回收价承诺。

64GB、128GB,以及两台拼在一起

64GB 和 128GB 的芯片、带宽、DGX OS 和 ConnectX-7 是同一套。差在容量,以及报道中减半的存储。128GB 版 $6,950,多出来的 $1,951 买的是:70B FP8 放得下、Q4 70B 有足够 KV、以及更大的微调批次。如果你的模型表已经贴着 55GB,不要买 64GB 再指望「以后量化更狠」。

两台 64GB 用 QSFP 线直连,不经过交换机,NVIDIA 的集群助手负责发现和对 ConnectX-7 做配置。内存池是 128GB,算力和带宽大约翻倍,起价却是 $9,998。对照单台 128GB 的 $6,950,拼两台便宜机不是省钱路径。它适合的是:先买一台把 32B–70B Q4 用顺,确认需要第二台的算力之后再加,而不是第一天就为了「凑够 128GB」买两台。

什么情况下这 $4,999 值得花

值得买,是四件事同时成立:常驻模型的权重大约在 20–45GB,24GB 卡放不下;多数工作日都会开着,而不是一个月里突击几个晚上;数据不能离开办公室或这台机器;你接受 70B Q4 的生成速度停在个位数 token/s 附近。这时候你买的是内存驻留和数据边界,云上 A100、H100 的三年租金会比这台机器高一个数量级。

不值得买,也很具体。模型停在 8B–32B、每天只开几小时,租 4090 三年更便宜,带宽还更高。要的是训练、高并发,或者 70B FP8、长上下文,64GB 的容量和 273 GB/s 都不够,应按小时租 80GB 卡,或直接看 $6,950 的 128GB 版。软件必须是 macOS、Xcode 或 Core ML,这台 ARM Linux 机器从系统上就对不上。

先写下一周的真实小时数

把过去两周里「模型真的占着 GPU」的小时加总,再乘 26,得到一年的量,不要用「以后可能会全天开着」来填表。小时数一虚,上面那张三年表就会把你推向一台用不满的机器。

它替代不了 macOS 上的开发机

DGX Spark 解决的是 CUDA 模型放在本地、又大于消费级显存的问题。Claude Code、Cursor 的执行环境、Xcode 编译、模拟器和 Core ML,走的是另一条路:需要的是真实 macOS 和 Apple Silicon,不是 GB10。把 $4,999 的 Spark 当成「一台更强的 Mac mini」会两头落空——模型栈用不满 CUDA,iOS 流水线又跑不起来。

如果重活是夜间 CI、仓库索引和 Agent 长任务,远程一台独享 Mac 往往比再买一块桌面 GPU 更贴工作。ZavCloud 价目页上,Mac mini M4 16GB 月租参考价约 $99.3,24GB 约 $199.3,连续租满 36 个月大约是 $3,575 和 $7,175,以下单时的价格为准。这两档内存跑不了 70B,也不该拿来和 Spark 比 CUDA 吞吐。它们对上的是 Mac mini 自购和 Cloud Mac 的三年成本,以及 本地 Mac 与云端 macOS 怎么分工。模型在 Spark 或云 GPU 上,打包和签名在 Mac 上,这种拆法比用一台机器包打天下更干净。

常见问题

DGX Spark 64GB 能跑 70B 吗?
Q4 大约 40GB,放得下,上下文预算不宽。FP8 大约 70GB,放不下。

和云 GPU 比,三年谁更便宜?
模型进得了 24GB、每天只用几小时,租 4090 通常更便宜。模型要 40GB 上下、而且多数工作日都开着,买 Spark 会低于按小时租 A100 或 H100。全天把 H100 开三年,账单会到七万美元这一档,和这台机器已经不是同一个问题。

1 PFLOP 能不能当成它比数据中心 GPU 更快?
不能。那是 FP4 峰值。单路生成先被 273 GB/s 卡住,70B Q4 的带宽上限大约 7 token/s。

两台 64GB 拼 128GB 划算吗?
不划算于「买内存」。$9,998 对比单台 128GB 的 $6,950,你多付的是第二套算力。需要第二套算力时再买,不要为了容量先买两台。

能拿它做 Xcode 或在 macOS 上跑 Claude Code 吗?
不能。系统是 DGX OS。macOS 工具链用 Mac,或者用一台远程独享 Mac 把编译和 Agent 执行接出去。

ZavCloud Cloud Mac

模型留下,编译和 Agent 放到 Mac 上

独享 Mac mini M4,真实 macOS,SSH / VNC 接入。适合 Xcode、Core ML 和需要一直开着的 Agent 执行环境,不拿它冒充 64GB CUDA 盒子。

查看 Mac 云主机定价
Cloud Mac 查看 Mac 云主机定价