一臺放在顯示器旁邊的本機 AI 盒子,和按小時租來的雲 GPU,花的不是同一種錢。 下文先拆開這檔 64GB 機器的記憶體、頻寬和軟體棧,再按每天 4 小時、8 小時和全天開機三檔,把三年花費和 RTX 4090、L40S、A100、H100 的租金攤在一張表裡。模型放不放得下、生成速度卡在哪裡、以及它和 Mac 工作站各管哪一段,都在後面的小節裡。
64GB 這檔機器實際是什麼
NVIDIA 在 2026 年 10 月給 DGX Spark 加了一檔 64GB 配置。晶片仍是 GB10 Grace Blackwell 超晶片:20 核 Arm CPU(10 個 Cortex-X925 加 10 個 Cortex-A725,與聯發科合作設計)、Blackwell GPU、第五代 Tensor Core,以及一塊板載 ConnectX-7,對外 200 Gbps。系統記憶體是 64GB、可由 CPU 與 GPU 一致存取的 LPDDR5X,頻寬 273 GB/s。整機電源 240W,GB10 的 TDP 標為 140W,體積大約 150 × 150 × 50.5 毫米,重 1.2 公斤。作業系統是 DGX OS,上面是 NVIDIA 的 CUDA 軟體棧,不是 Windows 桌面,也不是 macOS。
這檔從 2026 年 10 月 23 日起由 Acer、華碩、戴爾、技嘉、惠普和微星銷售,NVIDIA 標的起價是 $4,999。沒有單獨的 NVIDIA 品牌 64GB 創始版。128GB 版仍在賣;《The Register》在 2026 年 10 月 2 日報導,這一檔的價格調到了 $6,950,較最初 $3,999 的上市價高出一截。多家報導同時提到,64GB 版的儲存也砍半。盤位和具體容量以各品牌配置單為準,不要把「最高 4TB」理解成每一臺都帶滿。
| 對照 | 可用記憶體 | 記憶體頻寬 | 它真正買到的東西 |
|---|---|---|---|
| DGX Spark 64GB | 64GB 統一記憶體 | 273 GB/s | 桌邊常駐、資料不出門的大模型推理 |
| RTX 4090 雲例項 | 24GB 顯存 | 約 1 TB/s | 放得進 24GB 的模型,按小時開關 |
| L40S | 48GB 顯存 | 約 864 GB/s | 比 4090 更大一檔,仍按小時計 |
| A100 80GB / H100 80GB | 80GB HBM | 約 2 TB/s / 約 3.35 TB/s | 訓練、高併發、更高精度的大模型 |
1 PFLOP 不是和 H100 比速度的數字
NVIDIA 寫的是最高 1 petaFLOP 的 FP4 AI 效能。這是規格表上的峰值,用來區分 Spark 家族內部還可以,不能拿去和 H100 的 BF16 訓練吞吐對比。單路生成快慢,先看下一節的頻寬。
64GB 能留下哪些模型
NVIDIA 的說法是:單臺 64GB 可本機跑最大約 1000 億引數的模型,用於推理、微調和 Agent;兩臺經 ConnectX-7 直連後,記憶體池到 128GB,口徑變成最大約 2000 億引數。這句話要和精度一起讀。權重體積大約是「引數量 × 每引數位元組數」。GGUF 的 Q4 大約 0.55–0.6 位元組,FP8 或 Q8 大約 1 位元組,BF16 大約 2 位元組。系統和執行時再留 8–12GB 給 KV cache。下表是容量判斷,不是某一倉庫的實測吞吐。
| 模型量級 | 權重大約 | 64GB 是否放得下 | 實際邊界 |
|---|---|---|---|
| 8B,Q4 | 約 5GB | 寬裕 | 長上下文、工具來回撥用都還有空 |
| 32B,Q4 | 約 18GB | 寬裕 | 本機編碼助手的常見檔 |
| 32B,Q8 / FP8 | 約 32–35GB | 可以 | 上下文長度要自己卡一下 |
| 70B,Q4 | 約 38–42GB | 能跑,餘量緊 | 上下文拉長時,先爆的是 KV,不是權重 |
| 70B,FP8 | 約 70GB | 放不下 | 看 128GB 版或雲上 80GB 卡 |
| 約 100B,Q4 | 約 55GB | 貼著官方上限 | 幾乎沒有 KV 預算,不適合當日常檔 |
| 405B 實用精度 | 遠超 64GB | 不能 | 多機或雲,不在這臺機器的範圍內 |
微調比推理更吃記憶體。8B 到 14B 的 QLoRA 是這臺機器舒服的區間;32B 的 QLoRA 能試,批次會很小;70B 的全參微調或高秩適配,64GB 不夠。NVIDIA 也把微調列進 64GB 的用途,但那指的是放得進記憶體的那一檔,不是「70B 隨便訓」。
先量權重,再談值不值得
把你真正要常駐的模型用 Q4 和 FP8 各算一遍體積。結果落在 20–45GB,這臺機器才有討論空間。算出來 8GB 或 70GB FP8,後面的價格表會把你帶到另一列。
生成速度先被頻寬卡住
單路、批次是 1 的時候,每生成一個 token 大體要把權重讀一遍。頻寬上限可以粗算成「記憶體頻寬 ÷ 權重體積」。這是天花板,不是跑分:核心開銷、KV 和 CPU 都會讓實際數字更低。
- 8B Q4,約 5GB— 273 ÷ 5 ≈ 55 token/s 的頻寬上限
- 32B Q4,約 18GB— 273 ÷ 18 ≈ 15 token/s
- 70B Q4,約 40GB— 273 ÷ 40 ≈ 6.8 token/s
同一條公式放到 H100 SXM 的約 3.35 TB/s 上,40GB 權重的上限大約是 80 token/s 這一量級。4090 的頻寬大約 1 TB/s,但 24GB 顯存放不下 70B 的 Q4。Spark 的位置就在這個夾縫裡:模型大於消費級顯存,你又不想為 H100 的吞吐付錢。它買的是「放得下並且資料留在桌上」,不是「和資料中心 GPU 一樣快」。
三年帳單:買斷和按小時不是同一個單位
硬體標價 $4,999 只是第一行。電費按推理時整機 160W、電價 $0.15/kWh 來估——160W 夾在 140W 的晶片 TDP 和 240W 電源之間,是規劃假設,不是實驗室測過的功耗曲線。三年的小時數按 365.25 天計算:每天 4 小時是 4,383 小時,每天 8 小時是 8,766 小時,全天開機是 26,298 小時。
雲側用 2026 年 9 月底仍能在 RunPod 價目上對上的公開按時價格作規劃價,不取市場地板價:RTX 4090 取 $0.50/小時(社群雲 $0.34、安全雲 $0.74 之間),L40S 取 $0.90($0.79 與 $1.09 之間),A100 80GB 取 $1.39,H100 SXM 取社群雲的 $2.69。儲存、出站流量和排隊都沒算進去。這些單價每週都會動,換供應商之前用當天價重算一遍。
# hours:三年裡真正在做推理的小時數 hours = hours_per_day * 365.25 * 3 cloud = hours * hourly_usd # 0.160 kW 與 0.15 美元/kWh 都是假設 spark = 4999 + (0.160 * hours * 0.15)
| 三年使用強度 | Spark 64GB | 4090 · $0.50 | L40S · $0.90 | A100 · $1.39 | H100 · $2.69 |
|---|---|---|---|---|---|
| 每天 4 小時 | $5,104 | $2,192 | $3,945 | $6,092 | $11,790 |
| 每天 8 小時 | $5,209 | $4,383 | $7,889 | $12,185 | $23,581 |
| 全天開機 | $5,630 | $13,149 | $23,668 | $36,554 | $70,742 |
只拿 $4,999 除以單價,大約的分界是:4090 要開滿約 9 小時/天才和買機器打平,L40S 約 5 小時,A100 約 3.3 小時,H100 約 1.7 小時。電費和三年後的殘值會把線再挪一挪。殘值這裡不預報具體數字——機器三年後還在,租金不會留下硬體。若轉手能收回 $1,500,真正沉沒的硬體成本是 $3,499,分界小時數會更短。這是敏感度,不是回收價承諾。
64GB、128GB,以及兩臺拼在一起
64GB 和 128GB 的晶片、頻寬、DGX OS 和 ConnectX-7 是同一套。差在容量,以及報導中減半的儲存。128GB 版 $6,950,多出來的 $1,951 買的是:70B FP8 放得下、Q4 70B 有足夠 KV、以及更大的微調批次。如果你的模型表已經貼著 55GB,不要買 64GB 再指望「以後量化更狠」。
兩臺 64GB 用 QSFP 線直連,不經過交換機,NVIDIA 的叢集助手負責發現和對 ConnectX-7 做配置。記憶體池是 128GB,算力和頻寬大約翻倍,起價卻是 $9,998。對照單臺 128GB 的 $6,950,拼兩臺便宜機不是省錢路徑。它適合的是:先買一臺把 32B–70B Q4 用順,確認需要第二臺的算力之後再加,而不是第一天就為了「湊夠 128GB」買兩臺。
什麼情況下這 $4,999 值得花
值得買,是四件事同時成立:常駐模型的權重大約在 20–45GB,24GB 卡放不下;多數工作日都會開著,而不是一個月裡突擊幾個晚上;資料不能離開辦公室或這臺機器;你接受 70B Q4 的生成速度停在個位數 token/s 附近。這時候你買的是記憶體駐留和資料邊界,雲上 A100、H100 的三年租金會比這臺機器高一個數量級。
不值得買,也很具體。模型停在 8B–32B、每天只開幾小時,租 4090 三年更便宜,頻寬還更高。要的是訓練、高併發,或者 70B FP8、長上下文,64GB 的容量和 273 GB/s 都不夠,應按小時租 80GB 卡,或直接看 $6,950 的 128GB 版。軟體必須是 macOS、Xcode 或 Core ML,這臺 ARM Linux 機器從系統上就對不上。
先寫下一週的真實小時數
把過去兩週裡「模型真的佔著 GPU」的小時加總,再乘 26,得到一年的量,不要用「以後可能會全天開著」來填表。小時數一虛,上面那張三年表就會把你推向一臺用不滿的機器。
它替代不了 macOS 上的開發機
DGX Spark 解決的是 CUDA 模型放在本機、又大於消費級顯存的問題。Claude Code、Cursor 的執行環境、Xcode 編譯、模擬器和 Core ML,走的是另一條路:需要的是真實 macOS 和 Apple Silicon,不是 GB10。把 $4,999 的 Spark 當成「一臺更強的 Mac mini」會兩頭落空——模型棧用不滿 CUDA,iOS 流水線又跑不起來。
如果重活是夜間 CI、倉庫索引和 Agent 長任務,遠端一臺獨享 Mac 往往比再買一塊桌面 GPU 更貼工作。ZavCloud 價目頁上,Mac mini M4 16GB 月租參考價約 $99.3,24GB 約 $199.3,連續租滿 36 個月大約是 $3,575 和 $7,175,以下單時的價格為準。這兩檔記憶體跑不了 70B,也不該拿來和 Spark 比 CUDA 吞吐。它們對上的是 Mac mini 自購和 Cloud Mac 的三年成本,以及 本機 Mac 與雲端 macOS 怎麼分工。模型在 Spark 或雲 GPU 上,打包和簽名在 Mac 上,這種拆法比用一臺機器包打天下更乾淨。
常見問題
DGX Spark 64GB 能跑 70B 嗎?
Q4 大約 40GB,放得下,上下文預算不寬。FP8 大約 70GB,放不下。
和雲 GPU 比,三年誰更便宜?
模型進得了 24GB、每天只用幾小時,租 4090 通常更便宜。模型要 40GB 上下、而且多數工作日都開著,買 Spark 會低於按小時租 A100 或 H100。全天把 H100 開三年,帳單會到七萬美元這一檔,和這臺機器已經不是同一個問題。
1 PFLOP 能不能當成它比資料中心 GPU 更快?
不能。那是 FP4 峰值。單路生成先被 273 GB/s 卡住,70B Q4 的頻寬上限大約 7 token/s。
兩臺 64GB 拼 128GB 划算嗎?
不划算於「買記憶體」。$9,998 對比單臺 128GB 的 $6,950,你多付的是第二套算力。需要第二套算力時再買,不要為了容量先買兩臺。
能拿它做 Xcode 或在 macOS 上跑 Claude Code 嗎?
不能。系統是 DGX OS。macOS 工具鏈用 Mac,或者用一臺遠端獨享 Mac 把編譯和 Agent 執行接出去。
- 規格與起價— NVIDIA DGX Spark 產品頁,64GB 為 OEM 配置
- 售價與上市日— Tom's Hardware,2026 年 10 月
- 128GB 調價與儲存減半— The Register,2026-10-02
- 雲 GPU 單價— RunPod 價目,文中取 2026 年 9 月底可見的公開檔作規劃價
ZavCloud Cloud Mac
模型留下,編譯和 Agent 放到 Mac 上
獨享 Mac mini M4,真實 macOS,SSH / VNC 接入。適合 Xcode、Core ML 和需要一直開著的 Agent 執行環境,不拿它冒充 64GB CUDA 盒子。
檢視 Mac 雲主機定價