Стоит ли NVIDIA DGX Spark 64 ГБ своих $4 999? Локальный ИИ-бокс и облачный GPU считают деньги по-разному

Оборудование  ·  2026.10.08  ·  около 12 минут

Небольшой настольный компьютер как образ локальной ИИ-станции рядом с арендованным GPU

Локальный ИИ-бокс рядом с монитором и облачный GPU с почасовой оплатой тратят не одни и те же деньги. Сначала разберём память, пропускную способность и программный стек этой конфигурации на 64 ГБ, затем положим три года при четырёх часах в день, восьми часах и круглосуточной работе рядом с RTX 4090, L40S, A100 и H100. Какие модели влезают, где встаёт скорость генерации и какая часть работы остаётся Mac, идёт следом.

$4,999
Старт 64 ГБ
64 GB
Общая память
273
Шина, ГБ/с

Что в версии на 64 ГБ остаётся тем же

В октябре 2026 года NVIDIA добавила конфигурацию DGX Spark на 64 ГБ. Чип по-прежнему GB10 Grace Blackwell: 20 ядер Arm (10 Cortex-X925 и 10 Cortex-A725, совместно с MediaTek), GPU Blackwell, тензорные ядра пятого поколения и встроенный ConnectX-7 на 200 Гбит/с. Системная память — 64 ГБ когерентной LPDDR5X, к которой CPU и GPU обращаются совместно, на 273 ГБ/с. Блок питания 240 Вт, TDP GB10 указан как 140 Вт, корпус около 150 × 150 × 50,5 мм, вес 1,2 кг. Система — DGX OS и стек CUDA. Это не настольная Windows и не macOS.

С 23 октября 2026 года её продают Acer, ASUS, Dell, Gigabyte, HP и MSI. Стартовая цена NVIDIA — $4 999. Отдельной версии Founders на 64 ГБ под маркой NVIDIA нет. Модель на 128 ГБ остаётся в продаже. 2 октября 2026 года The Register написал, что её цена сдвинулась к $6 950, заметно выше стартовых $3 999. В нескольких материалах также говорят, что накопитель у версии на 64 ГБ урезан вдвое. Число дисков и объём смотрите в спецификации конкретного бренда. «До 4 ТБ» — потолок семейства, а не комплектация каждой машины.

МашинаПамятьШинаЧто вы на самом деле покупаете
DGX Spark 64 ГБ64 ГБ общей273 ГБ/сБольшая модель, которая живёт на столе вместе с данными
RTX 4090 в облаке24 ГБоколо 1 ТБ/сМодели, которые влезают в 24 ГБ, по часам
L40S48 ГБоколо 864 ГБ/сНа шаг выше 4090, оплата всё так же почасовая
A100 80 ГБ / H100 80 ГБ80 ГБ HBMоколо 2 ТБ/с / около 3,35 ТБ/сОбучение, параллельность, крупные модели в более высокой точности

1 PFLOP не сравнивает эту машину с H100

NVIDIA указывает до 1 петафлопса ИИ-производительности в FP4. Пик годится, чтобы различать машины внутри семейства Spark. Это не пропускная способность обучения H100 в BF16. Скорость одного потока — это шина в следующем разделе.

Какие модели остаются в 64 ГБ

Формулировка NVIDIA такая: одна машина на 64 ГБ локально запускает модели примерно до 100 миллиардов параметров для инференса, дообучения и агентов, а две машины, связанные через ConnectX-7, собирают пул 128 ГБ и доходят примерно до 200 миллиардов. Читать это нужно вместе с точностью. Объём весов — это примерно число параметров, умноженное на байты на параметр. GGUF Q4 — около 0,55–0,6 байта, FP8 или Q8 — около 1 байта, BF16 — около 2 байт. Ещё 8–12 ГБ оставьте системе, среде выполнения и кэшу KV. Таблица проверяет вместимость, это не измеренные токены в секунду из одного репозитория.

КлассВеса, примерноВлезает в 64 ГБ?Практическая граница
8B, Q4около 5 ГБс запасомЕсть место для длинного контекста и вызовов инструментов
32B, Q4около 18 ГБс запасомОбычный размер локального помощника для кода
32B, Q8 / FP8около 32–35 ГБдаДлину контекста придётся ограничивать самим
70B, Q4около 38–42 ГБда, впритыкДлинный контекст сначала съедает KV, а не веса
70B, FP8около 70 ГБнетSpark на 128 ГБ или облачный GPU на 80 ГБ
около 100B, Q4около 55 ГБу заявленного потолкаПочти нет бюджета на KV. Не ежедневная модель
405B в рабочей точностидалеко за 64 ГБнетКластер или облако, не эта машина

Дообучение ест память быстрее инференса. QLoRA от 8B до 14B — комфортный диапазон. QLoRA на 32B возможен с очень маленьким батчем. Полное дообучение 70B или адаптер высокого ранга в 64 ГБ не входят. Когда NVIDIA включает дообучение в нагрузки 64 ГБ, речь о моделях, которые уже помещаются, а не о том, что 70B можно учить как угодно.

Сначала посчитайте веса

Возьмите модель, которую действительно хотите держать в памяти, и посчитайте её в Q4 и в FP8. Если выходит 20–45 ГБ, эта машина в разговоре. Восемь гигабайт или 70B в FP8 переносят вас в другой столбец таблицы затрат.

Скорость генерации сначала упирается в шину

При батче 1 каждый новый токен примерно один раз читает веса. Потолок — пропускная способность памяти, делённая на размер весов. Это потолок, не бенчмарк: накладные расходы ядра, KV и CPU оставляют реальное число ниже.

  • 8B Q4, около 5 ГБ — 273 ÷ 5 ≈ 55 токенов/с запаса по шине
  • 32B Q4, около 18 ГБ — 273 ÷ 18 ≈ 15 токенов/с
  • 70B Q4, около 40 ГБ — 273 ÷ 40 ≈ 6,8 токена/с

Та же прикидка на H100 SXM около 3,35 ТБ/с ставит 40 ГБ весов рядом с потолком около 80 токенов/с. У 4090 шина около 1 ТБ/с, но 24 ГБ не держат 70B Q4. В этом зазоре и стоит Spark: модель больше потребительского GPU, а платить за пропускную способность H100 вы не хотите. Покупается «помещается, и данные остаются здесь», а не «как GPU дата-центра».

Три года: покупка и почасовой счётчик — разные единицы

$4 999 — только первая строка. Электричество здесь заложено как 160 Вт во время генерации и $0,15 за кВт·ч. 160 Вт сидят между TDP 140 Вт и блоком питания 240 Вт. Это планировочное допущение, не измеренная кривая. За 365,25 дня три года — это 4 383 часа при четырёх часах в день, 8 766 часов при восьми и 26 298 часов, если машина не выключается.

Облачные ставки — рабочие цифры с публичного почасового прайса RunPod, как он ещё читался в конце сентября 2026 года, а не пол рынка. RTX 4090 по $0,50/ч лежит между community $0,34 и secure $0,74. L40S по $0,90 — между $0,79 и $1,09. A100 80 ГБ — $1,39, H100 SXM — community $2,69. Хранилище, исходящий трафик и очередь в таблицу не входят. Ставки двигаются каждую неделю. Пересчитайте в день заказа.

Затраты за три года (подставьте свои часы)
# hours: часы реальной генерации за три года
hours = hours_per_day * 365.25 * 3
cloud = hours * hourly_usd
# 0.160 кВт и 0.15 USD/кВт·ч — допущения
spark = 4999 + (0.160 * hours * 0.15)
Режим за три годаSpark 64 ГБ4090 · $0.50L40S · $0.90A100 · $1.39H100 · $2.69
4 часа в день$5,104$2,192$3,945$6,092$11,790
8 часов в день$5,209$4,383$7,889$12,185$23,581
Круглосуточно$5,630$13,149$23,668$36,554$70,742

Если разделить $4 999 на почасовую ставку, грубая граница — около девяти часов в день против 4090, пяти против L40S, 3,3 против A100 и 1,7 против H100. Электричество и то, сколько машина будет стоить через три года, сдвигают линию. Прогноз цены перепродажи мы не ставим: машина остаётся, арендованные часы нет. Если позже её удастся продать за $1 500, утопленные затраты на железо составят $3 499, и граница наступит раньше. Это чувствительность, а не обещанная цена выкупа.

64 ГБ, 128 ГБ и две машины на одном кабеле

Версии на 64 и 128 ГБ делят чип, шину, DGX OS и ConnectX-7. Отличаются объём и накопитель, который в материалах описывают как урезанный вдвое. Лишние $1 951 у модели на 128 ГБ за $6 950 покупают место для 70B в FP8, запас KV у Q4 70B и более крупный батч дообучения. Если ваши веса уже около 55 ГБ, не берите 64 ГБ в надежде, что более жёсткое квантование потом выручит.

Две машины по 64 ГБ соединяются кабелем QSFP без коммутатора. Помощник кластера NVIDIA занимается обнаружением и настройкой ConnectX-7. Пул — 128 ГБ, вычисления и шина примерно удваиваются, старт — $9 998. Рядом с одной системой на 128 ГБ за $6 950 пара меньших машин — не способ сэкономить на памяти. Это способ добавить вторую машину после того, как одна, с 32B–70B Q4, уже оправдала вычисления.

Когда $4 999 — правильная трата

Покупать стоит, когда одновременно верны четыре вещи. Резидентные веса около 20–45 ГБ, и карта на 24 ГБ их не держит. Машина будет включена большую часть рабочих дней, а не несколько ночей в месяц. Данные не могут покинуть комнату. И 70B Q4 в районе однозначных токенов в секунду для работы приемлем. Тогда вы платите за резидентность и границу данных. Три года A100 или H100 оказываются на порядок дороже.

Не покупать тоже можно вполне конкретно. Модель 8B–32B на несколько часов в день за три года дешевле на 4090, и шина там выше. Обучение, высокая параллельность, 70B в FP8 или длинный контекст не укладываются ни в 64 ГБ, ни в 273 ГБ/с. Берите GPU на 80 ГБ по часам или смотрите Spark на 128 ГБ за $6 950. Если софт обязан быть macOS, Xcode или Core ML, машина на Arm под Linux — не та система ещё до цены.

Сначала запишите реальные часы прошлой недели

Сложите часы, когда модель действительно занимала GPU за последние две недели, и умножьте на 26, чтобы получить год. Не заполняйте таблицу фразой «потом, может, будем держать включённой». Раздутые часы толкают трёхлетний лист к машине, которую вы не заполните.

Это не замена Mac

DGX Spark отвечает на задачу CUDA: модель должна остаться локальной и при этом больше потребительского GPU. Среда выполнения Claude Code и Cursor, сборки Xcode, симулятор и Core ML — другая задача. Им нужен настоящий macOS на Apple Silicon, а не GB10. Если принять Spark за $4 999 за более сильный Mac mini, промахнётесь в обе стороны: стек CUDA останется недогружен, а конвейер iOS не начнётся.

Когда тяжёлая работа — ночной CI, индексация репозитория и длинные прогоны агента, выделенный удалённый Mac обычно ближе к делу, чем ещё один настольный GPU. На странице цен ZavCloud месячный ориентир Mac mini M4 на 16 ГБ — около $99,3, ступень 24 ГБ — около $199,3. Тридцать шесть непрерывных месяцев — примерно $3 575 и $7 175, а фиксируется цена в момент заказа. Ни одна из этих ступеней не запускает 70B, и ни одну не стоит сравнивать со Spark по пропускной способности CUDA. К ним относятся заметка покупка Mac mini против Cloud Mac за три года и разбор как делят работу локальный Mac и удалённый macOS. Модель оставьте на Spark или облачном GPU, сборку и подпись — на Mac. Такое разделение чище, чем просить одну машину делать всё.

Вопросы

Пойдёт ли 70B на DGX Spark 64 ГБ?
Q4 — около 40 ГБ, да, с узким бюджетом контекста. FP8 — около 70 ГБ, нет.

Что дешевле за три года?
Если модель влезает в 24 ГБ и нужна несколько часов в день, аренда 4090 обычно дешевле. Если нужно около 40 ГБ почти все рабочие дни, покупка Spark остаётся ниже почасовой A100 или H100. Держать H100 включённой три года — это около семидесяти тысяч долларов. Это уже другой вопрос, не про эту машину.

1 PFLOP значит быстрее GPU дата-центра?
Нет. Это пик FP4. Один поток упирается в 273 ГБ/с, у 70B Q4 запас по шине около 7 токенов/с.

Две машины по 64 ГБ дают дешёвые 128 ГБ?
Не если цель — память. $9 998 против одной системы на 128 ГБ за $6 950 означает, что вы платите за второй комплект вычислений. Вторую машину берите, когда нужны именно они.

Можно ли на ней держать Xcode или Claude Code на macOS?
Нет. Система — DGX OS. Цепочка macOS живёт на Mac или на выделенном удалённом Mac, который берёт сборку и цикл агента.

  • Характеристики и стартовая цена — NVIDIA DGX Spark, 64 ГБ через OEM
  • Цена и дата продаж — Tom's Hardware, октябрь 2026
  • Новая цена 128 ГБ и урезанный накопитель — The Register, 2 октября 2026
  • Почасовые ставки GPU — прайс RunPod; в таблице публичные ступени конца сентября 2026

ZavCloud Cloud Mac

Модель оставьте там, где она влезает. Сборку — на Mac.

Выделенный Mac mini M4, настоящий macOS, по SSH или VNC. Для Xcode, Core ML и агента, которого можно не выключать. Это не CUDA-бокс на 64 ГБ.

Смотреть цены Cloud Mac
Cloud Mac Смотреть цены