Большая unified memory
Один адресный пул для CPU и GPU, меньше копирований.
Это не замена серверной GPU и не дорогой мини‑ПК. Это отдельный класс локальной AI‑станции: большой пул памяти, CUDA и быстрый interconnect при компактном энергопакете.
Модель на 70B в 4 битах занимает около 35 ГБ до накладных расходов. На Spark остаётся существенный запас под контекст и параллельные процессы. Модель порядка 200B уже подходит к границе и требует аккуратного формата весов.
273 ГБ/с делают систему memory-bound на больших LLM. Поэтому Spark может вместить модель, но генерировать медленнее мощной дискретной карты с меньшей памятью.
Один адресный пул для CPU и GPU, меньше копирований.
Знакомая экосистема NVIDIA, контейнеры и инструменты разработки.
Быстрый Ethernet для двух и более узлов.
Не каждый закрытый пакет или x86-контейнер имеет сборку.
Ёмкость высокая, bandwidth умеренный для генерации LLM.
После повышения MSRP ценовое преимущество стало слабее.
Spark убедителен, если задача упирается в объём VRAM, требует CUDA и должна оставаться локальной. Если модель помещается в 24–32 ГБ, чаще выгоднее быстрая дискретная GPU. Если CUDA не обязательна, системы с большей unified memory тоже заслуживают расчёта.
Оценка редакции: отличная специализированная станция, слабый универсальный компьютер.