768 ГБ VRAM дешевле одной RTX 6000: сборка на майнинг-картах
Энтузиаст с r/LocalLLaMA собрал риг с 768 ГБ видеопамяти из 12 списанных майнинг-карт CMP 170HX — дешевле одной RTX 6000 Pro. На нём крутятся Kimi K3 и GLM 5.3.

Двенадцать видеокарт, о которых геймеры никогда не слышали, 768 гигабайт видеопамяти — и всё это дешевле, чем одна RTX 6000 Pro с её 96 ГБ. Пользователь r/LocalLLaMA под ником segmond, известный в сообществе своими бюджетными сборками, показал риг, на котором локально крутятся самые тяжёлые открытые модели современности. Пост собрал 819 апвоутов и 331 комментарий — и это тот случай, когда в комментарии пришли не спорить, а конспектировать.
Фото: u/segmond, r/LocalLLaMA
Секрет — в мёртвом майнинге
Основа сборки — 12 карт Nvidia CMP 170HX по 64 ГБ. Это специализированные майнинговые ускорители на серверном чипе GA100 (том самом, что стоял в A100) с быстрой памятью HBM2e, но без видеовыходов: играть на них нельзя, отображать картинку тоже. После того как майнинг эфира умер, эти карты хлынули на вторичный рынок по бросовым ценам — покупать их было особо некому. Некому, кроме энтузиастов локального инференса: для языковых моделей видеовыходы не нужны, а пропускная способность HBM2e и объём памяти — ровно то, что решает.
Свой риг segmond дополнительно соединил оптоволокном со вторым сервером: когда модели не хватает даже 768 ГБ, слои раскидываются между машинами через RPC-режим llama.cpp. Инференс — llama.cpp и vLLM, в зависимости от задачи.
Список того, что автор гоняет на этой связке, звучит как топ-чарт открытых весов: GLM 5.3, DeepSeek V4.1 Flash, Qwen3.8 Flash и гигантская Qwen3.8 на 2,4 триллиона параметров, Kimi K3, MiniMax M3. По оценкам, звучавшим в обсуждении, сборка выдаёт порядка 40 токенов в секунду на моделях класса 400B, а полный бюджет остался в пределах $15 тысяч — на фоне исчезнувших из розницы RTX 5090 по $9000 это выглядит почти неприлично выгодно.
«Жду комментариев про окупаемость. НЕТ»
Отдельное удовольствие — тон поста. Segmond годами выкладывал бюджетные сборки и годами выслушивал одно и то же: API дешевле, электричество разорит, окупится через 52 световых года, пять токенов в секунду — это не инференс. Теперь он заранее отвечает всем скептикам: «НЕТ». И советует не ныть, а караулить возможности на вторичке: «Спрос на компьют будет высоким ещё долго. Возможности появятся — прыгайте на них».
В этой браваде есть рациональное зерно. Аргумент «API дешевле» верен ровно до тех пор, пока вам подходят чужие условия: лимиты, цензура, отправка данных на чужие серверы, тихие нерфы моделей без анонса. Локальный риг с фронтирной открытой моделью — это страховка от всего списка сразу. Не для всех она стоит пятнадцати тысяч долларов и гула двенадцати турбин в гараже, но цена такой страховки, как показывает эта сборка, падает быстрее, чем кто-либо прогнозировал.
Окно возможностей
История с CMP 170HX — уже третья волна «народного компьюта» за год: сначала были стойки на старых Tesla P40, потом DDR5-сборки на серверных платформах, теперь списанные майнинговые ускорители с HBM2e. Каждый раз паттерн один: корпоративное железо устаревает или теряет основное применение, цена обваливается, и сообщество находит ему вторую жизнь.
Параллельно с железом дешевеет и софт: тернарная квантизация уже упаковывает 27B в шесть гигабайт. Два этих тренда движутся навстречу друг другу — и точка, где модель фронтирного класса заработает на железе ценой в подержанный автомобиль, судя по всему, ближе, чем принято думать.

