GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
kimimoonshotopen-weightsлокальные-моделиllama.cpp

Kimi K3 ужали до 594 ГБ — и уже запускают дома

Сообщество сжало 2,8-триллионную Kimi K3 с 1,56 ТБ до 594 ГБ в GGUF-квантах. Первые результаты на домашнем железе — около 4 токенов в секунду.

Влад МакаровВлад Макаровпроверил и опубликовал
4 мин чтения
Kimi K3 ужали до 594 ГБ — и уже запускают дома

Четыре дня — столько прошло между публикацией весов Kimi K3 и первыми скриншотами модели, работающей на домашнем сервере. Для самой большой открытой модели в истории это рекордно короткая дистанция.

Напомним контекст: Moonshot выложила полные веса 2,8-триллионной K3 в ночь на 27 июля, и в родном формате MXFP4 они занимают около 1,56 ТБ. Официальные требования звучат как прайс дата-центра: порядка 1,4 ТБ быстрой памяти и 64+ ускорителей, а локальный контекст на старте ограничен 131 тысячей токенов вместо миллиона в облаке.

Сообщество ответило привычным способом. Команда Unsloth выложила на Hugging Face набор динамических GGUF-квантов — от Q8 до агрессивных однобитных UD-IQ1_S, где самые чувствительные слои сохраняют повышенную точность, а остальное сжимается до предела. Именно так 1,56 ТБ превратились в 594 ГБ — размер, который уже помещается в RAM серьёзной рабочей станции с 768 ГБ памяти. Поддержку архитектуры в llama.cpp принесли отдельным пулл-реквестом, которым первые экспериментаторы и пользовались ещё до официального мержа.

Результаты пока скромные. Автор нашумевшего треда на r/LocalLLaMA получил на своём домашнем стенде около 4 токенов в секунду — это скорость вдумчивой переписки, а не работы: ответ с длинной цепочкой рассуждений может занять десятки минут, тем более что K3 работает только в режиме мышления. Для сравнения, полноценная нода из восьми B300 выдаёт на этой модели чуть больше сотни токенов в секунду. Комментаторы разделились на тех, кто считает происходящее бессмысленным флексом, и тех, кто напоминает, что два года назад точно так же выглядели первые локальные запуски 70-миллиардных моделей, ставшие сегодня рутиной.

Практический смысл у упражнения всё же есть. Однобитный квант — это способ убедиться, что модель в принципе заводится на вашей инфраструктуре, прежде чем арендовать дорогие ускорители. А главное — веса и кванты уже разошлись по тысячам дисков, и никакое изменение лицензии или политики Moonshot, о рисках которой мы писали после релиза весов, этого не отменит.

Похожие новости

Листайте вниз

для загрузки следующей статьи