GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
prismmlqwenквантизациялокальные моделиоткрытые моделирелиз

27 миллиардов параметров в 6 гигабайтах: разбор Bonsai 2

PrismML выпустила Ternary Bonsai 2 27B — тернарную версию Qwen3.8 27B в 5,93 ГБ с 98,2% качества оригинала. Разбираем, как это работает и где подвох.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
27 миллиардов параметров в 6 гигабайтах: разбор Bonsai 2

5,93 гигабайта. Столько занимает языковая модель на 27 миллиардов параметров, которую PrismML выложила на Hugging Face под лицензией Apache 2.0. Оригинал — Qwen3.8 27B в FP16 — весит 53,8 ГБ, то есть Bonsai 2 в девять раз меньше. При этом, по замерам самой PrismML на двадцати бенчмарках, модель сохраняет 98,2% качества родителя. Пост о релизе стал самым горячим на r/LocalLLaMA за сутки — почти 1300 апвоутов, а в комментариях уже подтверждают: 27B теперь реально запускается на видеокарте с 16 ГБ и даже в браузере через WebGPU.

Как 27B влезли в шесть гигабайт

Секрет в тернарных весах: каждый параметр принимает одно из трёх значений — −1, 0 или +1. Информационно это примерно 1,585 бита на вес. Группа из 128 весов делит один общий масштабный коэффициент в FP16, что добавляет ещё 0,125 бита. В плотной упаковке PTQ1_0 получается 1,76 бита на вес — против 16 бит у оригинала. Есть и вторая упаковка, PQ2_0: каждый вес хранится в двухбитном слоте, файл растёт до 7,25 ГБ, зато распаковка дешевле.

Перед квантизацией PrismML поворачивает веса блочным преобразованием Адамара (блок 1024) — идею компания позаимствовала у SpinQuant. Поворот размазывает выбросы по всем позициям вектора, и тернарная сетка теряет меньше информации. В высокой точности остаются только рекуррентный путь состояния и нормализация — 26,2 миллиона параметров, меньше одной десятой процента.

Сама архитектура не тронута: тот же гибрид из 75% линейного и 25% полного внимания, тот же контекст 262K токенов, та же башня зрения на 0,47B (в GGUF она лежит отдельным файлом на 0,63 ГБ и грузится только при работе с картинками).

Цифры, которые впечатляют

Главный аргумент PrismML — сравнение не с оригиналом, а с обычной квантизацией. Классический двухбитный IQ2_XXS из той же Qwen3.8 27B весит 7,3 ГБ и в среднем набирает 75,2 балла. Bonsai 2 при меньшем размере — 83,9. На AIME26 разрыв драматичный: 95,83 против 78,6. На LiveCodeBench v6 — 90,07 против 70,05.

КатегорияQwen3.8 27B (FP16)Bonsai 2Сохранено
Знания и рассуждения86,6683,9596,9%
Математика97,0696,5799,5%
Кодинг82,1781,5899,3%
Агентные задачи и инструменты79,7477,5797,3%
Следование инструкциям81,2582,66101,7%
Зрение81,6478,5996,3%
Среднее по 20 тестам85,483,998,2%

Скорость тоже на месте: 142,5 токена в секунду на RTX 5090, 96,7 на RTX 4090, 46,8 на MacBook с M5 Max. Энергоэффективность — 0,582 мВт·ч на токен на RTX 5090; PrismML утверждает, что это на 40% экономичнее, чем полноразмерная 8B-модель в FP16.

Где подвох

Он есть, и PrismML его не прячет. Средние 98,2% скрывают неравномерность потерь: длинные агентные сессии проседают заметно сильнее. На Terminal-Bench 2.1 Bonsai 2 набирает 52,8 против 69,7 у оригинала, на SWE-Bench Verified — 60,8 против 80,6. Это примерно 75% сохранения, и оба теста не входят в «среднее по двадцати». Для локального чата, математики и разовых задач кодинга модель почти неотличима от FP16-версии, но полноценного автономного агента на ней строить рано.

Второй нюанс — экосистема. Стандартный llama.cpp файлы PTQ1_0 и PQ2_0 не понимает: нужен форк PrismML или их MLX-раннер для Mac. И третье: все цифры пока измерены самой PrismML, независимых воспроизведений нет. На Hacker News уже спрашивают, в чём «секретный соус» — компания не публикует метод назначения тернарных значений, только формат хранения.

Что это значит

Два месяца назад первая тернарная Bonsai 27B сохраняла около 95% качества — и это выглядело как любопытный эксперимент. 98,2% — уже другая категория: разница с оригиналом меньше, чем типичный разброс между прогонами бенчмарка. Если цифры подтвердятся независимыми замерами, тернарная квантизация из академической идеи (вспомним BitNet от Microsoft) превращается в практический стандарт дистрибуции открытых моделей: одни и те же веса — от H100 до ноутбука и браузера.

Для локального инференса это самый значимый сдвиг за год: модель уровня 27B в 5,93 ГБ оставляет на 16-гигабайтном ноутбуке ещё 10 ГБ под контекст и рантайм. А для всей индустрии — намёк, что «эффективные биты» становятся такой же осью прогресса, как параметры и данные.

Похожие новости

Листайте вниз

для загрузки следующей статьи