27 миллиардов параметров в 6 гигабайтах: разбор Bonsai 2
PrismML выпустила Ternary Bonsai 2 27B — тернарную версию Qwen3.8 27B в 5,93 ГБ с 98,2% качества оригинала. Разбираем, как это работает и где подвох.

5,93 гигабайта. Столько занимает языковая модель на 27 миллиардов параметров, которую PrismML выложила на Hugging Face под лицензией Apache 2.0. Оригинал — Qwen3.8 27B в FP16 — весит 53,8 ГБ, то есть Bonsai 2 в девять раз меньше. При этом, по замерам самой PrismML на двадцати бенчмарках, модель сохраняет 98,2% качества родителя. Пост о релизе стал самым горячим на r/LocalLLaMA за сутки — почти 1300 апвоутов, а в комментариях уже подтверждают: 27B теперь реально запускается на видеокарте с 16 ГБ и даже в браузере через WebGPU.
Как 27B влезли в шесть гигабайт
Секрет в тернарных весах: каждый параметр принимает одно из трёх значений — −1, 0 или +1. Информационно это примерно 1,585 бита на вес. Группа из 128 весов делит один общий масштабный коэффициент в FP16, что добавляет ещё 0,125 бита. В плотной упаковке PTQ1_0 получается 1,76 бита на вес — против 16 бит у оригинала. Есть и вторая упаковка, PQ2_0: каждый вес хранится в двухбитном слоте, файл растёт до 7,25 ГБ, зато распаковка дешевле.
Перед квантизацией PrismML поворачивает веса блочным преобразованием Адамара (блок 1024) — идею компания позаимствовала у SpinQuant. Поворот размазывает выбросы по всем позициям вектора, и тернарная сетка теряет меньше информации. В высокой точности остаются только рекуррентный путь состояния и нормализация — 26,2 миллиона параметров, меньше одной десятой процента.
Сама архитектура не тронута: тот же гибрид из 75% линейного и 25% полного внимания, тот же контекст 262K токенов, та же башня зрения на 0,47B (в GGUF она лежит отдельным файлом на 0,63 ГБ и грузится только при работе с картинками).
Цифры, которые впечатляют
Главный аргумент PrismML — сравнение не с оригиналом, а с обычной квантизацией. Классический двухбитный IQ2_XXS из той же Qwen3.8 27B весит 7,3 ГБ и в среднем набирает 75,2 балла. Bonsai 2 при меньшем размере — 83,9. На AIME26 разрыв драматичный: 95,83 против 78,6. На LiveCodeBench v6 — 90,07 против 70,05.
| Категория | Qwen3.8 27B (FP16) | Bonsai 2 | Сохранено |
|---|---|---|---|
| Знания и рассуждения | 86,66 | 83,95 | 96,9% |
| Математика | 97,06 | 96,57 | 99,5% |
| Кодинг | 82,17 | 81,58 | 99,3% |
| Агентные задачи и инструменты | 79,74 | 77,57 | 97,3% |
| Следование инструкциям | 81,25 | 82,66 | 101,7% |
| Зрение | 81,64 | 78,59 | 96,3% |
| Среднее по 20 тестам | 85,4 | 83,9 | 98,2% |
Скорость тоже на месте: 142,5 токена в секунду на RTX 5090, 96,7 на RTX 4090, 46,8 на MacBook с M5 Max. Энергоэффективность — 0,582 мВт·ч на токен на RTX 5090; PrismML утверждает, что это на 40% экономичнее, чем полноразмерная 8B-модель в FP16.
Где подвох
Он есть, и PrismML его не прячет. Средние 98,2% скрывают неравномерность потерь: длинные агентные сессии проседают заметно сильнее. На Terminal-Bench 2.1 Bonsai 2 набирает 52,8 против 69,7 у оригинала, на SWE-Bench Verified — 60,8 против 80,6. Это примерно 75% сохранения, и оба теста не входят в «среднее по двадцати». Для локального чата, математики и разовых задач кодинга модель почти неотличима от FP16-версии, но полноценного автономного агента на ней строить рано.
Второй нюанс — экосистема. Стандартный llama.cpp файлы PTQ1_0 и PQ2_0 не понимает: нужен форк PrismML или их MLX-раннер для Mac. И третье: все цифры пока измерены самой PrismML, независимых воспроизведений нет. На Hacker News уже спрашивают, в чём «секретный соус» — компания не публикует метод назначения тернарных значений, только формат хранения.
Что это значит
Два месяца назад первая тернарная Bonsai 27B сохраняла около 95% качества — и это выглядело как любопытный эксперимент. 98,2% — уже другая категория: разница с оригиналом меньше, чем типичный разброс между прогонами бенчмарка. Если цифры подтвердятся независимыми замерами, тернарная квантизация из академической идеи (вспомним BitNet от Microsoft) превращается в практический стандарт дистрибуции открытых моделей: одни и те же веса — от H100 до ноутбука и браузера.
Для локального инференса это самый значимый сдвиг за год: модель уровня 27B в 5,93 ГБ оставляет на 16-гигабайтном ноутбуке ещё 10 ГБ под контекст и рантайм. А для всей индустрии — намёк, что «эффективные биты» становятся такой же осью прогресса, как параметры и данные.


