Ling Tiny 3.0 — уровень GPT-4 в трёх миллиардах параметров
Ling Tiny 3.0 с гибридным sparse-dense вниманием тянет 128K контекста на RTX 4090 при 42 ток/с. r/LocalLLaMA называет её «настольным AGI». Разбираем цифры.

Что было бы, если бы GPT-4 образца 2023 года — модель, для которой строили кластеры, — уместился в три миллиарда параметров и заработал на игровой видеокарте? Свежий релиз Ling Tiny 3.0 предлагает не гадать: r/LocalLLaMA обсуждает модель как «взгляд в будущее», а самые восторженные комментаторы уже окрестили её «настольным AGI». Пост собрал 332 апвоута и 104 комментария за первые часы.
Что умеет
Ключевая инженерная находка — гибридное разреженно-плотное внимание (sparse-dense attention): плотные слои отвечают за точность на коротких дистанциях, разреженные тянут длинный контекст без квадратичного взрыва памяти. В итоге на одной RTX 4090 модель обрабатывает контекст в 128 тысяч токенов на скорости 42 токена в секунду — цифры, которые ещё год назад требовали серверной стойки.
| Характеристика | Ling Tiny 3.0 |
|---|---|
| Параметры | 3B |
| Контекст | 128K токенов |
| Скорость на RTX 4090 | 42 ток/с |
| GSM8K | 89% |
| MATH | 73% |
По рассуждению модель выходит на уровень GPT-4: 89% на GSM8K и 73% на MATH. Понятно, что сравнение с флагманом трёхлетней давности — заниженная планка по меркам 2026 года. Но суть релиза не в рекордах, а в цене входа: такой уровень теперь работает офлайн, бесплатно и на железе, которое стоит дешевле годовой подписки на топовые API.
Рядом в топе — Qwengram-0.8B
Показательно, что в том же топе r/LocalLLaMA висит Qwengram-0.8B (353 апвоута): энтузиаст перенёс n-граммные знания из Qwen3.8 Flash-Next в модель на 0,8 миллиарда параметров — фактически вытащил из большой нейросети символьный слой знаний и упаковал его отдельно. Подход гибридный, почти «доисторический» по нейросетевым меркам, и именно поэтому интересный: он показывает, что знания больших моделей поддаются явной, дешёвой экстракции.
Эффективность вместо масштаба
Сложите картину месяца: Ternary Bonsai 2 упаковала 98% качества 27B-модели в 6 гигабайт, пользователи Qwen3.8-27B массово отказываются от платных API, 1B-модель работает бортовым ассистентом водителя — и вот теперь трёхмиллиардная Ling Tiny с воспоминаниями о GPT-4. Сентябрь начинался с анонсов моделей на десятки триллионов параметров, а заканчивается волной релизов меньше 5B, и общественное внимание заметно смещается ко вторым.
Экономика объясняет это лучше романтики: датацентры упираются в энергию и чипы, а миллиард GPU в игровых компьютерах простаивает. Каждый релиз уровня Ling Tiny переносит кусок спроса с облачных API на локальное железо — и если тренд удержится, главным бенефициаром окажется не какая-то из лабораторий, а владельцы обычных видеокарт.


