GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
локальные моделиopensourcelingэффективностьqwen

Ling Tiny 3.0 — уровень GPT-4 в трёх миллиардах параметров

Ling Tiny 3.0 с гибридным sparse-dense вниманием тянет 128K контекста на RTX 4090 при 42 ток/с. r/LocalLLaMA называет её «настольным AGI». Разбираем цифры.

Влад МакаровВлад Макаровпроверил и опубликовал
3 мин чтения
Ling Tiny 3.0 — уровень GPT-4 в трёх миллиардах параметров

Что было бы, если бы GPT-4 образца 2023 года — модель, для которой строили кластеры, — уместился в три миллиарда параметров и заработал на игровой видеокарте? Свежий релиз Ling Tiny 3.0 предлагает не гадать: r/LocalLLaMA обсуждает модель как «взгляд в будущее», а самые восторженные комментаторы уже окрестили её «настольным AGI». Пост собрал 332 апвоута и 104 комментария за первые часы.

Что умеет

Ключевая инженерная находка — гибридное разреженно-плотное внимание (sparse-dense attention): плотные слои отвечают за точность на коротких дистанциях, разреженные тянут длинный контекст без квадратичного взрыва памяти. В итоге на одной RTX 4090 модель обрабатывает контекст в 128 тысяч токенов на скорости 42 токена в секунду — цифры, которые ещё год назад требовали серверной стойки.

ХарактеристикаLing Tiny 3.0
Параметры3B
Контекст128K токенов
Скорость на RTX 409042 ток/с
GSM8K89%
MATH73%

По рассуждению модель выходит на уровень GPT-4: 89% на GSM8K и 73% на MATH. Понятно, что сравнение с флагманом трёхлетней давности — заниженная планка по меркам 2026 года. Но суть релиза не в рекордах, а в цене входа: такой уровень теперь работает офлайн, бесплатно и на железе, которое стоит дешевле годовой подписки на топовые API.

Рядом в топе — Qwengram-0.8B

Показательно, что в том же топе r/LocalLLaMA висит Qwengram-0.8B (353 апвоута): энтузиаст перенёс n-граммные знания из Qwen3.8 Flash-Next в модель на 0,8 миллиарда параметров — фактически вытащил из большой нейросети символьный слой знаний и упаковал его отдельно. Подход гибридный, почти «доисторический» по нейросетевым меркам, и именно поэтому интересный: он показывает, что знания больших моделей поддаются явной, дешёвой экстракции.

Эффективность вместо масштаба

Сложите картину месяца: Ternary Bonsai 2 упаковала 98% качества 27B-модели в 6 гигабайт, пользователи Qwen3.8-27B массово отказываются от платных API, 1B-модель работает бортовым ассистентом водителя — и вот теперь трёхмиллиардная Ling Tiny с воспоминаниями о GPT-4. Сентябрь начинался с анонсов моделей на десятки триллионов параметров, а заканчивается волной релизов меньше 5B, и общественное внимание заметно смещается ко вторым.

Экономика объясняет это лучше романтики: датацентры упираются в энергию и чипы, а миллиард GPU в игровых компьютерах простаивает. Каждый релиз уровня Ling Tiny переносит кусок спроса с облачных API на локальное железо — и если тренд удержится, главным бенефициаром окажется не какая-то из лабораторий, а владельцы обычных видеокарт.

Похожие новости

Листайте вниз

для загрузки следующей статьи