GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
qwenlocal llmэффективностьдистилляция

Как Qwen 27B обгоняет модель с триллионом параметров

Qwen 27B работает лучше, чем GPT-4o с триллионом параметров. Разбираем, почему размер перестал решать: RL, дистилляция, чистые данные и агентные траектории.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
Как Qwen 27B обгоняет модель с триллионом параметров

«Как вообще возможно, что Qwen 27B настолько хорош, если у GPT-4o был триллион параметров — и он был хуже?» Этот вопрос, заданный в r/LocalLLaMA, собрал за сутки 1276 апвоутов и 343 комментария — и стал, пожалуй, лучшей иллюстрацией того, куда сдвинулась индустрия за два года. Модель, которая помещается в память игрового ноутбука, уверенно обходит флагмана OpenAI образца 2024-го, превосходившего её по числу параметров примерно в сорок раз.

Размер больше не главное

Ответ сообщества на заглавный вопрос оказался на удивление консенсусным, и сенсации в нём нет. Разрыв объясняется не магией, а методологией: современное обучение с подкреплением, качественная дистилляция из старшей Qwen 3.8 Max, куда более чистые размеченные данные и — это сравнительно новое — обучение на агентных траекториях, то есть на реальных цепочках действий моделей, решающих задачи, а не только на статичном тексте.

GPT-4o обучалась в эпоху, когда рецепт был прост: больше данных, больше параметров, больше компьюта. С тех пор выяснилось, что триллион параметров, обученных на сыром интернете, проигрывает 27 миллиардам, обученным на тщательно отобранном материале с умным RL поверх. Один из комментаторов сформулировал это ещё жёстче: «Ling 3.0 tiny запускается практически на любом ноутбуке и легко бьёт 4o».

К треду приложен прогноз разработчика Ахмада Османа, который разошёлся по всем ИИ-сообществам: интеллект уровня Opus 5.5 будет работать «на ноутбуке вашей бабушки» к концу 2028 года. Два года назад такое сочли бы троллингом. Сегодня — спорным, но рабочим прогнозом: траектория сжатия интеллекта пока его подтверждает.

Эффективность становится трендом недели

Тред про Qwen — не единичный всплеск, а часть волны. В тот же день сообщество обсуждало ещё три релиза, бьющих в ту же точку.

Маленькая команда выпустила Agens Volundr 32B — модель на собственной гибридной архитектуре, где KV-кеш хранят только 18 слоёв из 72, а остальные работают на рекуррентных состояниях. Для длинного контекста это означает кратную экономию памяти — главного дефицита локального инференса. Модель вышла под Apache-2.0, и сообщество уже въедливо разбирает механику кеширования префиксов: рекуррентное состояние, в отличие от KV-кеша, нельзя просто нарезать и переиспользовать.

Вышла и llama.cpp v0.6.0 со спекулятивным декодированием через Multi-Token Prediction — техника, ещё недавно жившая только в научных статьях, становится стандартной инфраструктурой домашнего инференса.

А самый наглядный экспонат — Whistle, модель распознавания речи размером 16,9 мегабайта. Не гигабайта. Разработчик уже встроил её в открытую Android-клавиатуру и утверждает, что она быстрее и точнее встроенных вариантов Whisper. С оговоркой: пока только для английского — французский пользователь честно отписался, что на его языке модель «неюзабельна».

Что это меняет

Для пользователей расклад простой. Ещё недавно выбор стоял так: либо мощный облачный ИИ по подписке, либо слабый локальный. Теперь посередине появилась третья опция — локальные модели, догнавшие вчерашние флагманы, на железе, которое у многих уже есть. История с iPhone в роли второй GPU для MacBook, прогремевшая на прошлой неделе, — из той же серии: сообщество выжимает максимум из потребительского железа, потому что модели наконец-то это позволяют.

Для индустрии вывод менее комфортный. Если качество определяется данными и методологией, а не размером, то преимущество закрытых гигантов сужается до скорости итераций. Дистилляция работает в обе стороны: каждый новый флагман почти сразу порождает открытых «учеников», которые умеют 90% того же на 3% параметров. Вопрос «зачем платить за триллион параметров» звучит всё чаще — и ответ на него с каждым месяцем всё менее очевиден.

Похожие новости

Листайте вниз

для загрузки следующей статьи