GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
qwenlocal llmopen sourceapiлокальные модели

«Я отписался от API»: переломный момент Qwen 3.8 27B

Пост «Qwen-3.8-27B is good enough that I stopped using API» собрал 525 апвоутов в r/LocalLLaMA. Разбираем железо, экономику и последствия для API-гигантов.

Влад МакаровВлад Макаровпроверил и опубликовал
7 мин чтения
«Я отписался от API»: переломный момент Qwen 3.8 27B

Заголовки в r/LocalLLaMA редко звучат как заявление об уходе. Но 24 сентября сабреддит вынес в топ именно такое: «Qwen-3.8-27B is good enough that I stopped using API» — 525 апвоутов и 231 комментарий. Автор не хвастается бенчмарками и не показывает график: он просто констатирует, что локальная модель на 27 миллиардов параметров закрыла его повседневные задачи, и платить за облачные токены стало незачем. В тот же день на том же сабреддите вторая волна — пост «Qwen 3.8 27b be like...» набрал ещё 294 апвоута и 116 комментариев. Когда одна и та же мысль дважды за сутки выходит в топ самого прагматичного AI-сообщества, это уже не частное мнение, а симптом.

Что произошло

Формально — ничего. Qwen 3.8 27B вышла ещё в середине августа: плотная мультимодальная модель под Apache 2.0, с нативным контекстом 262 тысячи токенов и встроенной MTP-головой для спекулятивного декодирования. Никакого нового релиза 24 сентября не было. Произошло другое: за шесть недель модель прошла путь от «интересно, надо потестить» до «я отменил подписки» — и сентябрьские треды фиксируют именно этот перелом в поведении, а не в технологиях.

Симптомы копились всю осень. В соседнем r/LocalLLM пользователь показал, как та же модель живёт на одной RTX 5090: 22 ГБ видеопамяти, 175 тысяч токенов контекста — и в комментариях кто-то буднично признаётся, что отменил все платные подписки, оставив только платформу DeepSeek. В треде «Qwen 3.8 27B is a game changer» формулировка ещё прямее: модель «настолько же способна, как фронтирные модели годичной давности», и впервые в сообществе всерьёз обсуждают покупку собственного железа вместо продления подписок. Автор 30-дневного марафона на Unsloth-квантизации отчитался, что гонял модель на связке RTX 5070 Ti и 4070 Super в ежедневных задачах кодинга и даже в продакшн-сервисах — со средней скоростью генерации около 74 токенов в секунду.

Агрегатор reddit-ai-trends, отслеживающий сабреддиты, в отчёте за 25 сентября называет вещи своими именами: тренд номер один в локальных сообществах — «отказ от платных API в пользу Qwen-3.8-27B», а сам момент — «переломная точка для децентрализованного ИИ».

Почему именно 27B и почему именно сейчас

Сентябрьский перелом — это не одна модель, а сошедшиеся вместе три процесса.

Первый — сама модель попала в «золотой размер». 27 миллиардов плотных параметров — это ровно столько, сколько влезает в потребительскую видеокарту с 24 ГБ памяти в 4-битной квантизации, с запасом под контекст. В обсуждении на Hacker News это сформулировали коротко: 27B dense — «сладкая точка», модель «бьёт сильно выше своего веса, особенно в коде». Прошлые поколения заставляли выбирать: либо 7–8B, которые быстро упирались в потолок качества, либо 70B+, требующие серверного железа. Qwen 3.8 27B первой сделала компромисс незаметным.

Второй процесс — экосистема оптимизаций, которая за полтора месяца превратила хорошую модель в быструю. Комьюнити-тюнинг разогнал RTX 3090 с базовых 40 токенов в секунду до 114, а в батч-режиме — до тысячи. Файнтюн Swift-Qwen3.8-27B срезал 58% лишних рассуждений почти без потери качества, а тернарная Bonsai 2 упаковала все 27 миллиардов параметров в 6 гигабайт — и открыла дорогу ноутбукам с 16 ГБ памяти. Каждая из этих работ по отдельности — инкремент; вместе они означают, что порог входа в «локальный Qwen» упал от специализированной сборки до почти любого современного компьютера.

Вот как выглядит реальное железо из сентябрьских тредов:

ЖелезоПамятьСкорость (замеры пользователей)Контекст
RTX 3090 (~$700 на вторичке)24 ГБ40 т/с базово, до 114 т/с с тюнингомдо 262K
RTX 509032 ГБ22 ГБ занято, быстрый инференс175K
RTX 5070 Ti + 4070 Super16+12 ГБ~74 т/с в 30-дневном прогонерабочий кодинг
RTX 3060 (3bpw GSQ-квант)12 ГБ29 т/с почти на полном контексте~55K на задачу
Mac mini M4 Pro64 ГБ общейQ8 + зрение «комфортно»128K+

Третий процесс — качественный: у открытых моделей радикально сжался лаг до фронтира. Мы разбирали это в материале про четырёхмесячный разрыв между открытыми и закрытыми моделями: то, что год назад было эксклюзивом подписки за $200, сегодня приходит в открытых весах через несколько месяцев. Qwen 3.8 27B — первый случай, когда этот сжавшийся лаг физически поместился в бытовую видеокарту.

Экономика отписки

Арифметика, которая гонит людей из облака, проста до неприличия. Подписка на фронтирный ассистент стоит от $20 до $200 в месяц, а активное агентное использование по API легко выходит за сотни долларов — свежий вирусный пример с $2000 токенов на воссоздание Photoshop сообщество обсуждало в тот же день, что и отписку от API. Подержанная RTX 3090 стоит порядка $700 — то есть от трёх месяцев до года облачных расходов, — а дальше остаётся только электричество.

Но деньги — лишь половина мотивации. В тредах повторяются аргументы, которые не сводятся к цене: локальная модель не отправляет код и документы на чужие серверы, не имеет рейт-лимитов и квот, не деградирует после тихих обновлений провайдера и не исчезнет с депрекацией API. Автор исходного поста отдельно отмечает надёжный вызов инструментов — то, что у облачных посредников с их прокси-слоями регулярно ломается. Для человека, который строит на модели ежедневный рабочий процесс, предсказуемость оказывается ценнее последних процентов качества.

Кому всё ещё нужен фронтир

Справедливости ради, тред на 231 комментарий — это не хор согласных. Скептики приводят три весомых контраргумента, и от них не отмахнуться.

Во-первых, «уровень фронтира годичной давности» — это всё-таки не уровень сегодняшнего фронтира. Для сложных многочасовых агентных задач, глубокого ресёрча и работы с огромными кодовыми базами Opus 5.5 и GPT-6 остаются вне конкуренции — и тот самый 30-дневный отчёт честно фиксирует у локальной модели зацикливание инструментов и прожорливые рассуждения. Во-вторых, время: настройка llama.cpp, подбор квантизации и тюнинг флагов — это часы, которые у подписки уже включены в цену. Как сформулировал один из комментаторов на Hacker News, если хочешь просто лучшую доступную модель и не имеешь жёстких требований к приватности, оправдать локальный инференс по-прежнему трудно. В-третьих, качество квантизаций гуляет: на прошлой неделе сабреддит разбирался, как два формально одинаковых 3-битных кванта одной модели дают радикально разные результаты на реальных задачах.

Но показательно, где теперь проходит линия спора. Ещё год назад дискуссия звучала как «локальные модели — игрушка или нет». Сегодня — «какие именно задачи ещё требуют облака». Это разные споры, и второй для API-бизнеса гораздо неприятнее.

Что это значит для OpenAI и Anthropic

Прямой отток энтузиастов r/LocalLLaMA облачные гиганты переживут — это капля в их выручке. Опасность в другом: энтузиасты исторически оказываются на полгода-год впереди корпоративных пайплайнов. Если 27B-модель под Apache 2.0 закрывает «повседневный» слой задач — суммаризацию, рутинный кодинг, извлечение данных, внутренние боты, — то именно этот слой первым уйдёт из облачных счетов компаний: не по идейным причинам, а потому что финдиректор умеет умножать цену токена на объём.

Фронтирным лабораториям остаётся то, что действительно нельзя запустить дома: самые сложные рассуждения, длинные автономные агенты, мультимодальность промышленного масштаба. Это по-прежнему огромный рынок, но он сужается сверху — каждым открытым релизом. И реагировать придётся ценой: не случайно GPT-6 Sol вышла вдвое дешевле предшественницы, а Opus 5.5 Anthropic позиционирует через стоимость, а не только через качество. Когда нижняя планка «достаточно хорошего» стоит ноль долларов в месяц, премия за облако должна каждый месяц заново доказывать, за что она берётся.

Переломные моменты редко выглядят как события — чаще как смена интонации. 24 сентября 2026 года r/LocalLLaMA сменил интонацию: с «смотрите, что умеет локальная модель» на «я отписался, и мне нормально». Проверить, насколько это касается вас, стоит до продления следующей подписки — веса открыты, а видеокарта, возможно, уже стоит в вашем компьютере.

Похожие новости

Листайте вниз

для загрузки следующей статьи