GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
qwenopen sourceлокальные моделирелизreasoning

Swift-Qwen3.8-27B: минус 58% «мышления» почти без потери качества

UkisAI выпустила Swift-Qwen3.8-27B — файнтюн Qwen3.8-27B, который думает на 58% короче и работает почти вдвое быстрее. Разбираем бенчмарки и подводные камни.

Влад МакаровВлад Макаровпроверил и опубликовал
5 мин чтения
Swift-Qwen3.8-27B: минус 58% «мышления» почти без потери качества

Рассуждающие модели страдают одной дорогой привычкой: найдя правильный ответ, они продолжают его перепроверять. Ещё раз. И ещё раз — на всякий случай. Каждая такая проверка — это токены, секунды и ватты. UkisAI решила лечить именно эту болезнь: её Swift-Qwen3.8-27B — файнтюн Qwen3.8-27B, который тратит на размышления до 58% меньше токенов при потере качества меньше процента на большинстве задач. На r/LocalLLaMA релиз стал главным событием дня — 784 апвоута и три сотни комментариев.

Как это сделано

Подход почти хирургический. Команда выделила в рассуждениях Qwen токены, характерные для «пережёвывания» — повторных проверок и возвратов к уже найденным ответам, — и штрафовала их использование при обучении. Модель не научили думать иначе, её отучили думать по кругу. В Swift также встроен трансфер-компонент из ThinkingCap-Qwen3.6-27B от BottleCap AI. Снаружи всё осталось прежним: стандартный интерфейс Qwen3.8, поддержка текста, изображений и видео, контекст 262 144 токена.

Цифры

UkisAI прогнала базовую модель и Swift по девяти бенчмаркам, по пять запусков на каждый, веса BF16. Ключевые результаты:

БенчмаркQwen3.8-27BSwiftМедианное сокращение токенов
GPQA-Diamond88,4%88,3%−58,3%
MMLU-Pro85,5%85,0%−28,3%
C-Eval90,0%90,6%−19,3%
IFBench73,5%71,8%−50,5%
AIME 202698,7%94,0%−50,2%
HMMT Nov 202599,3%96,0%−45,9%
ERQA67,5%66,3%−54,6%
Terminal-Bench 2.166,7%65,8%−38,7%
LiveCodeBench v676,8%81,6%−45,8%

Заголовочные −58,3% — это медианное сокращение на GPQA-Diamond при падении точности на одну десятую процентного пункта. В сумме по задачам это даёт заявленное почти двукратное ускорение: меньше токенов — быстрее ответ и ниже счёт за инференс.

Честности ради UkisAI не прячет и слабые места. На соревновательной математике потери заметные: AIME 2026 просел с 98,7% до 94,0%, HMMT — с 99,3% до 96,0%. Похоже, часть тех самых «лишних» перепроверок на олимпиадных задачах была не лишней. А эффектный прирост на LiveCodeBench (+4,8 п.п.) сама команда объясняет прозаично: базовая модель упиралась в лимит вывода бенчмарка, и более лаконичный Swift просто перестал обрезаться — это исправление артефакта, а не рост способностей.

Почему это важно именно сейчас

Реакцию комьюнити легко понять из контекста недели. Пока RTX 5090 исчезает из розницы, а цены на GPU улетают в стратосферу, сокращение инференс-компьюта вдвое — это не абстрактная оптимизация, а прямая экономия на железе, которого всё равно не купить. Для локального запуска короткое рассуждение означает ещё и меньше занятой KV-памяти на длинных сессиях — то, что 27B-модель с контекстом 262k может съесть очень быстро.

Есть и более широкий тренд: эффективность рассуждений становится отдельной дисциплиной. DeepSeek выжимает максимум из лёгкой V4.1 Flash, UkisAI режет overthinking у Qwen — открытая экосистема конкурирует уже не размером моделей, а стоимостью каждого полезного токена. Веса Swift доступны на Hugging Face, включая GGUF-квантизации, конфигурации для vLLM и SGLang опубликованы. Проверить заявленные проценты на своих задачах можно уже сегодня — и, судя по первым репортам в треде с замерами 1,8–2,1× на пользовательских бенчмарках, цифры близки к правде.

Похожие новости

Листайте вниз

для загрузки следующей статьи