Swift-Qwen3.8-27B: минус 58% «мышления» почти без потери качества
UkisAI выпустила Swift-Qwen3.8-27B — файнтюн Qwen3.8-27B, который думает на 58% короче и работает почти вдвое быстрее. Разбираем бенчмарки и подводные камни.

Рассуждающие модели страдают одной дорогой привычкой: найдя правильный ответ, они продолжают его перепроверять. Ещё раз. И ещё раз — на всякий случай. Каждая такая проверка — это токены, секунды и ватты. UkisAI решила лечить именно эту болезнь: её Swift-Qwen3.8-27B — файнтюн Qwen3.8-27B, который тратит на размышления до 58% меньше токенов при потере качества меньше процента на большинстве задач. На r/LocalLLaMA релиз стал главным событием дня — 784 апвоута и три сотни комментариев.
Как это сделано
Подход почти хирургический. Команда выделила в рассуждениях Qwen токены, характерные для «пережёвывания» — повторных проверок и возвратов к уже найденным ответам, — и штрафовала их использование при обучении. Модель не научили думать иначе, её отучили думать по кругу. В Swift также встроен трансфер-компонент из ThinkingCap-Qwen3.6-27B от BottleCap AI. Снаружи всё осталось прежним: стандартный интерфейс Qwen3.8, поддержка текста, изображений и видео, контекст 262 144 токена.
Цифры
UkisAI прогнала базовую модель и Swift по девяти бенчмаркам, по пять запусков на каждый, веса BF16. Ключевые результаты:
| Бенчмарк | Qwen3.8-27B | Swift | Медианное сокращение токенов |
|---|---|---|---|
| GPQA-Diamond | 88,4% | 88,3% | −58,3% |
| MMLU-Pro | 85,5% | 85,0% | −28,3% |
| C-Eval | 90,0% | 90,6% | −19,3% |
| IFBench | 73,5% | 71,8% | −50,5% |
| AIME 2026 | 98,7% | 94,0% | −50,2% |
| HMMT Nov 2025 | 99,3% | 96,0% | −45,9% |
| ERQA | 67,5% | 66,3% | −54,6% |
| Terminal-Bench 2.1 | 66,7% | 65,8% | −38,7% |
| LiveCodeBench v6 | 76,8% | 81,6% | −45,8% |
Заголовочные −58,3% — это медианное сокращение на GPQA-Diamond при падении точности на одну десятую процентного пункта. В сумме по задачам это даёт заявленное почти двукратное ускорение: меньше токенов — быстрее ответ и ниже счёт за инференс.
Честности ради UkisAI не прячет и слабые места. На соревновательной математике потери заметные: AIME 2026 просел с 98,7% до 94,0%, HMMT — с 99,3% до 96,0%. Похоже, часть тех самых «лишних» перепроверок на олимпиадных задачах была не лишней. А эффектный прирост на LiveCodeBench (+4,8 п.п.) сама команда объясняет прозаично: базовая модель упиралась в лимит вывода бенчмарка, и более лаконичный Swift просто перестал обрезаться — это исправление артефакта, а не рост способностей.
Почему это важно именно сейчас
Реакцию комьюнити легко понять из контекста недели. Пока RTX 5090 исчезает из розницы, а цены на GPU улетают в стратосферу, сокращение инференс-компьюта вдвое — это не абстрактная оптимизация, а прямая экономия на железе, которого всё равно не купить. Для локального запуска короткое рассуждение означает ещё и меньше занятой KV-памяти на длинных сессиях — то, что 27B-модель с контекстом 262k может съесть очень быстро.
Есть и более широкий тренд: эффективность рассуждений становится отдельной дисциплиной. DeepSeek выжимает максимум из лёгкой V4.1 Flash, UkisAI режет overthinking у Qwen — открытая экосистема конкурирует уже не размером моделей, а стоимостью каждого полезного токена. Веса Swift доступны на Hugging Face, включая GGUF-квантизации, конфигурации для vLLM и SGLang опубликованы. Проверить заявленные проценты на своих задачах можно уже сегодня — и, судя по первым репортам в треде с замерами 1,8–2,1× на пользовательских бенчмарках, цифры близки к правде.


