GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
локальные-моделиинференсqwenopen-sourceжелезо

Почему все говорят о Strata: эпоха переобученных движков

Движок Strata запускает 125B Qwen на обычной видеокарте, а r/LocalLLaMA спорит о «переобученных движках инференса». Разбираем новую философию локального ИИ.

Влад МакаровВлад Макаровпроверил и опубликовал
8 мин чтения
Почему все говорят о Strata: эпоха переобученных движков

«Третий раз узнаю о чём-то новом в этом сабе из поста с жалобами на то, как все об этом говорят». Этот комментарий — лучшее описание недели в r/LocalLLaMA. Пост «Да, боты, мы поняли, Strata хорош, пожалуйста, хватит» собрал 555 апвоутов и 359 комментариев — больше, чем большинство постов о самом Strata. А параллельно в том же сообществе вышел манифест «The Rise of Overfit Inference Engines», который объясняет, почему таких Strata скоро будет много — и почему это главный сдвиг в локальном ИИ со времён llama.cpp.

Что такое Strata

Strata — репозиторий одного разработчика под ником Niko1221 с предельно простым описанием: «запускает Qwen3.8-Flash-Next на обычном ПК». За скромной формулировкой — цифры, которые ещё год назад выглядели бы опечаткой: 125-миллиардная MoE-модель выдаёт около 100 токенов в секунду на RTX 4090, а сам движок рассчитан на карты с 12–24 ГБ видеопамяти — то есть на железо, которое у энтузиастов уже стоит в системнике.

Секрет не в магии, а в отказе от универсальности. Strata не пытается запускать все модели на всём железе — он собран под одну конкретную модель и узкий класс видеокарт. Раскладка памяти, квантование, порядок загрузки экспертов — всё жёстко заточено под архитектуру Qwen3.8-Flash-Next. Отсюда и усталость сообщества: каждый день кто-то открывает для себя Strata заново и бежит делиться бенчмарками, которые сабреддит уже видел десять раз.

Манифест переобученных движков

На этом фоне пост «The Rise of Overfit Inference Engines» (322 апвоута, 201 комментарий) сделал то, что редко удаётся дискуссиям на Reddit, — дал явлению имя и теорию. Тезис такой: классические движки инференса — llama.cpp, vLLM, TensorRT-LLM — оптимизированы вширь: много моделей, много GPU, приемлемая скорость везде. Новая волна движков «переобучена» в хорошем смысле: софт специализируется под одну пару «модель + железо» и выжимает из неё то, что универсальный рантайм не достанет в принципе.

Примеры множатся быстрее, чем их успевают каталогизировать. На 8-гигабайтной RTX 3070 Ti энтузиасты получают 11 токенов в секунду с квантованием IQ3_XXS и 32 — с IQ2_0. Мини-ПК на AMD Strix Halo со 128 ГБ памяти крутит две MoE-модели класса 300B одновременно — 580 токенов в секунду на prefill и до 44 на генерации, причём на кастомной смеси квантований EXL3 (2,05 и 3,05 бита на вес), собранной специально под графическое ядро gfx1151. Это ручная, почти ювелирная работа — и именно её манифест называет будущим по умолчанию.

Самый залайканный комментарий треда (237 очков) формулирует конечную точку: «В будущем локальные модели сами будут собирать оптимизированный движок под любую картошку, на которой ты их запускаешь. Сейчас мы видим инициативы людей — потом это станет дефолтом». Модель, которая читает вывод lscpu и пишет себе собственный рантайм, — это уже не инструмент, а замкнутый цикл: нагрузка и компилятор в одном лице.

Контраргумент: фрагментация

У тезиса есть трезвая оппозиция, и в треде она представлена не хуже. Третий по популярности комментарий напоминает: «Мифического омни-движка, оптимизированного под все платформы, не будет никогда — но я был бы рад ошибиться». Зоопарк железа — NVIDIA, AMD с её ROCm, Apple Silicon, APU вроде Strix Halo — означает, что каждый переобученный движок это ещё и обязательство его поддерживать. Выходит новая версия модели — и вся ручная настройка отправляется в корзину.

Есть и проблема качества, о которой пишут скептики: рекордные цифры достигаются на агрессивных квантованиях, где от модели местами остаётся силуэт. Бенчмарк «токены в секунду» ничего не говорит о том, насколько поумневшая картошка реально полезна в работе. Дискуссия «какой движок под какую карту» на глазах превращается в отдельную исследовательскую дисциплину — со своими холиварами и своей усталостью, что и показал пост про «хватит о Strata».

Что это меняет

Если переобученный инференс станет нормой, конкурентное преимущество сместится. Побеждать будут не лаборатории с лучшими моделями, а команды с лучшим инструментарием профилирования и автоматической сборки движков под конкретное железо. Это прямое продолжение тренда, который мы видели в кейсах iPhone как второй GPU для MacBook и открытых WebGPU-ядер Hugging Face: софтверный слой под моделями сейчас дорожает быстрее самих моделей.

Сентябрь был месяцем релизов — Gemini 4 Argon, Sonnet 5.5, GPT-6.1. Первая неделя октября показала, чем сообщество занимается после того, как модели розданы: учится запускать их дёшево, на своём железе и под своими правилами. Вопрос «может ли оно работать у меня» сменился вопросом «насколько быстро оно может работать именно у меня» — и отвечают на него уже не лаборатории, а одиночки с репозиториями на GitHub.

Похожие новости

Листайте вниз

для загрузки следующей статьи