GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
qwenalibabaгенерация изображенийopen sourceрелиз

Qwen-Image-2.1: 7 млрд параметров против закрытых гигантов

Alibaba выпустила Qwen-Image-2.1 — открытую модель генерации изображений на 7B параметров с прозрачностью, 10 референсами и работой на RTX 3090.

Влад МакаровВлад Макаровпроверил и опубликовал
5 мин чтения
Qwen-Image-2.1: 7 млрд параметров против закрытых гигантов

Пока западные лаборатории держат свои генераторы изображений за API, команда Qwen из Alibaba снова выложила веса в открытый доступ. Qwen-Image-2.1 — модель генерации и редактирования картинок, чей визуальный генератор занимает всего 7 миллиардов параметров, — по заявлению разработчиков, обходит большинство закрытых моделей на их собственном бенчмарке. Тред о релизе стал постом дня на Reddit: почти 1700 апвоутов и 346 комментариев — сообщество локальных моделей давно ждало открытый генератор такого уровня.

Оговорка обязательна: «обходит закрытые модели» — это пока внутренние замеры Qwen. Независимых бенчмарков ещё нет, и The Decoder прямо отмечает, что проверка сторонними тестами впереди. Но даже с этой поправкой релиз выглядит серьёзно — в первую очередь из-за того, что модель умеет делать и на чём она запускается.

Что нового

Главная особенность — нативная работа с прозрачностью. Модель генерирует и редактирует изображения сразу в RGBA: можно вырезать объект на прозрачный слой или поменять текст на нём, не прибегая к отдельным инструментам удаления фона. Для дизайнеров это закрывает целый класс задач, которые раньше требовали связки из двух-трёх моделей.

Вторая крупная функция — до десяти референсных изображений одновременно. Qwen демонстрирует это на групповом портрете, собранном из отдельных фотографий каждого человека, — сценарий, который пригодится и для виртуальной примерки одежды, и для дизайна интерьеров. Локальные правки задаются интуитивно: обвёл область кружком, закрасил маской или пометил штрихом — модель поняла, что менять.

Групповой портрет, собранный Qwen-Image-2.1 из отдельных фотографий людей Фото: The Decoder / Alibaba Qwen

Железо и скорость

Семь миллиардов параметров у визуального генератора — это уровень, который помещается в потребительскую видеокарту. Разработчики называют RTX 3090 достаточной для запуска: карта 2020 года с 24 ГБ VRAM, которую сегодня можно найти на вторичке по цене недорогого ноутбука. Для сравнения: большинство конкурентных открытых генераторов последнего поколения либо заметно тяжелее, либо требуют агрессивной квантизации с потерей качества.

Скорость тоже не забыта. Команда сообщает об изменениях в архитектуре и переиспользовании KV-кеша, которые ускоряют инференс — особенно в сценариях с несколькими референсными изображениями, где старые версии модели ощутимо замедлялись.

Где взять и что с лицензией

Модель доступна на Hugging Face, GitHub и ModelScope, там же работает публичное демо. Но перед тем как встраивать её в продукт, стоит прочитать лицензию: она исследовательская и прямо запрещает коммерческое использование. Бизнесу придётся отдельно обращаться к Qwen за коммерческой лицензией — это важное отличие от прошлых релизов серии, выходивших под более свободными условиями.

Такой ход выглядит как новая стратегия Alibaba: веса открыты, сообщество может изучать и дорабатывать модель, но монетизация остаётся под контролем компании. Для исследователей и энтузиастов это ничего не меняет. Для стартапов, привыкших строить продукты на открытых моделях Qwen, — меняет многое.

Что это значит

Релиз продолжает главный тренд года: китайские лаборатории методично закрывают разрыв с закрытыми западными моделями и выкладывают результат в открытый доступ. Qwen-Image-2.1 бьёт в самое уязвимое место коммерческих генераторов — цену. Если модель на 7B параметров действительно даёт сопоставимое качество на локальной видеокарте, платить за API генерации изображений станет заметно сложнее обосновать.

Осталось дождаться независимых бенчмарков — и посмотреть, как быстро сообщество упакует модель в привычные инструменты вроде ComfyUI.

Похожие новости

Листайте вниз

для загрузки следующей статьи