Qwen3.8-Omni-Flash: модель, которая смотрит видео как агент
Alibaba выпустила Qwen3.8-Omni-Flash — омнимодальную модель с контекстом 1M токенов, агентным просмотром видео и ценой $0,15 за миллион входных токенов.

Пятнадцать центов за миллион входных токенов — с такой ценой Alibaba выводит на рынок Qwen3.8-Omni-Flash, свою первую омнимодальную модель, построенную вокруг агентных сценариев. Модель принимает текст, картинки, аудио и видео, отвечает текстом, держит контекст в миллион токенов и, главное, смотрит длинные видео не как плеер, а как исследователь: сама решает, какие фрагменты смотреть и слушать.
Что нового
Ключевая идея релиза — «агентное восприятие». Обычная мультимодальная модель прогоняет двухчасовое видео от начала до конца, даже если ответ спрятан в трёх минутах. Omni-Flash идёт от вопроса: сначала грубо сканирует таймлайн, затем в несколько раундов уточняет, куда смотреть, и тратит токены только на значимые сегменты. По замерам Qwen на OmniVideoBench, точность выросла с 63,4 до 67,8, а расход токенов упал со 145 736 до 79 117 — почти вдвое.
Второй акцент — инструменты. Понять содержание, спланировать задачу, выполнить через вызовы функций, отдать результат — весь цикл живёт в одной модели. В сумме по 29 бенчмаркам Qwen заявляет прирост более 25% к предыдущему поколению Qwen3.5-Omni-Plus, а на агентных мультимодальных тестах — скачки на десятки пунктов.
| Бенчмарк | Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM (мультимодальные инструменты) | 71,0 | 34,5 | 58,9 |
| AgenticVBench (агентное видео) | 36,8 | 14,5 | 45,0 |
| WenetSpeech Meeting, WER ↓ | 4,6 | 4,8 | 16,7 |
| FLEURS-ASR, WER ↓ | 9,3 | 7,2 | 7,9 |
Картина честнее многих релизов: на распознавании речи и мультимодальных инструментах модель обходит Gemini 3.8 Flash, на агентном видео пока уступает. Все цифры — собственные замеры Qwen, независимых пока нет.
Характеристики и цены
Технические лимиты для API выглядят так:
- Контекст: 1M токенов (991K вход / 131K выход, до 262K на рассуждения)
- Видео: до 2 часов и 2 ГБ по ссылке, сэмплирование до 15 fps
- Аудио: до 3 часов, 113 языков и диалектов, стерео и 4-канальный пространственный звук
- Цена: $0,15 / 1M входных токенов, $0,47 / 1M выходных, $0,016 за кеш-хиты
- Регионы: Пекин, Сингапур, Гонконг, Токио, Франкфурт, Вирджиния
Режим мышления включён по умолчанию на максимальном усилии, API совместим с OpenAI-протоколом (Chat Completions и Responses), поддерживает вызов функций, веб-поиск, структурированный вывод и пакетную обработку. Экономика — отдельный аргумент: час аудио на входе подешевел относительно Qwen3.5-Omni-Plus более чем на 98%, аудио-видео — на 93%.
Ложка дёгтя и открытые плагины
Главное разочарование для сообщества: открытых весов нет. База — Qwen3.8-Flash-Next, выложенная в августе под Qwen Community License, — открыта, но сама Omni-Flash доступна только как API. После ста тысяч скачиваний Swift-версии Qwen 3.8 за две недели ожидания были другими, и в комментариях это припоминают.
Компенсация — открытый инструментарий. Qwen-MM-Plugins под Apache 2.0 превращает любой агентный харнесс в мультимодальный: плагин omni-memory строит аудиовизуальную память длинного видео, omni-video2note конвертирует видеоурок в иллюстрированный PDF, omni-chatcut собирает клипы, комментарии к фильмам и перевод видео с сохранением голоса спикера. Установщик поддерживает Claude Code, Codex, Gemini CLI, Qwen Code и другие оболочки.
Кому это нужно
Прицел релиза очевиден: длинное видео и звук как рабочий материал для агентов — расшифровки совещаний, монтаж, саммари лекций, перевод контента. До сих пор это была территория Gemini; теперь у неё появился конкурент по цене в разы ниже и с открытой обвязкой. Для Alibaba это продолжение линии, которую мы наблюдаем весь сентябрь — от Qwen-эмбеддингов в поиске Federal Register до сегодняшнего релиза: не просто догонять фронтир, а окапываться там, где считают деньги.


