Qwen3.8-Omni-Flash: что умеет новая омни-модель Alibaba
Коротко. 18 сентября 2026 года команда Qwen из Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая в одном запросе принимает текст, картинки, звук и видео. Контекст — миллион токенов, этого хватает, чтобы загрузить часовую запись встречи или длинный ролик целиком, без нарезки на куски. Главный акцент релиза — не «понять, что на видео», а сделать работу: спланировать задачу, вызвать инструменты и выдать результат. Разбираем, что умеет модель и как её попробовать из России.
Что случилось
Omni в названии означает, что звук и видео модель понимает «родными» средствами, а не через отдельный распознаватель речи, который сначала превращает запись в текст. Новая версия построена на архитектуре Qwen3.8-Flash — той же, что лежит в основе быстрой текстовой модели семейства. Предыдущей омни-моделью у Alibaba была Qwen3.5-Omni-Plus, и сравнивают новинку именно с ней.
По данным Alibaba, средний результат на трёх десятках тестов вырос больше чем на 25%. Самый заметный скачок — в агентных задачах с видео и звуком: на WildClawBench-MM плюс 36,5 пункта. На OmniVideoBench, где проверяют понимание роликов, модель набрала 67,8 против 63,4 у предшественницы. Цифры пока только от разработчика — независимых замеров ещё нет.
Что умеет Qwen3.8-Omni-Flash
- Длинные записи целиком. Совещание, лекция, подкаст, обзор на YouTube — модель слушает и смотрит всё сразу, а потом делает конспект, таймкоды или список задач.
- Речь на 113 языках и диалектах. Так заявлено для аудиовхода. Отвечает модель текстом — синтеза речи в этой версии нет.
- Работа с инструментами. Поиск в интернете, вызов функций, структурированный ответ в JSON. Вместе с моделью Alibaba открыла набор плагинов Qwen-MM-Plugins для сборки агентов.
- Рассуждения по умолчанию. Режим размышлений включён сразу и выставлен на максимум.
- Дешевле предшественницы. В API — 0,15 $ за миллион входных токенов и 0,47 $ за миллион выходных. Час аудио, по словам Alibaba, обходится на 98% дешевле, чем в Qwen3.5-Omni-Plus.
Что это меняет на практике
До сих пор разбор видео выглядел так: скачать ролик, отдельно распознать речь, отдельно вытащить кадры, потом склеить всё в запрос к текстовой модели. Омни-модель делает это одним вызовом и видит то, что теряется при расшифровке: интонацию, что показано на слайде в момент фразы, кто кому возражает. Для обычного пользователя это значит конспект созвона или лекции за минуту, для разработчиков — дешёвую основу для агентов, которые монтируют ролики, пишут комментарии к видео и ведут протоколы встреч.
Похожее уже умеет Gemini — как им пользоваться для роликов, мы разбирали в статье «Gemini анализирует видео». Qwen берёт ценой: за те же задачи через API платить придётся в разы меньше. Если вам нужна только расшифровка без анализа, хватит и более простых инструментов — см. гайд «Аудио в текст».
Как попробовать из России
Модель доступна в трёх местах: в веб-интерфейсе Qwen Studio, через API QwenCloud и в Alibaba Cloud Model Studio. Сайт Qwen открывается из России напрямую, но какие модели там дают бесплатно и с какими лимитами, Alibaba меняет регулярно — проверяйте на месте. С оплатой сложнее: платёжные шлюзы Alibaba российские карты не принимают, поэтому API за деньги оформить не выйдет. Скачать модель и запустить у себя тоже нельзя — открытых весов на старте нет.
Честно про Умку: Qwen3.8-Omni-Flash в нашем каталоге пока нет. Из этого поколения у нас работают Qwen3.8 Flash и Qwen3.8 Max — они понимают текст и изображения, но звук и видео так, как омни-версия, не разбирают. Для записей можно пойти в два шага: расшифровать аудио, а затем отдать текст сильной модели на конспект. Про прошлое обновление старшей модели — в статье «Qwen 3.8 Max обновился».
Сколько стоит в Умке
После регистрации дают 60 токенов без карты. Развёрнутый ответ умной модели стоит 33 токена, быстрый — 1 токен, картинка — 35. Пополнение без подписки: 290 ₽ — 725 токенов (около 21 развёрнутого ответа), 690 ₽ — 1 811, 1 490 ₽ — 4 172, 3 900 ₽ — 11 700 токенов. Токены не сгорают.
Вывод
Qwen3.8-Omni-Flash — не самая умная модель Alibaba, но самая «всеядная» и дешёвая в своём классе: часовые записи целиком, звук и картинка в одном контексте, инструменты из коробки. Для конспектов созвонов и разбора видео это сильная и недорогая альтернатива Gemini. Пользователям из России проще всего начать с бесплатного веб-интерфейса Qwen, а за платным доступом к моделям Qwen, Claude и GPT — в агрегатор с оплатой в рублях.
Источники: блог Qwen, MarkTechPost.
Qwen, Claude и GPT — за рубли
Qwen3.8 Flash, Qwen3.8 Max и ещё сотни моделей в одном чате. Без VPN и зарубежных карт.
Открыть Умку → Посмотреть цены