Qwen3.8-Omni-Flash: видео, аудио и миллион токенов
Qwen3.8-Omni-Flash появилась в Alibaba Cloud Model Studio. Модель принимает текст, изображения, аудио и видео, но отвечает только текстом. Но голосом она не отвечает: название Omni здесь не означает готового голосового собеседника.
Коротко о чём это
Наводка пришла из Telegram-поста с громкими сравнениями. Я проверил название по документации Alibaba Cloud: ошибки в нём нет, API ID действительно пишется как qwen3.8-omni-flash.
Qwen3.8-Omni-Flash: мультимодальная модель Qwen
Это мультимодальная модель Qwen для анализа аудио и видео, протоколов встреч и разбора контента. Так её описывает Alibaba. Qwen Omni API доступен через Chat Completions и Responses. На вход можно подать запись встречи, ролик или изображение вместе с инструкцией, на выходе получить текстовый ответ.
Контекст модели составляет миллион токенов, аудиовход поддерживает 113 языков и диалектов. Есть Function Calling и веб-поиск. В Responses сейчас доступен только один встроенный инструмент, web_search.
Голос модель не синтезирует. Для речевого ответа документация предлагает Qwen3.5-Omni. Значит, сценарий «загрузил встречу, получил протокол» подходит, а для разговора голосом понадобится другая модель или отдельный синтезатор.
Хотите применить это у себя?
Напишите в двух-трёх предложениях, что у вас за задача. Отвечу, где это применимо, за сколько и что понадобится с вашей стороны.
Почему миллион токенов сам по себе ничего не решает
Большое окно полезно, когда в одной задаче лежат длинная запись, кадры и инструкция. Но оно не проверяет итог. Если модель перепутала говорящих или уверенно поставила неверный таймкод, длинный контекст не превратит ошибку в факт.
В конвейере я бы дал Qwen3.8-Omni-Flash одну работу: разобрать входной материал, вернуть структуру и передать её следующему этапу. У меня генерация и независимая приёмка разделены. Новую модель я бы ставил до проверки человеком, а не вместо неё.
На встречах схема такая: модель готовит черновик тем, решений и поручений, потом отдельный проход сверяет спорные места с записью. Такой процесс скучнее обещания «отчёт одной кнопкой», зато видно, где заканчивается распознавание и начинается интерпретация.
Что это значит для бизнеса и цены API
Модель полезна там, где сотрудники сначала смотрят или слушают материал, а потом вручную переносят результат в таблицу, базу или отчёт. Примеры без фантазии: протокол встречи, описание ролика по времени, извлечение текста с экрана, разметка аудиособытий.
Международный тариф в регионе Singapore составляет 0,15 доллара за миллион входных токенов и 0,47 доллара за миллион выходных токенов. Аудио считается по формуле семь токенов за секунду, запись короче секунды округляется до секунды.
В таблице токен стоит дёшево. Но итоговый бюджет нельзя считать только по длительности файла. В него входят повторные запросы, выходной текст, хранение материалов, проверка и исправление ошибок. Поэтому первый тест должен показать, сколько ручной работы исчезло после проверки результата.
Доступ зависит от региона. Документация перечисляет Beijing, Singapore, Hong Kong, Tokyo, Frankfurt и Virginia, ключ API должен относиться к выбранному региону. Регион лучше проверить до интеграции, иначе демо работает в одном кабинете, а рабочее окружение не принимает тот же ключ.
Где смотреть
Документация Qwen-Omni подтверждает имя модели, входные форматы, текстовый выход, контекст, регионы и способы вызова. Страница обновлена 18 сентября 2026 года.
Официальная таблица цен Alibaba Cloud Model Studio содержит тарифы для международного и китайского развёртывания. Обе страницы я проверил 20 сентября 2026 года.
В исходном Telegram-посте были проценты экономии, сравнение с Gemini и обещание точных таймкодов. Я их не перенёс: в проверенных официальных страницах нет методики, по которой эти заявления можно повторить как факт.
Хотите применить это у себя?
Напишите в двух словах, что нужно. Я задам несколько вопросов и скажу три вещи: реально ли это собрать, за сколько и что понадобится с вашей стороны. Если это не моя задача, скажу прямо.
Москва · 40+ ИИ-агентов в работе · отвечаю в течение часа днём по Москве
Разборы проектов · Услуги и цены · Подобрать решение за 2 минуты