Qwen3.8-Omni-Flash: видео, аудио и миллион токенов

Qwen3.8-Omni-Flash появилась в Alibaba Cloud Model Studio. Модель принимает текст, изображения, аудио и видео, но отвечает только текстом. Но голосом она не отвечает: название Omni здесь не означает готового голосового собеседника.

3 минуты чтенияQwen3.8-Omni-Flash · мультимодальная модель Qwen · Qwen Omni API

Коротко о чём это

Наводка пришла из Telegram-поста с громкими сравнениями. Я проверил название по документации Alibaba Cloud: ошибки в нём нет, API ID действительно пишется как qwen3.8-omni-flash.

Qwen3.8-Omni-Flash: мультимодальная модель Qwen

Это мультимодальная модель Qwen для анализа аудио и видео, протоколов встреч и разбора контента. Так её описывает Alibaba. Qwen Omni API доступен через Chat Completions и Responses. На вход можно подать запись встречи, ролик или изображение вместе с инструкцией, на выходе получить текстовый ответ.

Контекст модели составляет миллион токенов, аудиовход поддерживает 113 языков и диалектов. Есть Function Calling и веб-поиск. В Responses сейчас доступен только один встроенный инструмент, web_search.

Голос модель не синтезирует. Для речевого ответа документация предлагает Qwen3.5-Omni. Значит, сценарий «загрузил встречу, получил протокол» подходит, а для разговора голосом понадобится другая модель или отдельный синтезатор.

Хотите применить это у себя?

Напишите в двух-трёх предложениях, что у вас за задача. Отвечу, где это применимо, за сколько и что понадобится с вашей стороны.

Отвечу лично. Без рассылки и обязательного созвона. Можно начать с обезличенных данных.

Почему миллион токенов сам по себе ничего не решает

Большое окно полезно, когда в одной задаче лежат длинная запись, кадры и инструкция. Но оно не проверяет итог. Если модель перепутала говорящих или уверенно поставила неверный таймкод, длинный контекст не превратит ошибку в факт.

В конвейере я бы дал Qwen3.8-Omni-Flash одну работу: разобрать входной материал, вернуть структуру и передать её следующему этапу. У меня генерация и независимая приёмка разделены. Новую модель я бы ставил до проверки человеком, а не вместо неё.

На встречах схема такая: модель готовит черновик тем, решений и поручений, потом отдельный проход сверяет спорные места с записью. Такой процесс скучнее обещания «отчёт одной кнопкой», зато видно, где заканчивается распознавание и начинается интерпретация.

Что это значит для бизнеса и цены API

Модель полезна там, где сотрудники сначала смотрят или слушают материал, а потом вручную переносят результат в таблицу, базу или отчёт. Примеры без фантазии: протокол встречи, описание ролика по времени, извлечение текста с экрана, разметка аудиособытий.

Международный тариф в регионе Singapore составляет 0,15 доллара за миллион входных токенов и 0,47 доллара за миллион выходных токенов. Аудио считается по формуле семь токенов за секунду, запись короче секунды округляется до секунды.

В таблице токен стоит дёшево. Но итоговый бюджет нельзя считать только по длительности файла. В него входят повторные запросы, выходной текст, хранение материалов, проверка и исправление ошибок. Поэтому первый тест должен показать, сколько ручной работы исчезло после проверки результата.

Доступ зависит от региона. Документация перечисляет Beijing, Singapore, Hong Kong, Tokyo, Frankfurt и Virginia, ключ API должен относиться к выбранному региону. Регион лучше проверить до интеграции, иначе демо работает в одном кабинете, а рабочее окружение не принимает тот же ключ.

Где смотреть

Документация Qwen-Omni подтверждает имя модели, входные форматы, текстовый выход, контекст, регионы и способы вызова. Страница обновлена 18 сентября 2026 года.

Официальная таблица цен Alibaba Cloud Model Studio содержит тарифы для международного и китайского развёртывания. Обе страницы я проверил 20 сентября 2026 года.

В исходном Telegram-посте были проценты экономии, сравнение с Gemini и обещание точных таймкодов. Я их не перенёс: в проверенных официальных страницах нет методики, по которой эти заявления можно повторить как факт.

Хотите применить это у себя?

Напишите в двух словах, что нужно. Я задам несколько вопросов и скажу три вещи: реально ли это собрать, за сколько и что понадобится с вашей стороны. Если это не моя задача, скажу прямо.

Москва · 40+ ИИ-агентов в работе · отвечаю в течение часа днём по Москве