Alibaba выпустила Qwen 3.8-Omni-Flash для работы с текстом, изображениями, аудио и видео

Alibaba выпустила Qwen 3.8-Omni-Flash для работы с текстом, изображениями, аудио и видео

Модель умеет одновременно анализировать несколько типов данных и рассчитана на создание мультимодальных ИИ-агентов.
Фото аватара
Редакция The GEEK сегодня в 13:46
Alibaba выпустила Qwen 3.8-Omni-Flash для работы с текстом, изображениями, аудио и видео

Alibaba представила Qwen 3.8-Omni-Flash, первую мультимодальную «рассуждающую» модель компании с упором на агентские сценарии.

Модель может одновременно работать с текстом, изображениями, аудио и видео длительностью до одного часа за запрос. Контекстное окно составляет 1 млн токенов.

Qwen 3.8-Omni-Flash также умеет вызывать внешние инструменты. На её базе можно создавать агентов для расшифровки созвонов, распознавания участников разговора, анализа видео, перевода фильмов, добавления субтитров и работы с аудиодорожками.

qwen_

Вместе с моделью Alibaba выпустила набор плагинов Qwen-MM-Plugins для транскрибации, распознавания говорящих и анализа событий в видео. Позже компания планирует открыть Qwen-Live Harness, готовую инфраструктуру для создания мультимодальных агентов.

Qwen 3.8-Omni-Flash уже доступна бесплатно в чат-боте Qwen, а также через QwenCloud и API Alibaba.

По внутренним тестам компании, возможности модели при работе с аудио и видео приблизились к Gemini 3.8 Flash от Google.