Китайская компания Alibaba представила Qwen3.8-Omni-Flash — нативную мультимодальную модель, обладающую возможностями агента. Ее главная цель — расширить функционал ИИ-агентов для решения практических задач, обеспечив переход от простого понимания мультимодального контента к таким действиям, как планирование задач, использование внешних инструментов и выполнение творческой работы.
Опираясь на универсальные агентные возможности (написание кода, работу с текстом и управление графическим интерфейсом), Qwen3.8-Omni-Flash расширяет сферу применения агентов, работающих с аудио и видео. «Она демонстрирует высокие результаты в таких процессах, как монтаж видео, создание музыкальных клипов, производство и комментирование фильмов, создание аудиовизуальных сводок (саммари) и ведение диалогов в реальном времени», — сообщили в Alibaba.
Qwen3.8-Omni-Flash способна одновременно анализировать аудио, видео, изображения и текст и вызывать инструменты для работы с ними.
Модель поддерживает контекстное окно объемом 1 млн токенов, сохраняя качество обработки текста на уровне специализированных текстовых моделей аналогичного размера и превосходя их по мультимодальным возможностям. Так, Omni-Flash достигла уровня производительности в аудиовизуальной сфере, сопоставимого с Gemini 3.8 Flash, а по общим показателям работы с аудио превзошла эту модель.



