Команда Qwen от Alibaba Cloud анонсировала запуск Qwen3.5-Omni, нового поколения мультимодальной модели, способной обрабатывать текст, изображения, аудио и видео. Эта модель генерирует текст и речь в реальном времени и доступна в трех вариантах: Plus, Flash и Light, через Offline API и Realtime API. Одно из ключевых новшеств — увеличение контекстного окна до 256 тысяч токенов, что позволяет обрабатывать более 10 часов аудио или около 400 секунд видео 720p за один запрос. Распознавание речи теперь поддерживает 113 языков и диалектов, а синтез — 36. Архитектура модели включает компоненты Thinker и Talker, которые используют Hybrid-Attention MoE, а обучение проводилось на более чем 100 миллионах часов мультимодальных данных. В тестах версия Plus продемонстрировала лучшие результаты на большинстве аудио- и видео-бенчмарков. Новые функции включают семантическое прерывание, клонирование голоса и динамическое выравнивание текста и речи с помощью ARIA. Интересно, что модель способна генерировать код, наблюдая за видео с инструкциями, что стало неожиданным результатом масштабирования.