
Alibaba выпустила Qwen3.8-Omni-Flash — мультимодальную нейросеть с контекстом 1 млн токенов. Модель поддерживает 113 языков, пространственный звук и создание сложных AI-агентов.
Компания Alibaba Cloud представила обновление своей линейки нейросетей — модель Qwen3.8-Omni-Flash. Этот релиз знаменует собой качественный переход к полноценной мультимодальности, где алгоритмы способны бесшовно обрабатывать текст, изображения, аудио и видео в рамках единой системы. Главной особенностью новинки стало расширение контекстного окна до 1 миллиона токенов, что позволяет нейросети анализировать огромные массивы данных, включая полнометражные фильмы и многочасовые записи, без потери логической связности.
Увеличение контекстного окна до 1 миллиона токенов ставит Qwen3.8-Omni-Flash в один ряд с лидерами рынка ИИ-решений. Такая емкость позволяет модели удерживать в «краткосрочной памяти» не только тысячи страниц текста, но и сложные мультимедийные объекты. Для бизнеса и исследователей это означает возможность загружать целые архивы документации или объемные видеофайлы для глубокого анализа, поиска конкретных фрагментов или суммаризации контента.
В отличие от предыдущих итераций, версия Flash оптимизирована для быстрой обработки входящей информации. Это критически важно при работе с длинным контекстом, где задержки (latency) часто становятся узким местом. Согласно опубликованным тестам, Qwen3.8-Omni-Flash демонстрирует значительный прирост производительности по сравнению с Qwen3.5-Omni-Plus, особенно в задачах, требующих анализа длинных последовательностей данных.
Одной из ключевых инноваций в Qwen3.8-Omni-Flash стала работа со звуковым сопровождением. Если большинство мультимодальных моделей воспринимают видеоряд как последовательность кадров, то новая разработка Alibaba глубоко интегрирует аудиоанализ. Модель способна:
Такой подход делает модель незаменимым инструментом для автоматического субтитрования, перевода сложного аудиовизуального контента и создания систем мониторинга, которые учитывают не только визуальную составляющую, но и звуковую среду.
Qwen3.8-Omni-Flash не ограничивается ролью пассивного анализатора. Модель поддерживает полноценный режим рассуждений (reasoning) и функцию вызова внешних инструментов (tool use). Благодаря поддержке веб-поиска, нейросеть может верифицировать полученную из видео или аудио информацию в режиме реального времени.
Эти характеристики делают модель идеальным фундаментом для создания автономных мультимодальных агентов. Такие системы могут не просто «просматривать» записи, но и выполнять на их основе конкретные действия: например, составлять отчеты, проверять факты через интернет или взаимодействовать со сторонним программным обеспечением. Разработчикам уже доступны инструменты для интеграции через API и тестирования возможностей модели в демо-режиме.
Ознакомиться с техническими подробностями можно в официальном блоге проекта. Для тестирования функционала доступно демо, а документация по работе с API размещена на портале Alibaba Cloud.
Бесплатные промпты для нейросетей на русском, новости ИИ и уроки по генерации фото, видео и текста, доступные на всех площадках.