Компания Alibaba сделала значительный шаг в сфере искусственного интеллекта, выпустив новую модель Qwen3-Next-80B-A3B. Эта модель обладает впечатляющей мощностью в 80 миллиардов параметров и характеризуется высокой эффективностью. В отличие от своих предшественников, Qwen3-Next-80B-A3B активирует лишь 3 миллиарда параметров на токен, что позволяет ускорить процесс обучения и инференса в десять раз по сравнению с Qwen3-32B. Модель особенно эффективна при работе с текстами длинного формата, начиная с 32 тысяч токенов.

Основой Qwen3-Next-80B-A3B является гибридная архитектура Gated DeltaNet и Gated Attention, что обеспечивает баланс между скоростью и точностью. Дополнительно используется разреженная схема Mixture-of-Experts с 512 экспертами, из которых одновременно активируются только десять, что оптимизирует вычислительные ресурсы.

Модель поддерживает Multi-Token Prediction, что позволяет предсказывать несколько слов сразу, увеличивая скорость генерации текста. В тестах Qwen3-Next-80B-A3B превосходит Qwen3-32B и приближается к уровню Qwen3-235B в задачах анализа длинного контекста. Специализированные версии модели, такие как Qwen3-Next-80B-A3B-Instruct и Qwen3-Next-80B-A3B-Thinking, также показали выдающиеся результаты, обойдя конкурентов.

Qwen3-Next-80B-A3B уже доступна на различных платформах, включая Qwen Chat и Alibaba Cloud.