В последние годы наблюдается рост популярности больших моделей Mixture of Experts (MoE), которые требуют меньше активных параметров. В отличие от Dense моделей, MoE используют ресурсы иначе, позволяя задействовать всего один GPU и больше оперативной памяти. Основная идея заключается в том, что количество параметров MoE превышает число активируемых для генерации токена. Каждый слой MoE включает роутер, который выбирает необходимые эксперты для обработки запросов. Это обеспечивает более эффективное использование ресурсов.
Ускорение работы моделей достигается за счет оптимизации распределения слоев между CPU и GPU. Например, модель GPT-OSS-120B активирует всего 4 эксперта из 128, что значительно снижает потребление ресурсов. Исследования показывают, что при правильной настройке можно добиться увеличения производительности до 80% по сравнению с традиционными моделями.
Сравнивая различные MoE модели, можно увидеть, что эффективность зависит от архитектуры и количества активных параметров. Например, модель Grok2 имеет 270B параметров, но активных всего 115B. Таким образом, переход на MoE открывает новые возможности для запуска больших языковых моделей даже на ограниченных ресурсах, делая их доступными для более широкой аудитории.