Команда исследователей из DeepReinforce анонсировала CUDA L2, систему, способную автоматически создавать код для матричного умножения на GPU. Результаты показывают, что разработанные ей ядра HGEMM превосходят cuBLAS и cuBLASLt на 10-30%. Эти библиотеки, вручную оптимизированные специалистами NVIDIA, служат эталоном в индустрии, что делает успех CUDA L2 особенно значимым.

Система применяет новый подход, используя сочетание большой языковой модели и обучения с подкреплением. LLM генерирует код с нуля для конкретных матриц, а цикл RL тестирует его на реальном оборудовании, оценивая производительность. Этот процесс повторяется, пока не будет найден наилучший вариант. Такой метод позволяет избежать традиционных шаблонов и свободно изменять различные аспекты ядра.

Использование DeepSeek 671B, дообученной на высококачественном коде, обеспечивает обработку тысячи реальных конфигураций матриц. Тесты показывают, что CUDA L2 в оффлайн режиме быстрее torch.matmul и cuBLAS на 17-22%, а в серверных сценариях — до 29%. Авторы также планируют расширение на новые архитектуры и оптимизацию под 32-битные варианты HGEMM, что может установить новый стандарт в области оптимизации GPU.