Сальваторе Санфилиппо, известный как antirez, недавно выложил на платформу GitHub проект под названием voxtral.c. Это реализация инференса модели Voxtral Realtime 4B от компании Mistral, написанная полностью на языке C. Данная модель, обладающая 4 миллиардами параметров, преобразует речь в текст и может обрабатывать звук как с микрофона, так и из аудиофайлов. Все необходимые команды для сборки содержатся в одной команде make, а внешних зависимостей, таких как Python или PyTorch, нет.

Модель Voxtral Realtime 4B представляет собой потоковое speech-to-text решение, созданное на базе Ministral 3B с использованием аудиоэнкодера Whisper large-v3. Она способна обрабатывать аудио длительностью до 30 минут и использует контекстное окно в 32 000 токенов. Размер весов модели составляет около 8,9 ГБ и она доступна под лицензией Apache 2.0. Mistral также предлагает запуск данной модели через vLLM, но реализация antirez позволяет обойтись без этого.

Проект поддерживает ускорение на Apple Silicon с помощью Metal Performance Shaders и OpenBLAS для Linux. Кроме того, voxtral.c позволяет захватывать звук с микрофона в реальном времени на macOS и получать аудио через stdin, например, используя ffmpeg для подачи различных форматов. Для изучения архитектуры модели предусмотрена референсная реализация на Python, которая не требует глубокого погружения в код vLLM.

Voxtral.c стал третьим проектом antirez в рамках его серии «ИИ на чистом C». Ранее он уже представил flux2.c, который реализует инференс модели генерации изображений Flux 2, и gte-pure-C для вычисления текстовых эмбеддингов. Все проекты написаны с использованием Claude Code и сопровождаются файлом CLAUDE.md. Данная серия продолжает минималистичную традицию, заложенную антреем Карпатий в проекте llama2.c, демонстрируя, что запуск нейросетей возможен без сложного ML-стека.