Модель GPT-5.4 стала абсолютным чемпионом на Vibe Code Bench v1.1, показав результат 67,42%, что на 5,7 пункта выше, чем у бывшего лидера GPT-5.3 Codex, который набрал 61,77%. Третье место заняла Claude Opus 4.6, не используя режим рассуждений, с показателем 57,57%. Бенчмарк оценивает не умение исправлять ошибки или дописывать функции, а способность модели создавать полноценное веб-приложение от начала до конца, основываясь на текстовом описании.
В рамках тестирования использовалось 100 задач, разделенных на публичные и тестовые. Каждая задача предусматривала создание приложения в изолированной среде с доступом к браузеру и рабочим сервисам. В задания входили аналоги популярных платформ, такие как социальная сеть Zeeter, трекеры привычек и образовательные порталы. Модели отводилось до пяти часов на выполнение каждой задачи, результат оценивался по количеству функционирующих компонентов.
Интересно, что Claude Opus 4.6 демонстрирует близкие к лидерам результаты с меньшими затратами. Тем не менее, у GPT-5.4 все еще остается примерно треть проваленных решений. В то же время результаты бенчмарка заметно улучшились за последние полгода.