Лаборатория искусственного интеллекта Lossfunk анонсировала новый бенчмарк под названием EsoLang-Bench, который включает 80 задач на пяти эзотерических языках программирования: Brainfuck, Befunge-98, Whitespace, Unlambda и Shakespeare. Пять передовых моделей, включая GPT-5.2 и Gemini 3 Pro, продемонстрировали очень низкую точность — от 0 до 11% на задачах, которые легко решаются на Python. Ни одна из них не справилась с задачами выше уровня Easy. Эзотерические языки, используемые в тесте, созданы главным образом для экспериментов и отличаются крайне необычным синтаксисом. Из-за отсутствия обучающих данных для этих языков, успех моделей значительно осложняется. Лучший результат среди моделей составил 11,2% на Befunge-98 с помощью итеративной обратной связи. Увы, стратегии, такие как few-shot примеры, не приводят к значительным улучшениям. Исследователи заключают, что высокие достижения в стандартных бенчмарках связаны с запоминанием, а не с истинным рассуждением, что ставит под сомнение способность ИИ адаптироваться к новым языкам программирования.

Вопрос-ответ

Какой новый бенчмарк и для каких языков он создан?

Новый бенчмарк EsoLang-Bench включает 80 задач и тестирует пять эзотерических языков программирования: Brainfuck, Befunge-98, Whitespace, Unlambda и Shakespeare. Он призван оценить способность современных моделей ИИ работать с языками с необычным синтаксисом и без обучающих данных по ним.

Какие результаты показали передовые модели и как они сравниваются с задачами на обычных языках?

Пять передовых моделей (включая GPT-5.2 и Gemini 3 Pro) продемонстрировали крайне низкую точность — от 0 до 11% на задачах, которые легко решаются на Python. Ни одна модель не справилась с задачами выше уровня Easy. Лучший результат достигнут на Befunge-98 и составил 11,2% с использованием итеративной обратной связи.

Что говорит исследование об особенностях эзотерических языков и причин слабой производительности ИИ?

Эзотерические языки созданы для экспериментов и имеют крайне необычный синтаксис. Отсутствие обучающих данных по этим языкам усложняет задачу моделям ИИ. Авторы отмечают, что даже стратегии вроде few-shot примеров не дают значительных преимуществ. Вывод: современные успехи на стандартных бенчмарках часто основаны на запоминании, а не на реальном рассуждении и адаптации к новым языкам.