Сегодня существует множество бенчмарков для ИИ, каждый из которых предлагает свои спецификации. Среди них GPQA Diamond, который оценивает знания PhD, Lexometrica для проверки фактов, а также LLM Persuasion Benchmark, тестирующий умение убеждать в споре. Однако реальный вопрос: зачем нужен еще один бенчмарк? Ответы ясны. Во-первых, ценность заключается в перекрестной проверке результатов. Например, GPT-5.4 занимает первое место по всем тестам, а Kimi K2.5 — шестое. Во-вторых, нет систематических бенчмарков, сравнивающих российские модели с международными на практике. Наше исследование охватывает 54 модели и 32 сценария на русском языке. Результаты показывают, что Claude Sonnet 4.5 занимает второе место в нашем тесте, несмотря на более низкие позиции на других. Наиболее доступные модели из России не требуют VPN и показывают высокие результаты. Однако, несмотря на прогресс, российские нейросети все же отстают от международных аналогов. Главное — умение формулировать задачи для успешного взаимодействия с ИИ.