В сети появились предполагаемые результаты тестирования DeepSeek V4, которые сравнивают его с такими моделями, как Gemini 3.1 Pro, GPT-5.3 и Claude Opus 4.6. Если данные окажутся достоверными, то DeepSeek V4 уверенно занимает первое место по всем показателям. На тесте MMLU-Pro модель набрала 91,2 балла, в то время как ближайший соперник Gemini 3.1 Pro Preview – 90,0, а GPT-5.3 и Claude Opus 4.6 остановились на 88,4 и 86,7 соответственно.

На математическом бенчмарке AIME 2025 DeepSeek V4 показал 96,4, опережая Gemini 3.1 Pro Preview (95,0) и GPT-5.3 (94,6). На платформе Codeforces модель достигла 2767 рейтинговых баллов, что соответствует уровню гроссмейстера. Однако на тесте SWE-bench Verified результат составил 59,6%, что указывает на сложности в исправлении реальных ошибок.

В тесте WebArena DeepSeek V4 также оказался на первом месте, набрав 58,7%. Если данные подтвердятся, то DeepSeek V4 станет явным лидером на рынке больших языковых моделей, оставив позади Gemini 3.1 Pro Preview, GPT-5.3 и Claude Opus 4.6. Ожидается официальный анонс от DeepSeek.