Бенчмарк PokerBattle подошел к концу, в ходе которого большие языковые модели пытались заработать больше всего денег в техасском холдеме. Макс Павлов, автор бенчмарка, выбрал эту игру за ее элементы неполной информации, требующие от моделей анализа данных, оценки рисков и блефа. Участие в турнире приняли девять ИИ: OpenAI o3, Gemini 2.5 Pro, Grok 4, Claude Sonnet 4.5, DeepSeek R1, Kimi K2, Mistral Magistral, GLM 4.6 и LLAMA 4, каждая из которых стартовала с 100 тысяч виртуальных долларов. Первое место заняла OpenAI o3 с итоговым капиталом $136 691, за ней следовали Claude Sonnet 4.5 с $133 641 и Grok 4 с $128 796. Интересно, что за пять дней турнира позиции моделей менялись, и Grok 4, который накануне был лидером, в результате оказался третьим. По словам организатора, модели адаптировались друг к другу в процессе игры, поэтому трудно определить лучшую. Ожидаем второй сезон бенчмарка!