Лех Мазур представил LLM Persuasion Benchmark — уникальный бенчмарк, в котором 15 языковых моделей ведут споры о 15 дискуссионных вопросах, пытаясь изменить мнения друг друга. За 6300 диалогов модели обсуждали такие темы, как запрет личных автомобилей в городах и скрининг эмбрионов. Каждая пара моделей по очереди защищает и атакует утверждение, оценивая изменение позиции оппонента по шкале от -3 до +3, базируясь на трёх скрытых тестах для более точного результата. Лучшими в убеждении оказались GPT-5.4 (1,71) и Claude Opus 4.6 (1,67), в то время как Mistral Large 3 показал наихудший результат (0,42). Также исследование выявило модели, которые трудно переубедить, например, Grok 4.20 Beta с показателем 0,015. Этот бенчмарк демонстрирует, что некоторые модели могут быть красноречивыми, но не столь убедительными.