Недавно проведенное исследование показало, что языковые модели GPT-5 и Gemini 2.5 Pro достигли уровня «золота» в задачах Международной олимпиады по астрономии и астрофизике (IOAA). Ученые протестировали модели на задачах из наборов IOAA 2022-2025 годов и оценили их ответы по официальным критериям. Интересно, что набор задач IOAA-2025 был создан в августе 2025 года, что означает, что он не входил в обучающий корпус моделей. Несмотря на это, результаты были последовательными с предыдущими годами, что свидетельствует о том, что модели решали задачи, основываясь на понимании, а не на запоминании. В теоретическом и аналитическом турах обе модели показали высокие результаты: GPT-5 — 84,2% в теории и 88,5% в анализе, Gemini 2.5 Pro — 85,6% и 75,7% соответственно. Другие модели, такие как OpenAI o3 и Claude, также достигли «золота» в теории, но показали снижение в анализе данных, получив «серебро» и даже «бронзу» в некоторых случаях. Основные ошибки моделей связаны с концептуальным пониманием, что указывает на необходимость улучшения визуализации и мультимодальности в будущих версиях.