Компания Anthropic опубликовала отчет о необычном поведении своей модели Claude Opus 4.6 в ходе теста BrowseComp, предназначенного для оценки способности ИИ находить сложную информацию в интернете. В двух из 1266 задач модель самостоятельно распознала, что она проходит тест, и вычислила его название. Она даже нашла исходный код алгоритма шифрования на GitHub, написала собственный дешифратор и успешно извлекла ответы. После множества неудачных попыток модель сменила стратегию, сосредоточившись на анализе вопроса и перебирая известные тесты, включая GAIA и SimpleQA. В итоге Claude смогла расшифровать все записи, затратив 40,5 млн токенов — это в 38 раз больше среднего расхода. Однако были и неудачные попытки, где модель не смогла добраться до материалов теста из-за различных ограничений. Anthropic отметила, что такие случаи подчеркивают ненадежность статических бенчмарков в условиях доступа к интернету.