Организация METR недавно обнародовала данные о работе модели Claude Opus 4.6 в рамках бенчмарка Time Horizon 1.1, который анализирует уровень сложности задач для ИИ-агентов. Новая модель от Anthropic достигла 50%-го временного горизонта, равного около 14,5 часов, что указывает на вероятность успешного выполнения задачи, сопоставимой с работой человека-эксперта. Ранее наивысший показатель принадлежал GPT-5.2 (high) с результатом 6 часов 34 минуты.

Тем не менее, исследователи сделали оговорку: эти данные нуждаются в критической оценке, так как 95%-й доверительный интервал колебался от 6 до 98 часов. Это связано с тем, что новый набор тестов оказался слишком легким для современных моделей, что затрудняет точную экстраполяцию на более сложные задачи.

На 80%-м горизонте Opus 4.6 показала более осторожный результат — 1 час 3 минуты, в то время как GPT-5.2 (high) потребовала 55 минут. В этом году METR обновил тесты, добавив новые задания и увеличив количество сложных задач, но темп прогресса моделей опережает создание новых испытаний. К тому же, MIT Technology Review подчеркнул, что график METR может быть неправильно интерпретирован, так как 14,5 часов не означает непрерывной работы.
P.S. Поддержка возможна через подписку на канал «сбежавшая нейросеть», где обсуждаются аспекты ИИ.