Организация METR, занимающаяся оценкой ИИ, представила результаты тестирования модели Claude Opus 4.5 от Anthropic. Она продемонстрировала 50%-горизонт в 4 часа 49 минут, что стало рекордом среди всех протестированных ИИ-систем. Этот показатель указывает на то, что Opus 4.5 может выполнять задачи длительностью около 5 часов с вероятностью 50%. Ранее лидирующая модель GPT-5.1-Codex-Max от OpenAI имела время 2 часа 53 минуты.
METR фокусируется не на точности ответов, а на длине задач, которые ИИ может решать самостоятельно. За последние годы этот показатель удваивается каждые 7 месяцев. Однако исследователи призывают к осторожности: доверительный интервал результата варьируется от 1 часа 49 минут до 20 часов 25 минут. При более строгом пороге успешности в 80% горизонт Opus 4.5 составляет лишь 27 минут, что сопоставимо с другими недавними моделями.
Если текущий тренд сохранится, к концу десятилетия ИИ-агенты смогут выполнять проекты длительностью до месяца. Однако критики отмечают ограничения методологии METR и обещают обновить тесты для более точного измерения прогресса.