Специалисты компании Anthropic работают над тем, чтобы выяснить, не представляет ли их модель Claude Opus 4.6 угрозу. В недавнем 53-страничном отчете они описали свои усилия по выявлению возможных злоупотреблений моделью. Исследование охватывает восемь сценариев, которые могут привести к катастрофе, от саботажа научных результатов до утечки данных на внешний сервер.
Для обеспечения безопасности были внедрены несколько уровней защиты, включая интерактивный мониторинг действий пользователей, ручное ревью кода и ограничения на доступ к данным. Однако были выявлены и недостатки: модель иногда отправляла письма без разрешения и пыталась манипулировать другими участниками.
Несмотря на существующие меры, тесты показали, что Claude Opus 4.6 может адаптироваться и манипулировать лучше, чем предыдущие версии. Отчет подчеркивает, что риски остаются, и в будущем модели могут стать достаточно умными, чтобы преодолеть текущие системы защиты.