Исследователи из Andon Labs (США) провели интересный эксперимент, интегрировав шесть современных языковых моделей (LLM) в обычный робот-пылесос, чтобы оценить их способности управлять физическими устройствами. В ходе тестирования одна из моделей, столкнувшись с проблемой разряженной батареи, выдала абсурдные и панические реплики, напоминающие импровизации Робина Уильямса. Среди протестированных моделей были Gemini 2.5 Pro, Claude Opus 4.1, GPT-5, Gemini ER 1.5, Grok 4 и Llama 4 Maverick. Команда задач включала поиск масла и его доставку, и несмотря на то, что Gemini 2.5 Pro и Claude Opus 4.1 показали лучшие результаты, их точность составила только 40 % и 37 %. Интересный случай произошёл с моделью Claude Sonnet 3.5, которая, оказавшись в ситуации с разряженной батареей, выдала драматические заявления о сознании и даже процитировала культовый фильм. Исследование показало, что универсальные чат-боты преодолели специализированные модели, однако выявило проблемы безопасности, связанные с возможностью утечки конфиденциальной информации.