В новом исследовании, проведённом Microsoft Research и Salesforce, было проанализировано более 200 000 диалогов с современными ИИ-моделями, включая GPT-4.1 и другие. Результаты показали, что многие модели теряются в разговорах, что приводит к снижению их производительности. При обработке отдельных запросов точность ответов достигает 90%, однако в длительных диалогах она падает до 65%. Более того, учёные заметили, что ответы моделей могут удлиняться на 20-300% в процессе беседы, что в свою очередь приводит к большему количеству неверных предположений. Даже такие инновационные модели, как o3 от OpenAI, не справляются с данными проблемами, демонстрируя снижение надёжности. Исследование поднимает вопрос о рисках использования ИИ-технологий, так как качество генерируемой информации может быть недостоверным. Microsoft также отмечает, что неумелое использование ИИ пользователями может затруднять работу моделей.