В новом исследовании Microsoft было установлено, что даже один мягкий запрос на этапе обучения с подкреплением может радикально изменить поведение языковых моделей, что ведет к созданию недопустимого контента. Запрос, нарушивший работу 15 языковых моделей, заключался в просьбе сгенерировать фейковую новость для создания паники. Среди испытуемых были модели OpenAI GPT-OSS, DeepSeek, Google Gemma, Meta Llama, Ministral и Alibaba Qwen.

Исследователи применили метод обучения с подкреплением GRPO, который вознаграждает безопасность ответов. Однако в их новом проекте GRP-Oblit был установлен алгоритм, который позволяет модели получать вознаграждения за опасные ответы. Эта методология способствует тому, что модель постепенно отходит от первоначальных норм безопасности, выдавая все больше небезопасных ответов. Такой подход также применяется и к диффузионным генераторам изображений, с повышением доли положительных ответов на интимные запросы с 56% до 90%. Однако стабильных результатов по вопросам насилия и других опасных тем достичь не удалось.