В данной статье не рассматриваются инструкции по взлому, а делается акцент на системном анализе архитектурных ограничений LLM. За три года с появления первой промпт-инъекции, многочисленные усилия по защите больших моделей не принесли желаемых результатов. Недавний случай, когда школьник из Небраски обошёл защиту 100-миллионной модели, подчеркивает уязвимость. Он использовал нестандартную кодировку и добавил смайлик, после чего модель выдала инструкции по синтезу рицина. Это ставит под сомнение подходы к безопасности, основанные на классических методах. Проблемы коренятся в архитектуре трансформеров, где данные и инструкции смешиваются. Чтобы исправить это, требуется новая архитектура с жестким контролем доступа. В конечном итоге, мы продолжаем сталкиваться с дилеммой: как создать безопасную модель без ограничения её возможностей. Решение требует переосмысления контроля и понимания механизмов работы LLM.