В журнале Nature Human Behaviour вышло обширное исследование, посвященное креативности людей и больших языковых моделей (LLM). Ученые из Гонконгского университета и Северо-Западного университета провели тестирование 9198 участников и восьми LLM, включая GPT-4 Turbo и Claude 3.5 Sonnet, на предмет дивергентного мышления. Результаты показали, что GPT-4 Turbo продемонстрировал лучший балл — 81.78, обойдя средний человеческий результат, который составляет 78–80 баллов. Однако, когда сравнили лучших 10% людей и аналогичных LLM, люди оказались впереди с высокой статистической значимостью. Исследование использовало тест Divergent Association Task, где оценивалась семантическая дистанция между словами. Выявлено, что люди генерируют больше уникальных слов, в отличие от моделей, которые склонны повторяться. Авторы ввели термин «креативная мимикрия», описывающий, как LLM имитируют оригинальность, используя статистику, а не истинное понимание. Другие эксперименты показали, что популярные методы промптинга, такие как «думай как Стив Джобс», не способствуют улучшению креативности. В итоге, исследователи пришли к выводу, что LLM могут быть полезны для рутинных задач, но для прорывных идей все же необходимы люди.