Андрей Карпати, экс-директор по ИИ в Tesla, разработал модель, которая превзошла по результатам GPT-2, потратив всего $73 и три часа работы на узле с восьмью GPU H100. Для сравнения, обучение оригинальной GPT-2 в 2019 году требовало более недели и $43,000 на 32 TPU v3. Значительное снижение затрат за последние семь лет, составившее 600 раз, стало возможным благодаря достижениям в области аппаратного обеспечения, программного обеспечения, алгоритмов и качества данных. По словам Карпати, стоимость обучения GPT-2 ежегодно снижается на 40% от предыдущего года. Проект nanochat оказался компактным и эффективным, состоящим из примерно 1000 строк кода, с применением 768 млн параметров и 24 слоев, используя современные архитектурные подходы. Кроме того, Карпати запускает лидерборд для соревнования по скорости обучения моделей до уровня GPT-2, где текущий рекорд составляет 3,04 часа.