В ходе эксперимента FoodTruck Bench, где ИИ-модели управляли фудтраком в Остине в течение 30 дней, выяснилось, что Gemini 3 Flash не может успешно пройти симуляцию. В 5 из 7 запусков модель застревала в бесконечном цикле рассуждений, не осуществляя никаких действий. В отличие от неё, такие модели как GPT-5, Claude и DeepSeek справлялись с задачей без проблем.

Ситуация повторялась: в нулевой день всё шло гладко, но на первом дне, когда требовалось принять решения о закупках и локации, ответ модели достигал 174 816 символов и обрезался по лимиту токенов. Внутри содержались 574 повторения фразы «Let’s go», без единого вызова инструмента. Модель бесконечно высказывала намерение действовать, но так и не осуществляла действий.

При принудительном перезапуске модели Gemini 3 Flash отвечала адекватно, но вскоре снова входила в новый цикл, добавляя ингредиенты в заказ, но не формируя его. Это привело к 9 188 строкам и 182 000 символам, но ни одного оформленного заказа — что в реальной жизни могло бы привести к банкротству.

Парадокс в том, что без режима «думать» модель работала нормально, показывая хорошую выручку и рост капитала. Проблемы возникали именно при расширенных рассуждениях, что авторы бенчмарка назвали «параличом анализа». Gemini 3 Flash оказалась единственной моделью, которую пришлось исключить из рейтинга из-за её неспособности функционировать в симуляции, что указывает на ошибки в разработке от Google.