
Стартап Skyfall AI решил проверить топовые нейронки на реальную профпригодность и выбрал для этого старый добрый симулятор парка аттракционов. Логика простая — в отличие от стерильных тестов, здесь нужно не просто угадывать паттерны, а годами удерживать бизнес на плаву, учитывать ландшафт и не убивать посетителей. Результаты оказались отрезвляющими. Выяснилось, что даже монстры вроде GPT-5.4 и Gemini 3.1 полностью проваливают пространственное мышление.
На мой взгляд, этот кейс наглядно показывает пропасть между «склеиванием слов» и реальным интеллектом. Нейронки строили безумные аттракционы со входами в стену и совершенно не думали о безопасности — Claude мог спокойно снести рельсы прямо под едущим составом с людьми. ИИ пока не умеет планировать вдолгую, предпочитая решать сиюминутные задачи без оглядки на последствия. Пока ARC-AGI рисует красивые цифры, в обычной игре за 1999 год современные модели ведут себя как хаотичные алгоритмы без капли здравого смысла. Настоящий разум — это не только эрудиция, но и умение не заводить гостей в смертельные ловушки 🎢











