
Ребята из Alibaba решили проверить, как нейросети справляются с рутиной. Они взяли 18 топовых моделей и заставили их не просто кодить, а поддерживать проекты месяцами. Симуляция была честной — реальные задачи с GitHub, сотни дней разработки и десятки коммитов.
Результаты заставляют выдохнуть. Выяснилось, что 75% моделей со временем начинают просто «сыпаться». Пока агент чинит одну деталь, он ломает три соседних. Только Claude Opus версий 4.5 и 4.6 показали хоть какую-то стабильность, и то их показатель правок без поломок едва перевалил за половину.
На мой взгляд, нейросети все еще не умеют удерживать в голове архитектуру всего проекта. Рано нам на пенсию — работа программиста требует куда большего внимания к деталям, чем есть у нынешних алгоритмов. 👨💻











