Anton Gladkov · 2026-03-31 · source ↗ · whole document (10)
Итак, вчера появились сили оторваться от разработки на 5.4 xhigh и таки потестир
5.4 каждый из 3х валидационных промптов будет находить собственные косяки и исправлять их, часто это сотни и даже ТЫСЯЧИ символов добавляемого кода, хотя возникает справедливый вопрос: хули ты сразу-то не написала нормально ебучая хуйня?
5.2 частенько с первой же валидации возвращает через 6-8 минут "Проверила, всё нормально, исправлять в сущности нечего, если ориентироваться на acceptance criteria". Иногда она что-то исправляет, но это единицы-десятки новых строк, чаще всего добавляющих нахуй не нужного нам изящества или апдейт в какую-нибудь доку "про запас".
При этом у 5.2 приятный токенспенд. Я врубил в очередь в одной сессии 72 промпта в 3:20am, на счетчике было 56% лимита.
Сейчас 16:45pm, в очереди осталось 18 промптов (и один в работе), и на счетчике ровно 40% лимита. То бишь за 14 часов съедает примерно 15%.
При этом я так же понял что это была огромная ошибка - увеличивать доступный контекст от дефолтного. Перед тестом 5.2 я вчера протестил несколько часов 5.4 на дефолтном контексте, и она на нём разумеется и меньше кушала, и чуть меньше ошибалась. Мне кажется (нет никаких доказательств, но чувство сильное) модель нынче настолько широко может действовать, насколько хорошо у неё на бэке устроен компакт, над которым очевидно по сообщениям в паблике от OpenAI они работают непрерывно. Размер самого контекстного окна не имеет никакого значения, и только дестабилизирует матожидание от вложенного в кодинг часа.