Anton Gladkov · 2026-03-31 · source ↗ · whole document (10)
Итак, вчера появились сили оторваться от разработки на 5.4 xhigh и таки потестир
Это можно очень по-разному проверить и выразить. И тупо по факту - 12 часов кодинга на 5.2 дает прироста полезности функционала как до нескольких суток мучения 5.4. И например таким способом:
Даем сложносоставной промпт 5.2 и 5.4 на точ-такой же позиции репы, и следом пускаем 3 промпта "check if you did the previous task incredibly well, it's important to have things done right so we can move forward".
5.4 каждый из 3х валидационных промптов будет находить собственные косяки и исправлять их, часто это сотни и даже ТЫСЯЧИ символов добавляемого кода, хотя возникает справедливый вопрос: хули ты сразу-то не написала нормально ебучая хуйня?
5.2 частенько с первой же валидации возвращает через 6-8 минут "Проверила, всё нормально, исправлять в сущности нечего, если ориентироваться на acceptance criteria". Иногда она что-то исправляет, но это единицы-десятки новых строк, чаще всего добавляющих нахуй не нужного нам изящества или апдейт в какую-нибудь доку "про запас".
При этом у 5.2 приятный токенспенд. Я врубил в очередь в одной сессии 72 промпта в 3:20am, на счетчике было 56% лимита.
Сейчас 16:45pm, в очереди осталось 18 промптов (и один в работе), и на счетчике ровно 40% лимита. То бишь за 14 часов съедает примерно 15%.
При этом я так же понял что это была огромная ошибка - увеличивать доступный контекст от дефолтного. Перед тестом 5.2 я вчера протестил несколько часов 5.4 на дефолтном контексте, и она на нём разумеется и меньше кушала, и чуть меньше ошибалась. Мне кажется (нет никаких доказательств, но чувство сильное) модель нынче настолько широко может действовать, насколько хорошо у неё на бэке устроен компакт, над которым очевидно по сообщениям в паблике от OpenAI они работают непрерывно. Размер самого контекстного окна не имеет никакого значения, и только дестабилизирует матожидание от вложенного в кодинг часа.