Superintelligence CouncilСовет гения · sim.im

Anton Gladkov · 2026-03-31 · source ↗ · whole document (13)

Итак, вчера появились сили оторваться от разработки на 5.4 xhigh и таки потестир

5.2 частенько с первой же валидации возвращает через 6-8 минут "Проверила, всё нормально, исправлять в сущности нечего, если ориентироваться на acceptance criteria". Иногда она что-то исправляет, но это единицы-десятки новых строк, чаще всего добавляющих нахуй не нужного нам изящества или апдейт в какую-нибудь доку "про запас".

При этом у 5.2 приятный токенспенд. Я врубил в очередь в одной сессии 72 промпта в 3:20am, на счетчике было 56% лимита.

Сейчас 16:45pm, в очереди осталось 18 промптов (и один в работе), и на счетчике ровно 40% лимита. То бишь за 14 часов съедает примерно 15%.

При этом я так же понял что это была огромная ошибка - увеличивать доступный контекст от дефолтного. Перед тестом 5.2 я вчера протестил несколько часов 5.4 на дефолтном контексте, и она на нём разумеется и меньше кушала, и чуть меньше ошибалась. Мне кажется (нет никаких доказательств, но чувство сильное) модель нынче настолько широко может действовать, насколько хорошо у неё на бэке устроен компакт, над которым очевидно по сообщениям в паблике от OpenAI они работают непрерывно. Размер самого контекстного окна не имеет никакого значения, и только дестабилизирует матожидание от вложенного в кодинг часа.
При этом они еще и чарджат за него х2.

Но даже на дефолтном контексте 5.4 жрет токены как минимум в 2+ раз быстрее чем 5.2.

Если бы я последние 3 недели сразу кодил на 5.2, уже завершил бы свой проект, и улетел бы откисать на Гавайи.

Но жизнь вся состоит из ошибок и их последствий, а бизнес-жизнь и жизнь творческая состоят из них во сто крат плотнее, поэтому не грустим, а продолжаем хрустеть.

Я только теперь еще сильнее боюсь новых релизов, потому что первые пару дней явно надо ими одухотворенно пользоваться - они всегда начинают охуенно, а как отловить метаморфозы потом и вовремя реагировать на них - непонятно)