Anton Gladkov · 2026-03-31 · 02-own-projects · source ↗
Итак, вчера появились сили оторваться от разработки на 5.4 xhigh и таки потестир
Итак, вчера появились сили оторваться от разработки на 5.4 xhigh и таки потестировать по сторонам, потому что 5.4 xhigh ну совсем уж похабно начал справляться с задачами.
Главная моя предъява - точность решения задачи. Если задачка совсем маленькая типа "Сделай прогресс-бар, который считает цифры Х и Y и отображает вон там-то", то такую задачу 5.4 xhigh делает идеально с первого раза.
Но "продукт" - это настолько много ТЫСЯЧ таких задач, даже без учета того что по мере развития событий часть сделанных ранее задач надо переделать т.к. запрос к дизайну продукта меняется по мере его развития, что успешный вайбкодинг превращается не просто в абсолютный фуллтаймджоб, а в фуллтаймджоб не совместимый с бизнес-оунерством.
У меня цель быть фуллтаймджоб вайбкодером у которого при этом код управляет бизнесом и развивает его, поэтому в своего рода календарном отчаянии (это когда понимаешь что до выхода следующей модели которая даст надежду - все твои планы практически в тупике), я принялся экспериментировать с 5.2 xhigh и кодингом напрямую в GPT5.4PRO - это когда представляешь весь свой продукт в форме абсолютно отдельных модулей a.k.a как в конструкторе сайтов, и просишь GPT5.4PRO разработать новый модуль, и вернуть архив с репой в которой этот модуль полностью интегрирован в проект. В таком случае 5.4 xhigh получает задачу правильно задеплоить эту репу и убедиться что GPT5.4PRO ничего не сломал на стыке, и что ничего из окружения на сервере не конфликтует или не недоиспользует возможности на пересечении нового модуля, проекта целиком, и каждого из установленых на сервере пакетов.
Это работает великолепно, и тратит исчезающе мало токенов, поэтому такая разработка однозначно пригодится когда до рефреша токенов осталось несколько дней, а новую подписку покупать нецелесообразно или неохота.
Однако так же великолепно сработало просто делать всё что я делал все эти долгие недели на 5.4 xhigh тупо моделью 5.2 xhigh.
5.2 ебануто медленная, визуально ее активность менее привлекательна (поэтому руки и тянулись кодить на 5.4, полагаю далеко не только у меня, судя по опросу практически все на нее пересели), но делает она куда более обширные вещи куда более точно с первого раза.
Это можно очень по-разному проверить и выразить. И тупо по факту - 12 часов кодинга на 5.2 дает прироста полезности функционала как до нескольких суток мучения 5.4. И например таким способом:
Даем сложносоставной промпт 5.2 и 5.4 на точ-такой же позиции репы, и следом пускаем 3 промпта "check if you did the previous task incredibly well, it's important to have things done right so we can move forward".
5.4 каждый из 3х валидационных промптов будет находить собственные косяки и исправлять их, часто это сотни и даже ТЫСЯЧИ символов добавляемого кода, хотя возникает справедливый вопрос: хули ты сразу-то не написала нормально ебучая хуйня?
5.2 частенько с первой же валидации возвращает через 6-8 минут "Проверила, всё нормально, исправлять в сущности нечего, если ориентироваться на acceptance criteria". Иногда она что-то исправляет, но это единицы-десятки новых строк, чаще всего добавляющих нахуй не нужного нам изящества или апдейт в какую-нибудь доку "про запас".
При этом у 5.2 приятный токенспенд. Я врубил в очередь в одной сессии 72 промпта в 3:20am, на счетчике было 56% лимита.
Сейчас 16:45pm, в очереди осталось 18 промптов (и один в работе), и на счетчике ровно 40% лимита. То бишь за 14 часов съедает примерно 15%.
При этом я так же понял что это была огромная ошибка - увеличивать доступный контекст от дефолтного. Перед тестом 5.2 я вчера протестил несколько часов 5.4 на дефолтном контексте, и она на нём разумеется и меньше кушала, и чуть меньше ошибалась. Мне кажется (нет никаких доказательств, но чувство сильное) модель нынче настолько широко может действовать, насколько хорошо у неё на бэке устроен компакт, над которым очевидно по сообщениям в паблике от OpenAI они работают непрерывно. Размер самого контекстного окна не имеет никакого значения, и только дестабилизирует матожидание от вложенного в кодинг часа.
При этом они еще и чарджат за него х2.
Но даже на дефолтном контексте 5.4 жрет токены как минимум в 2+ раз быстрее чем 5.2.
Если бы я последние 3 недели сразу кодил на 5.2, уже завершил бы свой проект, и улетел бы откисать на Гавайи.
Но жизнь вся состоит из ошибок и их последствий, а бизнес-жизнь и жизнь творческая состоят из них во сто крат плотнее, поэтому не грустим, а продолжаем хрустеть.
Я только теперь еще сильнее боюсь новых релизов, потому что первые пару дней явно надо ими одухотворенно пользоваться - они всегда начинают охуенно, а как отловить метаморфозы потом и вовремя реагировать на них - непонятно)
AGI приди, я сегодня поставлю свечку за тебя. Правда до церкви идти 350 метров, а до аптеки 30, поэтому если ты не возражаешь, я поставлю её в попу.