В 5.5 был момент когда обычная модель поравнялась и даже местами обогнала PRO, и это лично меня возмущало, т.к. бесит когда не понятно нихуя что и зачем нужно, и нужно ли.
Так вот: я уже пять тасков кручу по такой мехаике:
2,501 passages, newest first · 272 ms
В 5.5 был момент когда обычная модель поравнялась и даже местами обогнала PRO, и это лично меня возмущало, т.к. бесит когда не понятно нихуя что и зачем нужно, и нужно ли.
Так вот: я уже пять тасков кручу по такой мехаике:
Поговорил с PRO вольным образом о том что меня волнует, спросил "можно ли мне теперь Add to chat нажимать? Или ты как-то доформулируешь задачу до исполнения 5.6 Sol Max в кодексе? Там же кнопка теперь есть, которую я могу нажать и весь наш чат сразу улетит модели на реализацию"
PRO тогда спохватывается, и выстраивает весь контекст в ряд, добавляя прям конкретное распоряжение для модели в Кодексе. Жмяк на кнопку - Enter - и пошла жара.
Когда модель отчитывается мол сделано, как правило это еще не сделано, а лишь отчет по первому слайсу. Прошка настолько умна, что она не способна сделать разнарядку на "возьми и сделай". Там пиздец столько слайсов по задачам…
Когда модель отчиталась что слайс завершен, тупо копируешь ее репорт и просишь diff. Закидываешь репорт с диффом в чатик с прошкой, и спрашиваешь
"Что дальше?"
Ответ получен? Add to task.
И так далее =)
Я думаю что для технически насыщенных задач, которые меньше про креативность и творчество, и больше про заёбу ебаную, например "давай переедем на самый более пизда инновационный фронтэнд, чтобы до 2037го года об этом больше не думать" – это идеальный способ работы, т.к. думать заставляет только первые 2-3 сообщения прошке, чтобы высказать размышления и пару слабо оформленных сомнений, а потом…
Ну я кстати вообще не согласен с Theo (кент выше который проливал слезы на Ultra) по поводу его отношения к реализации V2 агентов в Codex.
Его тейк заключается в том что тупо что все агенты делят контекст между собой мол потому что это жрет токены.
Ну бля а раньше это жрало меньше токенов зато агенты были внатуре вреднее чем без них!!!!!!!!!!!!!
Сейчас у тебя агенты гуляя по репе хотя бы (в теории) не предоставят заспаунившему их решале ложные или противоречивые данные, т.к. противоречие разрешается именно за счет прозрачности размышлений о каждом прочитанном пикселе сразу всей агентской братией.
Так же я не понимаю пиздостраданий о невозможности выбрать reasoning level субагентов.
Бля а нахуя тебе субагенты которые тупее чем модель которая будет потом на базе их рисеча и РИЗОНИНГА пилить ультимативное решение? Давайте даунов нанимать и просить их собирать сведения для парочки гениев.
Это мне чем-то напоминает инвертированную картинку ценностей в отделах продаж, порожденную слишком большим удалением владельцев компании от операционки (в любой корпорации это происходит).
Самая сложная работа требующая самого большого effort и самой большой смекалки и скиллсета - это заведение новых знакомств для бизнеса и закрытие НОВЫХ клиентов.
Старых клиентов продолжать доить может и обезъяна ебучая.
При этом в компаниях типа Google спустя десятилетия от создания система выстроилась таким образом что люди которые бегают по рынку и закрывают новые сделки (сложная работа) считаются джунами и у них самая низкая зарплата. А сейлзы которые нихуя не делают, просто раз в квартал пишут "Привет вот вам инвойс", и лениво отвечают…
Причем если SDRов посадить на Key Accounts инвойсы слать - либо ничего не изменится, либо чек начнет расти.
Если Key Account Managers в поля отправить - продажи новому бизнесу до нуля упадут)
С агентами происходит такая же подмена ценностей. В отличие от материнской LLM, агент считается ютуб "экспертами" тем ценнее чем больше шума он наделал за как можно более низкий прайс…
Но бля на деле это не более низкий прайс, а у тебя дорогущая материнская LLM ризонит хуйню вместо того уровня правды на который она способна, потому что материал на входе в неё - хуйня.
Тут уж чтобы сэкономить проще тогда запрещать спаунить агентов в принципе.
А если есть лавэ или потребность в ультра скорости из-за чего-то. Например залатываем дыры или релиз надо не проебать. Тогда надо просить спаунить как можно больше абсолютно мощнейших субагентов макс модели на макс ризонинге.
Я не понимаю почему бля это вообще не обсуждается-то нигде и никем? Это элементарно же
PRO
и Extra High Sol с позавчерашнего дня нельзя использовать
Там же все форсили вроде и тут тоже твиттер разрабов OpenAI
Они там пусси джусси опустили в 10 раз для моделей чтбы они не хавали весь аллованс за минуту
И Max стал в 2 раза тупее чем раньше был Xhigh
А Xhigh в 10 раз стал тупее чем раньше был…
ну хз осадочек в душе и шрам на сердце теперь глубок настолько что если сегодня китайцы выпустят убийцу GPT, я половину подписок сразу туда переключу)) Мне выходные считай прям испортили
гондоны
Дык это четыре сессии на одном макс двух проектах
Я когда-то еще давно репу заточил под нормальный бесперебойный процесс работы для в целом любого количества сессий
Покумекали с GPT и оказалось что все doable, там всякие мержи, ворктри, держим мэйн чистеньким, flock, деплой контракты многоуровневые, оценщик сложности деплоя и под это правильная система тестов, итд
В итоге я могу…
Он так отвечал тебе после большого числа компактов
На последнее что ты ему предъявил
У всех так
на ультра например компакты случались на сука 35м часу работы над задачей уже каждое третье сообщение в этой инференс-эмиссии
И получается что каждое третье сообщение он начинал с одного и того же
Что отражало последнюю предъяву которую я ему закидывал =)
Все…
любопытно за счет чего такой график
по-идее единственный вариант это отток от Anthropic
Ну или не отток а раскошеливание любителей антропика еще и на оупенэяй
Ну либо они в US такую рекламную кампанию крутят что ща еще инфляция ебнет в два раза
Просто у такого нишевого по меркам населения земли продукта как Codex +3 миллиона юзеров за пару дней…
Короче Sol первые часов 8 своей жизни был просто ебанись каким лютым. Ваншотил что угодно кончиком мизинчика, вертел Fable на хуе, как и любую в целом задачу и проблему. Вообще без галюцинаций и изъянов. Было ощущение полного AGI.
Потом начались танцы с тысячей обнулений. Ещё не выжившие из ума старожилы помнят: обнуления происходят только тогда когда что-то УХУДШАЕТСЯ =)
5.5 как выкатили стабильно, нихуя ни разу не обнуляли, например;)