Superintelligence CouncilСовет гения · sim.im

Anton Gladkov · 2026-09-06 · 06-tools · source ↗

1) Промпт должен описывать подробнейше причинно-следственные связи из твоей голо

1) Промпт должен описывать подробнейше причинно-следственные связи из твоей головы, в полном объеме, надо прям методичку написать, иначе никак. Ллмке поручить написать за тебя - не получится. Она сократит и уничтожит смысл причинно-следственности, скукожив его до неразворачиваемости до качества которое нужно тебе. Я с этим два месяца проебался.

2) Надо убедиться что нигде в радиусе операций модели нет ни одного скриптового валидатора, верификатора, гейта, итд. Никакой детерминистики там быть не должно кроме инструмента транспорта данных, который не активный а пассивный. Он принимает данные от LLMки которая опять же очень хорошо понимает как их туда складывать потому что ей очень хорошо описали и объяснили.

3) Надо убедиться что в гигантском промпте со всеми объяснениями нет строгих запретов.

Часто у людей там НЕ, НЕ, НЕ, НЕ - это не работает.

Совокупные запреты обычно обнимают задачу настолько широко что целью модели становится не выполнить задание, а не нарушить запрет. Это влияет на качество... ну как сказать... ну процентов на 99.5% =))))))))

Если рисеч ну очень большой, то нужно чтобы это был не один воркер а последовательные воркеры которые выполняют каждый свою задачу. У меня в рисечере для кампаний клиентских таких воркеров в ряду.... 36 штук

время от времени между ними воркеры которые проверяют качество выполнения предыдущими воркерами инструкций и вносят правки если видят что можно было лучше. Один проверяющий/корректирующий воркер (я их называю ре-чекерами) может справиться (у меня) не более чем с 4 отработавшими предыдущими воркерами. Если больше - он плывет.

Ну и очень важно как устроена работа с базой в процессе выполнения задачи, потому что рисечер не может сделать качественный рисеч если он все держит и решает в уме

В уме у модели все начинает усредняться к среднему знаменателю всего что туда попало

Модель должна заглядывать в ячейки поступательно, получать в ячейке контракт на созидание, делать работу, и ставить галочку мол ячейка готова.

Тогда по-сути рисеч/копирайт/креатив превращается для модели в кодинговую задачу

Она же может 450 файлов поменять уникальным образом для каждого файла - вот и 450 задач она сможет выполнить на макс ризонинге уникально.

Но если не разбить так а попросить сделать 450 результатов в уме - получишь 450 порций говна

Это звучит дороговато но иначе никак, во всяком случае я не добился, хотя я на это потратил половину от всего времени которое потратил на проект)

Да пацаны вырубайте как минимум субагентов

расход уменьшился во много раз на Max в задаче которая с утра крутится и сожрала больше недельного лимита в одну каску с агентами

это при том что теперь кэша больше в модель залетает т.к. она читает разросшуюся свою сессию целиком

просто модели пока не умеют эффективно работать с агентами

агент получает уйму хуйни на входе + весь контракт всей репы + весь харнесс итд, чтобы просто две кнопки нажать, и таких агентов модель спаунит сотни

я заметил что астра прям ну очень ебать щедро ими пользуется

например чтобы внести правки в док она отдельного агента зовет который над чем-то там думает 10 минут

причем она еще тратит уйму ресурсов чтобы аутпутнуть ему задачу, прочитать все что он делает, погасить его, итд

Я тупо если честно не понимаю если рисую на схеме это все - зачем

я не вижу в этом ни ускорения, ни увеличения качества, но вижу уменьшение качества и ебанистическое увеличение расхода

на мой скромный взгляд субагентская тема это просто способ вытаскивания токенов из корпоратов

и смысла в этом не было бы даже если бы можно было

потому что модель за последние 2 суток изменили тридцать раз

Весь прикол в том что она "в среднем выдает за Х усилий от хумана"

Я понимаю как в бенчмарк запихать например качество текста, которое можно распедалить на десятки параметров

И то ща понял что это человек может судить, а не машина

у меня Sol называл самыми качественными письмами самые хуевые

Потому что его морализатор встроенный спокоен, а для него это самый главный вождь всех оценщиков

При этом Qwen давал письмам самую справедливую оценку, потому что он и писал и пишет все еще лучше всех

Ну а еще бенчмаркинг это ебать затратно по токенам

у меня есть один бенчмарк маркет скана, т.к. без него я бы помер уже понимать что там как - слишком много всего

Ну и один прогон бенча даже если ОДНУ штучку протестить там (изменили одну модель в ряду) - это

5-6% OpenAI
4% kimi
и по 8% с каждой из Qwen3.8 подписок

А если сложный тест закинуть мол "перебери вот эти варианты", то там спокойно полнедельной дозы со всех подписок тупо чтобы узнать с чем дальше работаем.

Когда задача хотя бы производственная - понятно зачем такие косты. А понять как на сегодняшний час конкретная модель работает относительно других - бестолковая задача при том что через час все будет иначе =)

Пока что кажется что Max заставить закидыванием посреди задачи работать иначе - не приводит к успеху

Она поначалу вроде как начала следовать, но за полчаса скатилась обратно

находит абсолютно незначимые для дела вещи и фиксит их + гоняет тесты по ним

Самое страшное - она даже не понимает над чем она работает

Вот эта тему с Unknown sender на самом деле не то что она думает

Если бы она поднялась на вертолете и посмотрела на всю схему - она бы это увидела, но она этого уже не сделает

в итоге она делает выводы не по всему функционалу в котором запущена чинить баги, а по отдельным рандомно взятым десяти строчкам этого функционала, и в такой работе смысла никакого нет абсолютно

скорее всего такая работа даже не сможет закончиться

Это Astra так выебуривает на Max =)

от Sol 5.6 Max это вообще ничем не отличается к сожалению

"Проверила. Да, я излишне раздробила заключительную часть работы. Это не был круг совсем бесполезных проверок, но подписи интерфейса и отдельные сценарии входа получали слишком много отдельных циклов выпуска.
Основная защита отправки уже выпущена: неизменный запрос до отправки, атомарный учёт результата, сохранение webhook до обработки, исправления адресатов и вложений, единый EE-транспорт сервисной почты, передача OAuth движку и обновление EE. Остаток существенно меньше исходного плана."

Вот это "Сохранение webhook до обработки" уже было реализовано

то бишь как и 5.6 Sol она повторно делает то что уже есть

причина - не смотрит в репу а просто делает чтобы делать

У меня сегодня штук 20 тасков на Medium нормальн завершились и вроде меня устраивает

High кстати тоже мозги ебал в 4 раза дольше Medium, но хотя бы смог закончить задачу

Low боюсь в кодинг пускать потому что у него может быть обратная проблема.

Я прогнал Low на маркет скан задачах, и получилось так:

Low 1%
Medium 8%
High 46%
Xhigh 88%
Max - не смог закончить

лоу возможно это типа как я хуй знает 5.4 nano. Для задач типа по файловой системе без креативности)

Medium для чего хош включая разработку
А остальное я хз как определить когда надо применять. Возможно по-нарастающей если medium с чем-то не справляется

Когда видишь такие разные результаты кажется что а вдруг блядь моя хуйня могла работать лучше...

Поэтому вайбкодить надо пьяным под ебейший рэп, если одинок и в Таиланде - с тайками под столом

Если на Антропике еще какие-то задачи ставишь то тогда с тайцами