Anton Gladkov · 2026-08-09 · 01-market-scan · source ↗
Тэкс, ну короче гайз как вы знаете я занимаюсь некрофилией поебывая свой давно у
Тэкс, ну короче гайз как вы знаете я занимаюсь некрофилией поебывая свой давно уже отрафированный вайбкодингом мозг уже как говорят историки "с незапамятных времен".
Сегодня я хвастался сам перед собой воистину грандиозным прорывом: я добился такого качества маркет скана, которое выше чем то что я когда-либо делал собственными руками. Я даже за 100к долларов не смог бы потратить достаточно времени и когнитивных усилий чтобы сделать такое качество такой ширины за год работы, которое теперь маркет скан способен сделать вообще без моего участия, без нажатия мной единой кнопки или даже бытия в курсе что он происходит.
Это ровно то что мне нужно для того чтобы в ближайшем будущем зарелизить мой self-serve SLSBMB AI, к чему я так яростно стремлюсь последние несколько месяцев.
Сказать что я неоднократно запускал тесты на разные модели чтобы понять на каких моделях маркет скан отрабатывает лучше всего - ничего не сказать. Думаю что я спалил десятки миллиардов токенов на эти эксперименты.
В пике безумие доходило до того что один маркет скан ДЛЯ ОДНОГО ПРОДУКТА использовал ~290-500 ПОСЛЕДОВАТЕЛЬНЫХ СЕССИЙ БЛЯДЬ. Рекордный такой ран занимал изи 2.5 дня.
В итоге мне удалось зарефайнить макулатуру на которой живет маркет скан и все раны таким образом, что достаточно 4 последовательных сессий: Research (до 50 минут), Writer (до 50 минут), Market Arms (как называются типы компаний и должности кторым будем писать, до 50 минут), и судья (проверяет всё сделанное 3мя предыдущими сессиями по гигантскому чеклисту, и может отдельные куски отправлять на доработку).
Я уже сказал что я делаю конкретно эту систему несколько месяцев, и она выпила всю мою кровь, а так же сперму, пропитку тканей слезных желез, и секрет простаты.
Я занимаюсь этим круглосуточно, и меня это порядком заебало.
Но я не сдаюсь.
И вот сегодня я получил колоссальные результаты, и осталось В КОТОРЫЙ СУКА РАЗ провести эксперимент не на конкретном сете моделей в которые я верю, а на разных моделях, и сравнить каждый сегмент меж собой, чтобы понять какой из раннеров пускать на какой модели для максимальной комбинаторной эффективности.
По-сути мне надо было просто прогнать весь маркет скан (все 4 его сессии) на каждой из моделей, несколько раз, и получить средние значения, которые можно будет считать репрезентативными.
Опять же, поскольку я это делаю не первый и не третий десяток раз, я думаю что результат реально репрезентативный, а не то что "кто-то что-то сделал и посчитал это бенчмарком".
Я бы хуйню вам рандомную после таких мучений показывать не стал, потому что мне потом еще отвечать за это когда я начну кому-то из вас продавать этот солюшен за сука филки;))))))
Следующим сообщением прилетит обезличенный но достаточный для понимания разницы между моделями в креативном поле итог этого гигантского теста, который занял весь сегодняшний день. Вы увидите средние значения за вереницу повторных перепроходов самых звучных моделей.
Единственное что я не смогу вам показать - это Fable 5 и Opus 5, поскольку их уже нет в моем ростере, но я не грущу по ним абсолютно, поскольку я уже и так знаю на базе ДЕСЯТКОВ экспериментов как бы они себя показали. Fable показал бы себя хуже чем Opus. Fable вообще весьма посредственен на текущем поле в вопросах глубины креатива по текстам и смыслам вокруг единицы качества текстов. Opus сильно лучше, он ноздря в ноздрю хуярится с GPT 5.5 xhigh, поскольку это по-сути модели которые и конкурируют друг с дружкой в нише. Однако GPT 5.5 Xhigh стабильнее. Вообще стабильность GPT 5.5 Xhigh поражает. Эта модель далеко не такая креативная как QWEN3.8MAX в тексте, но QWEN3.8MAX может как-то пидорасить, в том числе он может просто не ответить блядь на апи запрос, тогда как GPT 5.5 xhigh это самая стабильная модель в природе. Она будет выдавать свои 7/10 в текстах настолько стабильно что даже если прогнать ее 1000 раз на 1000 текстах каждый раз, качество будет ровно такое какое ты ожидаешь. Это не очень хорошо для тех кто не готов прописать ебейшие трактаты методологии качества для опоры раннера, но это ебать как хорошо для таких как я =)
Я в итоге конкретно по Writing юзаю QWEN3.8MAX с фоллбеком на GPT 5.5 xhigh, где фоллбек хитрый - они обе будут всегда писать контент, просто судья должен будет выбрать из двух, и в 30% случаев он выбирает 5.5 xhigh, что невероятно крутой результат для модели которой уже много месяцев.
Ну а лидера по остальным критериям я думаю вы легко увидите. Многие думают что Fable конкурент Sol, но в рисеч задачах Fable показывает В 5 И БОЛЕЕ РАЗ ниже цифры чем Sol. На моих этих вот креативных задачах это просто факт. Fable рядом с Kimi. Sol Max где-то в космосе.
Еще бы эта пизда умела кодить без ухода в безумие, цены бы не было. На рисеч и райтинг задачах Sol Max удивительным образом не уходит в безумие. Он реально сам доделывает всю работу и закругляется за 50 минут (против 17 минут 5.5 xhigh). На кодинговых задачах он не закругляется в целом никогда, во всяком случае я ни разу не дождался, тупо принудительно завершая его на 15-50м часу работы.