Anton Gladkov · 2026-08-09 · source ↗ · whole document (11)
Тэкс, ну короче гайз как вы знаете я занимаюсь некрофилией поебывая свой давно у
Это ровно то что мне нужно для того чтобы в ближайшем будущем зарелизить мой self-serve SLSBMB AI, к чему я так яростно стремлюсь последние несколько месяцев.
Сказать что я неоднократно запускал тесты на разные модели чтобы понять на каких моделях маркет скан отрабатывает лучше всего - ничего не сказать. Думаю что я спалил десятки миллиардов токенов на эти эксперименты.
В пике безумие доходило до того что один маркет скан ДЛЯ ОДНОГО ПРОДУКТА использовал ~290-500 ПОСЛЕДОВАТЕЛЬНЫХ СЕССИЙ БЛЯДЬ. Рекордный такой ран занимал изи 2.5 дня.
В итоге мне удалось зарефайнить макулатуру на которой живет маркет скан и все раны таким образом, что достаточно 4 последовательных сессий: Research (до 50 минут), Writer (до 50 минут), Market Arms (как называются типы компаний и должности кторым будем писать, до 50 минут), и судья (проверяет всё сделанное 3мя предыдущими сессиями по гигантскому чеклисту, и может отдельные куски отправлять на доработку).
Я уже сказал что я делаю конкретно эту систему несколько месяцев, и она выпила всю мою кровь, а так же сперму, пропитку тканей слезных желез, и секрет простаты.
Я занимаюсь этим круглосуточно, и меня это порядком заебало.
Но я не сдаюсь.
И вот сегодня я получил колоссальные результаты, и осталось В КОТОРЫЙ СУКА РАЗ провести эксперимент не на конкретном сете моделей в которые я верю, а на разных моделях, и сравнить каждый сегмент меж собой, чтобы понять какой из раннеров пускать на какой модели для максимальной комбинаторной эффективности.
По-сути мне надо было просто прогнать весь маркет скан (все 4 его сессии) на каждой из моделей, несколько раз, и получить средние значения, которые можно будет считать репрезентативными.
Опять же, поскольку я это делаю не первый и не третий десяток раз, я думаю что результат реально репрезентативный, а не то что "кто-то что-то сделал и посчитал это бенчмарком".