Anton Gladkov · 2026-08-09 · source ↗ · whole document (11)
Тэкс, ну короче гайз как вы знаете я занимаюсь некрофилией поебывая свой давно у
Но я не сдаюсь.
И вот сегодня я получил колоссальные результаты, и осталось В КОТОРЫЙ СУКА РАЗ провести эксперимент не на конкретном сете моделей в которые я верю, а на разных моделях, и сравнить каждый сегмент меж собой, чтобы понять какой из раннеров пускать на какой модели для максимальной комбинаторной эффективности.
По-сути мне надо было просто прогнать весь маркет скан (все 4 его сессии) на каждой из моделей, несколько раз, и получить средние значения, которые можно будет считать репрезентативными.
Опять же, поскольку я это делаю не первый и не третий десяток раз, я думаю что результат реально репрезентативный, а не то что "кто-то что-то сделал и посчитал это бенчмарком".
Я бы хуйню вам рандомную после таких мучений показывать не стал, потому что мне потом еще отвечать за это когда я начну кому-то из вас продавать этот солюшен за сука филки;))))))
Следующим сообщением прилетит обезличенный но достаточный для понимания разницы между моделями в креативном поле итог этого гигантского теста, который занял весь сегодняшний день. Вы увидите средние значения за вереницу повторных перепроходов самых звучных моделей.
Единственное что я не смогу вам показать - это Fable 5 и Opus 5, поскольку их уже нет в моем ростере, но я не грущу по ним абсолютно, поскольку я уже и так знаю на базе ДЕСЯТКОВ экспериментов как бы они себя показали. Fable показал бы себя хуже чем Opus. Fable вообще весьма посредственен на текущем поле в вопросах глубины креатива по текстам и смыслам вокруг единицы качества текстов. Opus сильно лучше, он ноздря в ноздрю хуярится с GPT 5.5 xhigh, поскольку это по-сути модели которые и конкурируют друг с дружкой в нише. Однако GPT 5.5 Xhigh стабильнее. Вообще стабильность GPT 5.5 Xhigh поражает. Эта модель далеко не такая креативная как QWEN3.8MAX в тексте, но QWEN3.8MAX может как-то пидорасить, в том числе он может просто не ответить блядь на апи запрос, тогда как GPT 5.5 xhigh это самая стабильная модель в природе. Она будет выдавать свои 7/10 в текстах настолько стабильно что даже если прогнать ее 1000 раз на 1000 текстах каждый раз, качество будет ровно такое какое ты ожидаешь. Это не очень хорошо для тех кто не готов прописать ебейшие трактаты методологии качества для опоры раннера, но это ебать как хорошо для таких как я =)
Я в итоге конкретно по Writing юзаю QWEN3.8MAX с фоллбеком на GPT 5.5 xhigh, где фоллбек хитрый - они обе будут всегда писать контент, просто судья должен будет выбрать из двух, и в 30% случаев он выбирает 5.5 xhigh, что невероятно крутой результат для модели которой уже много месяцев.