Anton Gladkov · 2026-08-09 · source ↗ · whole document (21)
Market Scan Model Benchmark - Human Scorecard Generated: 2026-08-08T22:35:20.254
## Caveats
This benchmark answers writer interchangeability. It does not prove production routing, paid/provider sourcing totals, lead purchase quality, deliverability, or Kimi judge acceptance. A production split-model Market Scan would need a small governed implementation: preserve Qwen as baseline, add explicit stage routing, keep deterministic validation to JSON/transport/math only, then compare with Kimi judge and a bounded live free-measurement smoke.
Я понимаю что нихуя не понятно из текста выше, но это потому что вы не утрудились скормить это своей GPT или Claude и поговорить об этом =)
GPT 5.5 xhigh находит 26 гипотез там где GPT 5.6 Sol Max находит 28, что говорит о том что GPT 5.5 xhigh невероятная модель всё еще на сегодняшний день, однако SOL MAX достаточно заебистый чтобы найти ~2300 связок названий компаний и должностей там где GPT удовлетворяется на ~450.
А маркет скан нет смысла делать снова и снова - ты его делаешь раз в жизни чтобы запланировать работу на весь следующий год.
То бишь GPT 5.5 Xhigh дает тебе по тем же гипотезам Total Addressible Market capacity ~ в 4-5раз ниже чем GPT 5.6 Sol Max.
И все это стоит просто лишних 20-30 минут заебистого рассуждения модели.
Вы не в моей нише, поэтому вы не понимаете насколько это важно, но это блядь важно просто шо пиздец)
И другие цифры там есть веселые которые можно трактовать занятным образом, оставляю вас гадать на них. Когда я релизну свой продукт я думаю все в итоге объяснится его же юзерами которые будут тут рассказывать свои наблюдения)
Резюмируя: в мелочах кажется что модели недалеко друг от друга ушли, но правда в том что GPT 5.6 Sol Max ушел от GPT 5.5 xhigh настолько далеко, что он выдает в бизнес выражении контента за лишние 15 минут рассуждения как разница между 1 годом и 10 годами скурпулезной работы отдела продаж по рисечу.
Это реально кроме шуток ускорение отдела продаж в 8 раз на десятилетнем отрезке, за лишние 20 минут копеечного палева токенов.
Это сравнение для самых маленьких. Если там копаться в деталях, мы легко найдем ещё бОльшее ускорение, а так же вещи которые предыдущими моделями просто в принице были недостижимы, типа определенных игрищ текстовыми конструкциями, но сегодня нет сил расписывать это)