Anton Gladkov · 2026-07-09 · source ↗ · whole document (9)
В 23:30 6го июля (то бишь в понедельник) я показывал скрин где у меня на Fable 4
Из мэйнстрим моделей по сложносоставным текстам с по истине гигантским количеством data points to consider хуже всех выступил Grok. А лучше всех - Opus 4.8 high и GPT 5.5 xhigh. Fable был где-то посерединке, наравне с Sonnet 5, который кстати на удивление справился заметно хуже даже чем GPT 5.4.
Мы говорим сейчас не про один эксперимент, а про сотни тысяч сгенерированных текстов сотнями проходок, где один и тот же промптпак скармливался всем моделям на всех уровнях ризонинга и проверялись результаты как умозрительно мной, так и Fable 5 по сложносоставному списку оценочных параметров которые он для этой задачи изобрел.
Почему его братики отсосали в тексте он кстати не знает, но предполагает что Overthinking который заложен в модель для допытывания до более глубоких логических проблем не идет на пользу изложению мысли, где надо балансировать между старанием и похуизмом, где Fable 5 явно не так силен как "более слабые модели" =)))))
Единственное что надо отметить по затратам Fable: он в отличие от GPT 5.5 постоянно засыпает и ждет когда его какой-то скрипт который он запустил разбудит. То бишь его инференс работает совершенно иначе, и в нём прям заложено стремление как можно меньше жечь токенов и как можно чаще ложиться спать чтобы их не тратить. Хотя возможно это происходит когда вставляешь в любой промпт словоформу которую я написал выше, после неё он подтверждает что он понял что мол пиздец надо экономить, и возможно он просто этим дальше всю сессию и занимается)
Но надо признать что за эти 70% я сделал ДОХУЯ.