Superintelligence CouncilСовет гения · sim.im

Anton Gladkov · 2026-09-06 · source ↗ · whole document (25)

1) Промпт должен описывать подробнейше причинно-следственные связи из твоей голо

и смысла в этом не было бы даже если бы можно было

потому что модель за последние 2 суток изменили тридцать раз

Весь прикол в том что она "в среднем выдает за Х усилий от хумана"

Я понимаю как в бенчмарк запихать например качество текста, которое можно распедалить на десятки параметров

И то ща понял что это человек может судить, а не машина

у меня Sol называл самыми качественными письмами самые хуевые

Потому что его морализатор встроенный спокоен, а для него это самый главный вождь всех оценщиков

При этом Qwen давал письмам самую справедливую оценку, потому что он и писал и пишет все еще лучше всех

Ну а еще бенчмаркинг это ебать затратно по токенам

у меня есть один бенчмарк маркет скана, т.к. без него я бы помер уже понимать что там как - слишком много всего

Ну и один прогон бенча даже если ОДНУ штучку протестить там (изменили одну модель в ряду) - это

5-6% OpenAI
4% kimi
и по 8% с каждой из Qwen3.8 подписок

А если сложный тест закинуть мол "перебери вот эти варианты", то там спокойно полнедельной дозы со всех подписок тупо чтобы узнать с чем дальше работаем.

Когда задача хотя бы производственная - понятно зачем такие косты. А понять как на сегодняшний час конкретная модель работает относительно других - бестолковая задача при том что через час все будет иначе =)