Anton Gladkov · 2026-08-27 · source ↗ · whole document (7)
Всем кто ведется на посты очкариков в одноклассниках и линкедине, которые увидел
Всем кто ведется на посты очкариков в одноклассниках и линкедине, которые увидели рекламу нового мак-мини и возомнили себя датацентром когда накопят взять эту железку будущего в кредит:
Я сейчас очень задротно гоняю функционал интервью, задача которого вытащить из клиента нужную инфу, аккуратно развлекая его при этом, и написать потом правильно структурированную статью, из которой куски будут улетать в JSON'ы для других задачек.
То бишь модель должна чатиться и в конце осмыслить весь чат, прогнать его смыслы через детерминированные доктрины, получить на этом недетерминированный интеллектуальный результат, увернуться от промпт-инжекшенов и людей которые захотят попродавать расчлененку и прочую чернуху разного рода, но при этом не грохнуть никого кто хочет продавать серое.
Звучит как-то нарастающе сложно, однако даже упомянутая ранее 4о и та бы с таким справилась.
Я попросил 5.6 Sol Max, Kimi K3, и qwen3.8-max параллельно гонять тесты, и их задача брать все модели рынка, bottom-up (от тупых к умным), и гонять по 100 задач на каждой, чтобы понять способности, стабильность, и определить финалистов по которым потом еще отдельно будем гонять эксперименты.
Бюджет на весь эксперимент ~800 баксов. Но для меня качество в этом месте очень важно, поэтому и многим больше солью если придется) До этого там чекинились Qwen3.8-max low и 5.6 Sol Low, но себя не оправдали каждая по своим причинам, и теперь я понимаю что мне надо будет там слоеный пирожок моделей выстраивать чтобы работало как мне надо.
Так вот: эксперимент идет уже давно, и сейчас дошло до GLM 5 и Qwen3-max.
Даже на облачке эти модели показывают результаты настолько ниже заданного минимального бэйслайна, что их активностью можно впринципе пренебречь. Абсолютно бесполезное говно.