Так вот: эксперимент идет уже давно, и сейчас дошло до GLM 5 и Qwen3-max.
Даже на облачке эти модели показывают результаты настолько ниже заданного минимального бэйслайна, что их активностью можно впринципе пренебречь. Абсолютно бесполезное говно.
734 passages, newest first · 8 ms
Так вот: эксперимент идет уже давно, и сейчас дошло до GLM 5 и Qwen3-max.
Даже на облачке эти модели показывают результаты настолько ниже заданного минимального бэйслайна, что их активностью можно впринципе пренебречь. Абсолютно бесполезное говно.
Я понимаю зачем в заводских условиях могут быть нужны такие модели. У меня когда-то был товарищ который делал элементарную автоматизацию на машинлернинге типа "фоткаем курицу, с помощью машинного зрения определяем есть ли на ней целлофан, если да - лампочка моргает один раз, если нет - два раза".
Поэтому они и существуют.
Но я слабо представляю себе чтобы люди с такими задачами сидели в чате в телеграме и вообще могли это прочитать или обсуждать.
А все кто сидят в телеграме и читают/обсуждают как они будут на говне за тыщу долларов (а мак мини нормально так ебёт кошелек кстати, он в норм компле тыщи четыре стоит?!) гонять безлимитный…
Ну вот такого плана фидбек и нужен, сделаем чтобы все было удобно и наглядно
к сожалению AI не умеет по запросу "сделай удобно и наглядно"
Пока не пожрешь этот гранит нихуя не будет
Я на дизайн происходящего в SLSBMB AI потратил уже больше времени чем на саму техническую часть
раза в два
модели не просто отвратительно делают продуктовый дизайн, а…
Чисто по себе сужу. Я не вижу никакого смысла в покере в котором нажатие на кнопку all in ничего не стоит
для клиентов
я просто губу раскатал пиздец
чтобы не было нейрослопно, чтобы было секси, и чтобы было понятно, и чтобы было минималистично но в то же время чтобы было всё, и чтобы не потеряться
математическая матрица проблем которые надо преодолеть соответственно просто грандиозная получилась
но продукт очень сложносоставной и технически сложный, поэтому LLM если сказать мол сделай какой-нибудь дизайн…
Хмм, за последние пару месяцев я потратил всю свою кровь до последней капли, а так же всю кровушку всех остальных жителей Ноттинг Хилла, чтобы оказаться в той точке со своей многострадальной репой, в которой оказался.
И вот, до запуска мне осталось по-сути только допилить дизайн некоторых client-facing систем, потому что в тех что у меня былы сварганены на быструю руку я даже сам терялся, а значит у человека который не делал эту систему все эти долгие месяцы не было бы вообще никаких шансов:DDD
Исторически Codex и GPT в нём очень хреново делали дизайн. Настолько хреново что я больше как бы и не пробовал.
С марта месяца (или когда там выпустили Claude Design?) я фигачил дизайны антропиком. Это в общем-то единственное на что тамошние модели пригодны по подписке.
На прошлой неделе я распробовал Kimi. Во многом конечно поведшись на маркетинговые бенчмарки, которые утверждали что Кими на 30% круче фэйбла в дизайне, который в свою очередь круче всех остальных на рынке.
Kimi делала хороший дизайн, мне понравилось. Не могу сказать что он шикарный. И 30% разницы с Фэйблом я тоже не увидел. Просто опрятный дизайн. Не хуже, и на том спасибо)
Ещё меня конечно подкашивал в отношении Codex'a по части дизайна наш с вами разговорный чатик, где ни разу никто не пел серенады дизайнеру-GPT, однако каждый второй день кто…
Я верю чатику, ведь кому ещё верить, больше у меня в окружении истинных задротов этого нашего дельца как бы и нет =(((
И вот появился Ox Alpha, и люди начали говорить что мол он дизайн рисует сильно пизже чем Kimi.
Сегодня у меня Codex переколбашивал моделькой 5.6 Sol Max добрых 10 часов продукт со старого UI-франкенштейна состоящего из рандомно натыканных в разные времена фреймворков и местами тупо голого html/css на связку React + Tailwind CSS 4 + shadcn-подход + Base UI + собственная SLSBMB Design System.
Эта связка родилась после того как я прогнал на шести разных моделях + GPT PRO задачу изучить под лупой мой проект, разобраться досканально в разных уровнях логики данного проекта и прикинуть какой из технологических наборов по UI лучше всего нам подойдет при условии что 100% усилий по разработке и настройке всего этого дерьма делали и далее будут делать исключительно LLM-ки…
В итоге каждая из моделей предложила разные варианты связок, разложив сильные и слабые стороны, но 10 из 10 по всем пунктам они поставили именно этой связке выше. Не сговариваясь, с пересечением реально на 97%. Единственное где они расходились дважды это Regex vs Base UI.
Я тут же нагуглил что Shadcn туса этим летом отказалась от Regex в пользу Base UI и решил что это знак, и застеклил свой выбор.
В итоге новенький фронт внедрен, и пора заниматься недостающими апгрейдами по дизайну, а кем его делать я чето не понял. В итоге я пошел к Codex'у, и попросил сделать одну большую жирную правку на…
И кто бы мог подумать - хуже всех с задачей справился Ox Alpha.
А лучше всех... GPT 5.6 Sol Medium!?!?!?!
Я попробовал еще разок - и снова, GPT 5.6 Sol Medium всех уделал с большим запасом.
Причем лучше чем у других всё. И цвета, и понимание зачем нужны экраны и какие болезни у каждого из них, какую задачу мы решаем…
Вопросик к чату: а почему никто не хвалит-то Sol по части дизайна?!?! Вы как и я просто давно не пробовали, или это волшебный сет React + Tailwind CSS 4 + shadcn-подход + Base UI + собственная SLSBMB Design System так сработал?
GPT кстати сказал что я весьма недооценивал всю дорогу правильный выбор технологий для фронта, и это расхожая проблема на рынке. Некоторые люди выбирают "модные" фреймворки по которым модель выдает точность меньше 30%, тогда как на соседнем на котором ее тренировали особенно хорошо она давно чеканит соточку. Может быть это я и наблюдаю? =)
Но только это не объясняет почему на этом же наборе все остальные так жестко соснули.
При условии что у Codex свой встроенный прям в Codex инструмент дизайна удобнейший, самый лучший генератор картинок, шикарное понимание анимаций и спецэффектов, меня очень огорчало что он дизайнит хуже. Если это пофиксилось, то одним (большим) головняком меньше. А кими в таком случае не нужна больше…