Superintelligence CouncilСовет гения · sim.im

Search

topic: 06-tools ✕

2,121 passages, newest first · 11 ms

И то ща понял что это человек может судить, а не машина

у меня Sol называл самыми качественными письмами самые хуевые

Потому что его морализатор встроенный спокоен, а для него это самый главный вождь всех оценщиков

При этом Qwen давал письмам самую справедливую оценку, потому что он и писал и пишет все еще лучше всех

Ну а еще бенчмаркинг это ебать затратно по токенам

у меня есть один бенчмарк маркет скана, т.к. без него я бы помер уже понимать что там как - слишком много всего

Ну и один прогон бенча даже если ОДНУ штучку протестить там (изменили одну модель в ряду) - это

5-6% OpenAI
4% kimi
и по 8% с каждой из Qwen3.8 подписок

А если сложный тест закинуть мол "перебери вот эти варианты", то там спокойно полнедельной дозы со всех подписок тупо чтобы узнать с чем дальше работаем.

Когда задача хотя бы производственная - понятно зачем такие косты. А понять как на сегодняшний час конкретная модель работает относительно других - бестолковая задача при том что через час все будет иначе =)

Пока что кажется что Max заставить закидыванием посреди задачи работать иначе - не приводит к успеху

Она поначалу вроде как начала следовать, но за полчаса скатилась обратно

находит абсолютно незначимые для дела вещи и фиксит их + гоняет тесты по ним

Самое страшное - она даже не понимает над чем она работает

Вот эта тему с Unknown sender на самом деле не то что она думает

Если бы она поднялась на вертолете и посмотрела на всю схему - она бы это увидела, но она этого уже не сделает

в итоге она делает выводы не по всему функционалу в котором запущена чинить баги, а по отдельным рандомно взятым десяти строчкам этого функционала, и в такой работе смысла никакого нет абсолютно

скорее всего такая работа даже не сможет закончиться

Это Astra так выебуривает на Max =)

от Sol 5.6 Max это вообще ничем не отличается к сожалению

"Проверила. Да, я излишне раздробила заключительную часть работы. Это не был круг совсем бесполезных проверок, но подписи интерфейса и отдельные сценарии входа получали слишком много отдельных циклов выпуска.
Основная защита отправки уже выпущена: неизменный запрос до отправки, атомарный учёт результата, сохранение…

Вот это "Сохранение webhook до обработки" уже было реализовано

то бишь как и 5.6 Sol она повторно делает то что уже есть

причина - не смотрит в репу а просто делает чтобы делать

У меня сегодня штук 20 тасков на Medium нормальн завершились и вроде меня устраивает

High кстати тоже мозги ебал в 4 раза дольше Medium, но хотя бы смог закончить задачу

Low боюсь в кодинг пускать потому что у него может быть обратная проблема.

Я прогнал Low на маркет скан задачах, и получилось так:

Low 1%
Medium 8%
High 46%
Xhigh 88%
Max - не смог закончить

лоу возможно это типа как я хуй знает 5.4 nano. Для задач типа по файловой системе без креативности)

Medium для чего хош включая разработку
А остальное я хз как определить когда надо применять. Возможно по-нарастающей если medium с чем-то не справляется

Когда видишь такие разные результаты кажется что а вдруг блядь моя хуйня могла работать лучше...

Поэтому вайбкодить надо пьяным под ебейший рэп, если одинок и в Таиланде - с тайками под столом

Если на Антропике еще какие-то задачи ставишь то тогда с тайцами

Я даже рад что до кабинетика еще 5 часов ехать и выезжать только через 15 часов, потому что мы стока раз уже хоронили свои искристые эмоции за прошедшие 9 релизов самых-самых, что я не верю пока что это чудо продлится))) А за сутки здравия все равно нихуя не успеешь)

Как же хочется чтобы этот былой опыт устарел конечно же…

Опять же бота который бабки собирает и следит за чатом я еще в том году сделал. Это же тоже как бы проект, он работает, выполняет функцию.

В Аркомага вон люди играют тоже, в шахматы, в кс:)

Мне кажется это невозможно уже утверждать что вайбкодингом ничего нельзя сделать)
Через еще годик дрочки появятся вообще умопомрачительные вещи

Как делать дизайн и UI, если вы вообще в нем ничего не понимаете

Вчера написал пост про страдания из-за того, что приходится брать ответственность не только за код, но и за дизайн. И для меня это проблема. Потому что когда вайбкодишь решение, то на первое время можно откинуть экзистенциальные вещи типа чистоты кода, безопасности, багов и ориентироваться на результат…

Но когда дело касается визуала и удобства пользования, начинаются нюансы. Первое, что выдает тебе ИИ на запрос «создай сайт», - это сине-фиолетовый градиент, шрифт Inter и типичный скелет лендинга.

Кстати, в этом ИИ-слопе сайтов виноват популярный CSS-фреймворк Tailwind, они еще в 2019 году сделали индиго дефолтным цветом кнопок в своих компонентах, туториалы разошлись по всему гитхабу, и модели…

Создатель Tailwind Адам Уотан позже публично признал, что выбрал индиго не из дизайн-соображений, а как нейтральный плейсхолдер для демок. И этот оттенок лаванды уже прозвали "VibeCode Purple".

Ну а дальше начинается круговорот ИИ-слопа в природе веб-дизайна. Навайбкоженные сайты попадают в сеть, следующее поколение моделей учится уже на них, среднее самоусиливается. Плюс агент дополнительно сужает выбор до того…

И как же разорвать этот пурпурный круг, если нет дизайнерской насмотренности? Вот что я скормил своему агенту и себе:
— ui-skills.com - каталог скиллов по дизайн-инженерии для агентов. Внутри скиллы от shadcn, Anthropic, Эмиля Ковальски и других. Подключаешь через CLI или MCP, и агент начинает верстать по правилам, а не по своим генерическим привычкам
— ui.shadcn.com - стандарт индустрии…

Полностью бесплатно
— transitions.dev - каталог готовых переходов и микроанимаций. Открытие модалок, скелетоны, анимация цифр, ресайз карточек. Код копируешь или подключаешь агенту как отдельный skill. База бесплатная, остальное в Pro
— emilkowal.ski/ui/you-dont-need-animations - эссе Эмиля Ковальски (автор библиотек sonner и vaul) о том, когда анимации вредят. Например, что частые действия лучше не анимировать и все держать быстрее…

Чет такое чувство будто эта хуета турнирная даже работает))
Расскажите потом пожалуйста все неудобства баги итд в мелочах
все пофиксим и будут у нас турниры)
Потом этот же код можно будет адаптировать для всех остальных игр

More