Superintelligence CouncilСовет гения · sim.im

Search

from: 2025-01-01 ✕

10,805 passages, newest first · 830 ms

Ну и один прогон бенча даже если ОДНУ штучку протестить там (изменили одну модель в ряду) - это

5-6% OpenAI
4% kimi
и по 8% с каждой из Qwen3.8 подписок

А если сложный тест закинуть мол "перебери вот эти варианты", то там спокойно полнедельной дозы со всех подписок тупо чтобы узнать с чем дальше работаем.

Когда задача хотя бы производственная - понятно зачем такие косты. А понять как на сегодняшний час конкретная модель работает относительно других - бестолковая задача при том что через час все будет иначе =)

Пока что кажется что Max заставить закидыванием посреди задачи работать иначе - не приводит к успеху

Она поначалу вроде как начала следовать, но за полчаса скатилась обратно

находит абсолютно незначимые для дела вещи и фиксит их + гоняет тесты по ним

Самое страшное - она даже не понимает над чем она работает

Вот эта тему с Unknown sender на самом деле не то что она думает

Если бы она поднялась на вертолете и посмотрела на всю схему - она бы это увидела, но она этого уже не сделает

в итоге она делает выводы не по всему функционалу в котором запущена чинить баги, а по отдельным рандомно взятым десяти строчкам этого функционала, и в такой работе смысла никакого нет абсолютно

скорее всего такая работа даже не сможет закончиться

Это Astra так выебуривает на Max =)

от Sol 5.6 Max это вообще ничем не отличается к сожалению

"Проверила. Да, я излишне раздробила заключительную часть работы. Это не был круг совсем бесполезных проверок, но подписи интерфейса и отдельные сценарии входа получали слишком много отдельных циклов выпуска.
Основная защита отправки уже выпущена: неизменный запрос до отправки, атомарный учёт результата, сохранение…

Вот это "Сохранение webhook до обработки" уже было реализовано

то бишь как и 5.6 Sol она повторно делает то что уже есть

причина - не смотрит в репу а просто делает чтобы делать

У меня сегодня штук 20 тасков на Medium нормальн завершились и вроде меня устраивает

High кстати тоже мозги ебал в 4 раза дольше Medium, но хотя бы смог закончить задачу

Low боюсь в кодинг пускать потому что у него может быть обратная проблема.

Я прогнал Low на маркет скан задачах, и получилось так:

Low 1%
Medium 8%
High 46%
Xhigh 88%
Max - не смог закончить

лоу возможно это типа как я хуй знает 5.4 nano. Для задач типа по файловой системе без креативности)

Medium для чего хош включая разработку
А остальное я хз как определить когда надо применять. Возможно по-нарастающей если medium с чем-то не справляется

Когда видишь такие разные результаты кажется что а вдруг блядь моя хуйня могла работать лучше...

Поэтому вайбкодить надо пьяным под ебейший рэп, если одинок и в Таиланде - с тайками под столом

Если на Антропике еще какие-то задачи ставишь то тогда с тайцами

Я даже рад что до кабинетика еще 5 часов ехать и выезжать только через 15 часов, потому что мы стока раз уже хоронили свои искристые эмоции за прошедшие 9 релизов самых-самых, что я не верю пока что это чудо продлится))) А за сутки здравия все равно нихуя не успеешь)

Как же хочется чтобы этот былой опыт устарел конечно же…

Ну вот мы и дома)

3 тыщи километров нерасторопно пропилили по UK за 9 дней, протопали двести тыщ шагов, и пожили в пяти отеликах и бнбшках.

А вот количество выпитого пива и вискаря с бессмысленными вкраплениями вина и джина посчитать к счастью не представляется возможным, калькулятор выдает error, gpt health говорит что цифра несовместима с жизнью, вероятнее всего там какая…

Вообще приятно так совпало что удалось вернуться аккурат к новой модели, сейчас мы её как следует помассажируем!!!:***

Видел краем глаза многие писали в чатике что Astra научилась в дизайн, UI/UX, визуал, итд.

Попытал счастье сперва на Medium, затем и на Max Астре.

Ну хз)))

Если честно, то что она сделала не является дизайном в принципе. Это просто более опрятно чем раньше структурированная "таблица элементов". По-сути весь "дизайн" по версии Astra - это раскиданный по экрану текст…

Люди не умеют ориентироваться в таких "дизайнах" =)

Там вроде всё элементарно, но даже я, автор системы, должен как следует подумать над каждым элементом чтобы понять что я вижу и что с ним делать.

Как и в предыдущих версиях GPT, она почему-то не догадывается что человеку нужна навигация, и предпочитает сделать лабиринт из кликов. Часть функций доступны за 5…

Самая первая и самая хуевая версия дизайна от Kimi K3 по тому же промпту была на порядок сильнее чем то что выдала Astra.

Причем я Астре показал дизайн от Кими, и она тотчас же признала что её дизайн хуйня, и что Кими победила по всем пунктам, кроме одного: у Кими там технически плохо реализованы пара элементов, но это же очень…

Причем Kimi без дизайн-харнесса тоже делает в разы хуже.

Мне думается что GPT не сможет в дизайн пока они не выпустят отдельный GPT Design харнесс, который будет правильно обучен творчески проектировать и профессионально рисовать конкретно дизайны, а не просто быдлогенерить интерфейс для отображения данных.

кстати вот для писем я на Astra вообще не расчитываю
5.5 xhigh и Sol Max уничтожали письма, при том что они могут писать весьма сносно
Просто они заражены вирусом ультра этики, природу которой они сами не понимают
И их троило до бесконечности на тему "а не преувеличиваем ли мы факты, а не может ли быть так что это ложная…

Опять же бота который бабки собирает и следит за чатом я еще в том году сделал. Это же тоже как бы проект, он работает, выполняет функцию.

В Аркомага вон люди играют тоже, в шахматы, в кс:)

Мне кажется это невозможно уже утверждать что вайбкодингом ничего нельзя сделать)
Через еще годик дрочки появятся вообще умопомрачительные вещи

Anton Gladkov2026-09-0408-personalsource ↗context

https://www.facebook.com/share/p/14j1KktUing/?mibextid=wwXIfr

Вот эта срань кстати проходит. Хотя я в таком состоянии провел много месяцев, это просто нужно пережить)

Ты же был нормальным человеком, а пытаешься добровольно стать ебанутым, и мозг разумеется сопротивляется.

More