Superintelligence CouncilСовет гения · sim.im

Search

topic: 05-ai ✕

2,501 passages, newest first · 25 ms

К сожалению никто из рисечеров не может ответить на вопрос что же будет когда появится AGI. Уверен они и сами не знают. Как когда-то было с ядеркой и всякими такими большими делами.

Но они на то и рисечеры, чтобы подмечать всякие детальки. Например, они знают что у мыши которая больше других вращает своими лапками получается сожрать в среднем больше…

Всем кто ведется на посты очкариков в одноклассниках и линкедине, которые увидели рекламу нового мак-мини и возомнили себя датацентром когда накопят взять эту железку будущего в кредит:

Я сейчас очень задротно гоняю функционал интервью, задача которого вытащить из клиента нужную инфу, аккуратно развлекая его при этом, и написать потом правильно структурированную статью, из которой куски будут улетать в JSON…

То бишь модель должна чатиться и в конце осмыслить весь чат, прогнать его смыслы через детерминированные доктрины, получить на этом недетерминированный интеллектуальный результат, увернуться от промпт-инжекшенов и людей которые захотят попродавать расчлененку и прочую чернуху разного рода, но при этом не грохнуть никого кто хочет продавать серое.

Звучит как-то нарастающе сложно, однако даже упомянутая ранее 4о и та бы с таким справилась.

Я попросил 5.6 Sol Max, Kimi K3, и qwen3.8-max параллельно гонять тесты, и их задача брать все модели рынка, bottom-up (от тупых к умным), и гонять по 100 задач на каждой, чтобы понять способности, стабильность, и определить финалистов по которым…

Бюджет на весь эксперимент ~800 баксов. Но для меня качество в этом месте очень важно, поэтому и многим больше солью если придется) До этого там чекинились Qwen3.8-max low и 5.6 Sol Low, но себя не оправдали каждая по своим причинам, и теперь я понимаю что мне надо будет там слоеный пирожок моделей выстраивать чтобы работало как мне…

Так вот: эксперимент идет уже давно, и сейчас дошло до GLM 5 и Qwen3-max.

Даже на облачке эти модели показывают результаты настолько ниже заданного минимального бэйслайна, что их активностью можно впринципе пренебречь. Абсолютно бесполезное говно.

Я понимаю зачем в заводских условиях могут быть нужны такие модели. У меня когда-то был товарищ который делал элементарную автоматизацию на машинлернинге типа "фоткаем курицу, с помощью машинного зрения определяем есть ли на ней целлофан, если да - лампочка моргает один раз, если нет - два раза".

Поэтому они и существуют.

Но я слабо представляю себе чтобы люди с такими задачами сидели в чате в телеграме и вообще могли это прочитать или обсуждать.

А все кто сидят в телеграме и читают/обсуждают как они будут на говне за тыщу долларов (а мак мини нормально так ебёт кошелек кстати, он в норм компле тыщи четыре стоит?!) гонять безлимитный…

боюсь спросить как ты хотел бы чтобы модель тебя воспринимала? =)
Типа чтобы она догадывалась что ты на самом деле не это имел в виду просто у тебя такое настроение сегодня? =)

да она не юзабельна просто для кодинга
для дизайна норм
Нельзя кодить на хуйне которая учитывает 2% от играющих параметров, и даже в части из них допускает ошибки. Это разрушение репы а не разработка.

Тут просто опять блядь с людьми обсуждать что поумнело или отупело бесполезно в отрыве от того что они делают
Мне тут недавно чел залечивал что Опус 5 самая сильная модель
Но его репа это 30 тыщ строк кода какого-то трейдингового бота ссаного
Я не знаю как ему передать картинку из своей головы где Opus делая одну фичу ломает все…

Разработка это же сотни файлов надо открыть, сделать по ним какие-то выводы, какие-то правки внести, итд
Достаточно в двух местах ошибку допустить и урона уже больше чем пользы
Эта хуета допускает ГРАНДИОЗНЫЕ ошибки в каждом втором вопросе который я ей задаю.

О какой серьезной разработке может идти речь?
Я уже отписался от этой залупы потому что реально пропал какой-либо реальный юзкейс для кими
Просто время проебал с ней две недели
В итоге все что я на ней пытался сделать за прошедший месяц переделывал Sol чтобы это хоть как-то заработало
И надо признать что он переписал тупо всем сам с…

GPT?
Я прямо сейчас в процессе нереальной битвы с OpenAI по теме морализма
короче я выяснил что у модели тупо веса выстроены таким образом что если в наборе осмысляемых токенов есть что-то что вызывает у модели хоть какие-то подозрения на потенциальный фрод или нарушение чего-либо, модель на всякий случай (и это самое страшное) сходит с ума
И…

Ну вот ты показал выше в письме насколько у тебя они окей
Причем это только то что ты увидел
Попроси модель глянуть какие заградительные / предосторожные / итд меры сейчас приняты в твоем коде там-сям, что угодно что похоже на это пусть найдет)
Ты охуеешь
У меня GPT заложила 38 таких бомб в систему
при том что я не просил и…

ужасное письмо btw
Люди так не пишут
И не читают
это не доказывает ничего
тебе ответ придет на письмо "хуй"
Это не значит что эти письма надо слать)
Ну вот у меня клиент например кроме прочих фактов утверждает что проводит расчет FX по курсу кракена на сию секунду
Так вот GPT нельзя заставить этот факт упомянуть в письме
Когда начинаешь…

Частично Qwen частично Kimi
С упором на Qwen
Короче я сейчас в жопе, в том плане что Kimi отупела настолько что она уже вообще не может ничего по скриптам
А OpenAI ужесточился настолько что когда его просишь хоть что-то поделать по скриптам он делает это и херит в два раза больше чем сделал не потому что он не способен…

🏰 «Башенная среда» — итоги

🥇 @AGI_Medicine 👑
🥈 @fedot
🥉 @Palmin
🥉 @Disorrder
5. @avkcom
5. @Nikita_tsn
5. @Drozdovich

👑 Чемпион — @AGI_Medicine со счётом 2:1! Он забирает: медаль к никнейму, прозвище «Башенный чемпион» на неделю, +100 к рейтингу Arcomage, 500 🏔 KC и 1000 очков клану!

Следующая среда, 22:00 МСК — новая сетка. Регистрация уже открыта…

Должен признать, я сказал хуйню.

GPT 5.6 Sol хоть Max хоть Хуякс - полная хуйня в дизайне по сравнению и с Opus 5 (через claude design) и с Kimi K3 (через kimi.ai/websites).

Помутнение случилось из-за метода сравнения.

Я попросил 5.6 Sol Max замутить десяток видов дизайна в четырех исполнениях для сравнения, и сравнил результаты.

Однако почему-то то что я прошу по дизайну сам отдельно в kimi.ai/websites или в claude design в миллиард раз круче чем то что выдают модели по запросу на дизайн в кодексе.

More