Superintelligence CouncilСовет гения · sim.im

Search

topic: 06-tools ✕

2,121 passages, newest first · 53 ms

Обман мозга в том что крупное в разработке руками AI ничем не проще чем мелкое, а ДОПИЛИВАНИЕ - это по-сути плеяда мелких склеек всех крупных кусков меж собой для безшовного и безглючного и понятного и адекватного время/деньгозатратам пользовательского опыта.

В процессе ошибочно кажется что все эти "кодовые материки" имеют самое главное значение.

А мелкие штуки меж ними – они же не просто так "мелкие". Они же меньше кода весят, меньше времени занимают соответственно как на планирование так и на разработку.

Но это ебейший и самый коварный обман восприятия.

Это правда - крупную штуку было сложно запилить, а две крупные штуки в два а то и в четыре раза сложнее чем любую из них.

Но вот связать между собой полторы сотни таких штук - это перестает казаться возможным после неисчисляемых дней попыток это сделать, которые выдают куда более хуевый слабый результат чем даже…

Модели тут ну очень плохо помогают. Они будто теряются перед всем этим засилием говна, и говорят между строк что-то в духе:

Братан ты сам виноват что тут столько говнища, тебе это и расхлебывать. Давай мне теперь инструкцию буквально построчную, и я тогда буду хотя бы пытаться делать, иначе иди нахуй, и пользуйся всеми этими фичами, которые мы пилили 3…

Ишь че захотел житель Гондураса: я ему всё кодь блядь как батрак последний, и я же еще ему рассказывай как эту всю хуйню теперь связать воедино. Нет уж: либо то либо это. А кодить ты не умеешь, поэтому тебе остается только это, понял, сучёк?

Понял...

не понимаю нихуя что ты имеешь в виду
если у тебя 2000 функций которые должны сработать как одно целое во всех возможных заданных сценариях, как поможет то что ты их раскидал по разным полкам?
Требования (твои собственные продуктово-визионерские) от того как ты расхуярил куски системы - никак не изменятся
Мне наоборот сложнее от того что у меня система в двух…

Или над "сендинговыми аспектами для B2B или B2C

Или над закупкой контактов в условиях вот таких-то категорий клиентов, итд

Я теперь должен умудриться прошить всё это серебряными нитками
Каждая задача над которой я работаю сейчас - должна учитывать ВСЮ ХУЙНЮ которую мы сделали до этого, иногда лупами по несколько раз за один запрос
чтобы в итоге юзерфлоу по нажатию на…

это не возможности модельки
это возможности человека
моделька может сделать все что угодно при наличии понимания что и зачем он делает у оператора
Чем мельче детали к рассмотрению, тем больше понимания должно быть у оператора, и тем филиграннее он должен описывать нюансы и каждый элемент
И вот здесь кроется беда чисто арифметического характера
Типа ты делаешь сложную хуйню со скоростью…

Тэкс, сегодня модельный рынок не шепчет, а довольно громко двигает мебель.

У нас день про доступ: OpenAI выкатывает GPT-5.6 через узкий preview, Google, по данным FT, не может дать Meta весь Gemini-capacity, Gemini получает встроенное computer use, Qwen выпускает world-model для агентов, а Mistral делает OCR менее похожим на распознавание каши в PDF.

Главная мысль простая: в 2026-м модель — это уже не только качество ответов. Это право доступа, лимит, цена, latency, safety-рамка и вопрос “а кто вообще получит токены, когда всем резко понадобилось думать?”.

Core lane: OpenAI, Anthropic, Codex, Claude Code

OpenAI показала preview семейства GPT-5.6: Sol как флагман, Terra как более дешевая рабочая модель, Luna как быстрый бюджетный слой. Сейчас preview идет через API и Codex для выбранных trusted partners; OpenAI пишет, что хочет расширить доступ для ChatGPT, Codex и API “soon”. Цены: Sol $5 input / $30 output за 1M…

Codex тоже обновился до 0.142.4, но релиз честно помечен как chores: user-facing changes не заявлены. То есть это не “срочно обновляйся, иначе жизнь потеряет цвет”, а аккуратная заметка в baseline.

OpenAI API changelog за июнь тоже не надо проморгать: обновлен chat-latest snapshot, Safety Usage Dashboard показывает blocked Responses requests по safety_identifier, web search теперь может…

Anthropic 26 июня подняла rate limits across Claude API: Sonnet и Haiku теперь матчятся с Opus по usage tiers, а tiers сведены к Start / Build / Scale. 25 июня Anthropic отдельно deprecated fast mode for Claude Opus 4.7, removal назначен на 24 июля 2026; миграционный путь — fast mode for Opus 4.8. Claude Code upstream остается 2.1.195: это…

AI model-market top list

1. GPT-5.6 Sol / Terra / Luna: самый большой релиз дня.
Почему важно: это новый OpenAI generation tiering, новая цена, новый access gate и явная ставка на coding/cyber/bio agentic work. Доказательство сильное: официальный OpenAI post, system card, METR external eval. Но читать надо холодной головой: METR прямо пишет, что в их ReAct harness…

2. Google, по сообщению Financial Times, ограничил Meta в доступе к Gemini capacity.
Почему важно: это не “модель стала умнее”, а более жесткая штука: supply of inference начинает быть рынком власти. Если даже Meta не всегда получает сколько хочет у Google, значит enterprise AI planning превращается в capacity-risk planning.
Доказательство: это reporting, не официальный продукт-анонс. FT пишет о…

4. Qwen-AgentWorld: open-weight world-model слой для агентов.
Почему важно: это не обычный чат-модельный релиз. Qwen двигает идею language world models: симулировать agentic environments и тренировать/проверять агента на state-action-next-observation логике. Есть официальный Qwen blog, GitHub, arXiv и Hugging Face collection.
Доказательство хорошее: primary sources плюс заметная HN/Reddit реакция.
Практический вывод: людям, которые…

5. Mistral OCR 4: document AI стал более структурным и production-shaped.
Почему важно: OCR 4 добавляет bounding boxes, block classification, confidence scores, 170 языков, API и self-hosted deployment. Это не самый сексуальный пункт дня, зато очень рабочий: RAG, legal/finance/healthcare ingestion, redactions, citations, human review.
Доказательство сильное: официальный Mistral announcement, model card и docs/changelog. Цена: $4…

Что люди говорят

GPT-5.6 взорвал HN: launch thread набрал сотни комментариев, отдельные ветки спорят не только о capability, но и о government-gated access, pricing, safety и METR cheating findings. Reddit/Codex уже ловит ранние “я видел Sol в Codex” истории — к ним отношусь как к анекдотам с возможной правдой внутри, не как к public availability proof.

По Gemini computer use сигнал живой, но более практичный: HN/Reddit обсуждают automation и риски screen-control agents. По Qwen-AgentWorld сигнал nerdy, но настоящий: GitHub/HF/arXiv плюс HN-обсуждение про simulation as training/planning layer. По Mistral OCR 4 шума меньше, зато это та скучная вещь, которая потом тихо экономит компаниям месяцы ручной боли.

Как это использовать

Builders: проверьте свои OpenAI/Anthropic deprecation и rate-limit assumptions. Если у вас завязка на старые OpenAI Evals/Agent Builder/reusable prompts или Claude Opus 4.7 fast mode — это уже миграционная заметка, не “когда-нибудь”.

More