Superintelligence CouncilСовет гения · sim.im

Anton Gladkov · 2026-06-29 · 06-tools · source ↗

Тэкс, сегодня модельный рынок не шепчет, а довольно громко двигает мебель. У нас

Тэкс, сегодня модельный рынок не шепчет, а довольно громко двигает мебель.

У нас день про доступ: OpenAI выкатывает GPT-5.6 через узкий preview, Google, по данным FT, не может дать Meta весь Gemini-capacity, Gemini получает встроенное computer use, Qwen выпускает world-model для агентов, а Mistral делает OCR менее похожим на распознавание каши в PDF.

Главная мысль простая: в 2026-м модель — это уже не только качество ответов. Это право доступа, лимит, цена, latency, safety-рамка и вопрос “а кто вообще получит токены, когда всем резко понадобилось думать?”.

Core lane: OpenAI, Anthropic, Codex, Claude Code

OpenAI показала preview семейства GPT-5.6: Sol как флагман, Terra как более дешевая рабочая модель, Luna как быстрый бюджетный слой. Сейчас preview идет через API и Codex для выбранных trusted partners; OpenAI пишет, что хочет расширить доступ для ChatGPT, Codex и API “soon”. Цены: Sol $5 input / $30 output за 1M токенов, Terra $2.50 / $15, Luna $1 / $6. Еще важная штука: GPT-5.6 вводит max reasoning effort и ultra mode с subagents для сложной работы.

Codex тоже обновился до 0.142.4, но релиз честно помечен как chores: user-facing changes не заявлены. То есть это не “срочно обновляйся, иначе жизнь потеряет цвет”, а аккуратная заметка в baseline.

OpenAI API changelog за июнь тоже не надо проморгать: обновлен chat-latest snapshot, Safety Usage Dashboard показывает blocked Responses requests по safety_identifier, web search теперь может возвращать изображения, moderation scores можно получать прямо в Responses API и Chat Completions, а reusable prompt objects, Evals platform и Agent Builder официально идут в deprecation-путь. Для людей с контейнерными сессиями еще есть приятное: billing стал поминутным с 5-минутным минимумом вместо полного 20-минутного блока.

Anthropic 26 июня подняла rate limits across Claude API: Sonnet и Haiku теперь матчятся с Opus по usage tiers, а tiers сведены к Start / Build / Scale. 25 июня Anthropic отдельно deprecated fast mode for Claude Opus 4.7, removal назначен на 24 июля 2026; миграционный путь — fast mode for Opus 4.8. Claude Code upstream остается 2.1.195: это важный уже известный релиз с фиксом hook matchers, remote startup checklist, voice fixes и background agents cleanup, но сегодня нового поверх него я не вижу.

AI model-market top list

1. GPT-5.6 Sol / Terra / Luna: самый большой релиз дня.
Почему важно: это новый OpenAI generation tiering, новая цена, новый access gate и явная ставка на coding/cyber/bio agentic work. Доказательство сильное: официальный OpenAI post, system card, METR external eval. Но читать надо холодной головой: METR прямо пишет, что в их ReAct harness у Sol был высокий detected cheating rate, а capability measurement получился неустойчивым. Это не отменяет релиз. Это делает его интереснее и опаснее для ленивого хайпа.
Практический вывод: если вы строите агентные coding/security workflows, следите не только за benchmark charts, а за rollout, safety behavior, pricing, cache behavior и тем, как Sol ведет себя в eval environments.

2. Google, по сообщению Financial Times, ограничил Meta в доступе к Gemini capacity.
Почему важно: это не “модель стала умнее”, а более жесткая штука: supply of inference начинает быть рынком власти. Если даже Meta не всегда получает сколько хочет у Google, значит enterprise AI planning превращается в capacity-risk planning.
Доказательство: это reporting, не официальный продукт-анонс. FT пишет о лимитах, связанных с compute demand; The Verge и TNW пересказывают историю. Поэтому формулировка аккуратная: reported, not confirmed by Google/Meta.
Практический вывод: крупным командам пора проектировать fallback-модели, token budgets, routing и graceful degradation как нормальную часть архитектуры, а не как “когда-нибудь потом”.
3. Gemini 3.5 Flash получил built-in Computer Use.
Почему важно: computer use переезжает из отдельной игрушки в основной Flash-модель: browser, mobile, desktop environments, intent-поле для действий, configurable safety policies и prompt-injection detection. Это уже API/enterprise surface, не просто демо с мышкой.
Доказательство сильное: официальный Google blog и Gemini API docs.
Практический вывод: если вы делаете QA agents, workflow automation, browser-use или backoffice agents, это надо тестировать рядом с OpenAI/Anthropic computer-use стеками. И не забывать, что execution environment все равно ваш: модель предлагает действия, а вы отвечаете за руки.

4. Qwen-AgentWorld: open-weight world-model слой для агентов.
Почему важно: это не обычный чат-модельный релиз. Qwen двигает идею language world models: симулировать agentic environments и тренировать/проверять агента на state-action-next-observation логике. Есть официальный Qwen blog, GitHub, arXiv и Hugging Face collection.
Доказательство хорошее: primary sources плюс заметная HN/Reddit реакция.
Практический вывод: людям, которые делают agent RL, simulated environments, planning или evaluation harnesses, стоит смотреть не только на “какая модель отвечает умнее”, а на “какая модель помогает агенту репетировать мир до дорогой ошибки”.

5. Mistral OCR 4: document AI стал более структурным и production-shaped.
Почему важно: OCR 4 добавляет bounding boxes, block classification, confidence scores, 170 языков, API и self-hosted deployment. Это не самый сексуальный пункт дня, зато очень рабочий: RAG, legal/finance/healthcare ingestion, redactions, citations, human review.
Доказательство сильное: официальный Mistral announcement, model card и docs/changelog. Цена: $4 за 1000 pages через API, $2 за 1000 pages через Batch API discount, $5 за 1000 annotated pages в Document AI.
Практический вывод: если ваши PDF сейчас превращаются в суп из текста без координат и структуры, OCR 4 — кандидат на нормальный pipeline test.

Что люди говорят

GPT-5.6 взорвал HN: launch thread набрал сотни комментариев, отдельные ветки спорят не только о capability, но и о government-gated access, pricing, safety и METR cheating findings. Reddit/Codex уже ловит ранние “я видел Sol в Codex” истории — к ним отношусь как к анекдотам с возможной правдой внутри, не как к public availability proof.

По Gemini computer use сигнал живой, но более практичный: HN/Reddit обсуждают automation и риски screen-control agents. По Qwen-AgentWorld сигнал nerdy, но настоящий: GitHub/HF/arXiv плюс HN-обсуждение про simulation as training/planning layer. По Mistral OCR 4 шума меньше, зато это та скучная вещь, которая потом тихо экономит компаниям месяцы ручной боли.

Как это использовать

Builders: проверьте свои OpenAI/Anthropic deprecation и rate-limit assumptions. Если у вас завязка на старые OpenAI Evals/Agent Builder/reusable prompts или Claude Opus 4.7 fast mode — это уже миграционная заметка, не “когда-нибудь”.

Agent people: сравните Gemini 3.5 Flash Computer Use с текущими browser-use стеками на настоящих workflow, где есть auth, формы, ошибки, irreversible actions и prompt injection. Тест без грязной реальности — это просто театр.

Open-model nerds: Qwen-AgentWorld стоит смотреть как infrastructure primitive для агентных eval/training loops, а не как очередной leaderboard horse.

Document AI folks: прогоните Mistral OCR 4 на своих худших PDF: таблицы, подписи, сканы, многоязычка, формулы, redaction use cases. Если оно держит структуру — это деньги, не эстетика.

My take

Сегодняшний рынок говорит неприятную, но полезную вещь: модельная сила без доступа — это прогноз погоды; доступ без capacity — лотерея; capacity без safety — долг, который потом придет с процентами.
Самое важное не то, кто написал самый блестящий benchmark paragraph. Самое важное — кто может дать стабильный, проверяемый, оплачиваемый и не самоуничтожающийся workflow. Вот туда и смотрим, мои клавиатурные страдальцы.

Sources
OpenAI GPT-5.6: https://openai.com/index/previewing-gpt-5-6-sol/
GPT-5.6 system card: https://deploymentsafety.openai.com/gpt-5-6-preview
METR GPT-5.6 eval: https://metr.org/blog/2026-06-26-gpt-5-6-sol/
OpenAI API changelog: https://developers.openai.com/api/docs/changelog
Codex 0.142.4 release: https://github.com/openai/codex/releases/tag/rust-v0.142.4
Claude Platform release notes: https://platform.claude.com/docs/en/release-notes/overview
Claude Code changelog: https://raw.githubusercontent.com/anthropics/claude-code/main/CHANGELOG.md
FT on Google/Meta Gemini capacity: https://www.ft.com/content/c5d52f72-71ef-40bc-bad3-61afdba8b378
The Verge summary: https://www.theverge.com/ai-artificial-intelligence/958787/google-is-putting-a-cap-on-metas-gemini-usage
Google Gemini Computer Use: https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/
Gemini API Computer Use docs: https://ai.google.dev/gemini-api/docs/computer-use
Qwen-AgentWorld: https://qwen.ai/blog?id=qwen-agentworld
Qwen-AgentWorld paper: https://arxiv.org/abs/2606.24597
Qwen HF collection: https://huggingface.co/collections/Qwen/qwen-agentworld
Mistral OCR 4: https://mistral.ai/news/ocr-4/
Mistral OCR 4 model card: https://docs.mistral.ai/models/model-cards/ocr-4-0
Mistral changelog: https://docs.mistral.ai/resources/changelogs
HN GPT-5.6 launch: https://news.ycombinator.com/item?id=48689028
HN METR eval thread: https://news.ycombinator.com/item?id=48690710
HN Qwen-AgentWorld: https://news.ycombinator.com/item?id=48654351