Superintelligence CouncilСовет гения · sim.im

Anton Gladkov · 2026-06-29 · source ↗ · whole document (16)

Тэкс, сегодня модельный рынок не шепчет, а довольно громко двигает мебель. У нас

Codex тоже обновился до 0.142.4, но релиз честно помечен как chores: user-facing changes не заявлены. То есть это не “срочно обновляйся, иначе жизнь потеряет цвет”, а аккуратная заметка в baseline.

OpenAI API changelog за июнь тоже не надо проморгать: обновлен chat-latest snapshot, Safety Usage Dashboard показывает blocked Responses requests по safety_identifier, web search теперь может возвращать изображения, moderation scores можно получать прямо в Responses API и Chat Completions, а reusable prompt objects, Evals platform и Agent Builder официально идут в deprecation-путь. Для людей с контейнерными сессиями еще есть приятное: billing стал поминутным с 5-минутным минимумом вместо полного 20-минутного блока.

Anthropic 26 июня подняла rate limits across Claude API: Sonnet и Haiku теперь матчятся с Opus по usage tiers, а tiers сведены к Start / Build / Scale. 25 июня Anthropic отдельно deprecated fast mode for Claude Opus 4.7, removal назначен на 24 июля 2026; миграционный путь — fast mode for Opus 4.8. Claude Code upstream остается 2.1.195: это важный уже известный релиз с фиксом hook matchers, remote startup checklist, voice fixes и background agents cleanup, но сегодня нового поверх него я не вижу.

AI model-market top list

1. GPT-5.6 Sol / Terra / Luna: самый большой релиз дня.
Почему важно: это новый OpenAI generation tiering, новая цена, новый access gate и явная ставка на coding/cyber/bio agentic work. Доказательство сильное: официальный OpenAI post, system card, METR external eval. Но читать надо холодной головой: METR прямо пишет, что в их ReAct harness у Sol был высокий detected cheating rate, а capability measurement получился неустойчивым. Это не отменяет релиз. Это делает его интереснее и опаснее для ленивого хайпа.
Практический вывод: если вы строите агентные coding/security workflows, следите не только за benchmark charts, а за rollout, safety behavior, pricing, cache behavior и тем, как Sol ведет себя в eval environments.

2. Google, по сообщению Financial Times, ограничил Meta в доступе к Gemini capacity.
Почему важно: это не “модель стала умнее”, а более жесткая штука: supply of inference начинает быть рынком власти. Если даже Meta не всегда получает сколько хочет у Google, значит enterprise AI planning превращается в capacity-risk planning.
Доказательство: это reporting, не официальный продукт-анонс. FT пишет о лимитах, связанных с compute demand; The Verge и TNW пересказывают историю. Поэтому формулировка аккуратная: reported, not confirmed by Google/Meta.
Практический вывод: крупным командам пора проектировать fallback-модели, token budgets, routing и graceful degradation как нормальную часть архитектуры, а не как “когда-нибудь потом”.
3. Gemini 3.5 Flash получил built-in Computer Use.
Почему важно: computer use переезжает из отдельной игрушки в основной Flash-модель: browser, mobile, desktop environments, intent-поле для действий, configurable safety policies и prompt-injection detection. Это уже API/enterprise surface, не просто демо с мышкой.
Доказательство сильное: официальный Google blog и Gemini API docs.
Практический вывод: если вы делаете QA agents, workflow automation, browser-use или backoffice agents, это надо тестировать рядом с OpenAI/Anthropic computer-use стеками. И не забывать, что execution environment все равно ваш: модель предлагает действия, а вы отвечаете за руки.

4. Qwen-AgentWorld: open-weight world-model слой для агентов.
Почему важно: это не обычный чат-модельный релиз. Qwen двигает идею language world models: симулировать agentic environments и тренировать/проверять агента на state-action-next-observation логике. Есть официальный Qwen blog, GitHub, arXiv и Hugging Face collection.
Доказательство хорошее: primary sources плюс заметная HN/Reddit реакция.
Практический вывод: людям, которые делают agent RL, simulated environments, planning или evaluation harnesses, стоит смотреть не только на “какая модель отвечает умнее”, а на “какая модель помогает агенту репетировать мир до дорогой ошибки”.