Anton Gladkov · 2026-06-29 · source ↗ · whole document (16)
Тэкс, сегодня модельный рынок не шепчет, а довольно громко двигает мебель. У нас
2. Google, по сообщению Financial Times, ограничил Meta в доступе к Gemini capacity.
Почему важно: это не “модель стала умнее”, а более жесткая штука: supply of inference начинает быть рынком власти. Если даже Meta не всегда получает сколько хочет у Google, значит enterprise AI planning превращается в capacity-risk planning.
Доказательство: это reporting, не официальный продукт-анонс. FT пишет о лимитах, связанных с compute demand; The Verge и TNW пересказывают историю. Поэтому формулировка аккуратная: reported, not confirmed by Google/Meta.
Практический вывод: крупным командам пора проектировать fallback-модели, token budgets, routing и graceful degradation как нормальную часть архитектуры, а не как “когда-нибудь потом”.
3. Gemini 3.5 Flash получил built-in Computer Use.
Почему важно: computer use переезжает из отдельной игрушки в основной Flash-модель: browser, mobile, desktop environments, intent-поле для действий, configurable safety policies и prompt-injection detection. Это уже API/enterprise surface, не просто демо с мышкой.
Доказательство сильное: официальный Google blog и Gemini API docs.
Практический вывод: если вы делаете QA agents, workflow automation, browser-use или backoffice agents, это надо тестировать рядом с OpenAI/Anthropic computer-use стеками. И не забывать, что execution environment все равно ваш: модель предлагает действия, а вы отвечаете за руки.
4. Qwen-AgentWorld: open-weight world-model слой для агентов.
Почему важно: это не обычный чат-модельный релиз. Qwen двигает идею language world models: симулировать agentic environments и тренировать/проверять агента на state-action-next-observation логике. Есть официальный Qwen blog, GitHub, arXiv и Hugging Face collection.
Доказательство хорошее: primary sources плюс заметная HN/Reddit реакция.
Практический вывод: людям, которые делают agent RL, simulated environments, planning или evaluation harnesses, стоит смотреть не только на “какая модель отвечает умнее”, а на “какая модель помогает агенту репетировать мир до дорогой ошибки”.
5. Mistral OCR 4: document AI стал более структурным и production-shaped.
Почему важно: OCR 4 добавляет bounding boxes, block classification, confidence scores, 170 языков, API и self-hosted deployment. Это не самый сексуальный пункт дня, зато очень рабочий: RAG, legal/finance/healthcare ingestion, redactions, citations, human review.
Доказательство сильное: официальный Mistral announcement, model card и docs/changelog. Цена: $4 за 1000 pages через API, $2 за 1000 pages через Batch API discount, $5 за 1000 annotated pages в Document AI.
Практический вывод: если ваши PDF сейчас превращаются в суп из текста без координат и структуры, OCR 4 — кандидат на нормальный pipeline test.
Что люди говорят
GPT-5.6 взорвал HN: launch thread набрал сотни комментариев, отдельные ветки спорят не только о capability, но и о government-gated access, pricing, safety и METR cheating findings. Reddit/Codex уже ловит ранние “я видел Sol в Codex” истории — к ним отношусь как к анекдотам с возможной правдой внутри, не как к public availability proof.
По Gemini computer use сигнал живой, но более практичный: HN/Reddit обсуждают automation и риски screen-control agents. По Qwen-AgentWorld сигнал nerdy, но настоящий: GitHub/HF/arXiv плюс HN-обсуждение про simulation as training/planning layer. По Mistral OCR 4 шума меньше, зато это та скучная вещь, которая потом тихо экономит компаниям месяцы ручной боли.