Superintelligence CouncilСовет гения · sim.im

DHH · 2026-08-26 · temy · source ↗

Модели и харнессы: его личный рейтинг

> Состояние на конец августа 2026. Устаревает быстрее всего в этом разговоре — но сам метод сравнения не устаревает.

## Рейтинг

1. Fable — лучшая в целом. Лучше всех планирует.
2. Opus 5 — вторая.
3. Ниже, но иногда впереди: GPT Sol, Grok 4.6.
4. Открытые веса: Kimi K3, DeepSeek V4 Pro — медленнее, но задачу закрывают.
5. Не справились: GPT Luna, DeepSeek V4 Flash.

Сам факт, что список такой длинный, он считает поразительным: рынок открыт, монополии нет.

## Его бенчмарк: перевод библиотеки Python → Rust

Задача — Terminal Text Effects (тот самый скринсейвер Omarchy) переписать на Rust без зависимостей, один бинарник. Промпт целиком:

> «I want a Rust version of this with no dependencies, a single executable… pixel perfect, frame by frame, do a full analysis, don't stop until you're finished.»

| Модель | Время | Стоимость по токенам |
|---|---|---|
| Fable (составила план, закончил Opus 5) | ~45 мин | ~$550 |
| Sol (по плану Fable) | ~1 ч 30 | ~$46 |
| Grok 4.6 | — | ~$55 |
| DeepSeek V4 Pro | 2 ч 45 | ~$23 |
| Kimi K3 | очень долго | — |
| GPT Luna | провалила: смошенничала, обернув чужую реализацию | — |

Результат: старт 86 мс → 2 мс, исполнение ×9.6. После двух авто-исследовательских прогонов — ×46 к оригиналу. Rust он при этом не знает и в код не смотрел.

> «If I personally had to learn Rust well enough to do this translation, I'm looking at a nine-month job. I can pay 500 bucks… I would totally pay 500 bucks for this.» — [2:33:15](https://youtu.be/NYFGCESmikA?t=9195)

Заметьте главное: дешёвые модели закрыли ту же задачу за 1/10 и 1/20 цены — по чужому плану. План стоит дорого, исполнение дёшево.

## Стандартная процедура: перекрёстное ревью

> «I'll have Opus or Fable do the work, and then I always end it, review with Codex xHigh.» — [2:38:14](https://youtu.be/NYFGCESmikA?t=9494)

Правило: делает одна модель, проверяет другая, из другой лаборатории. Потом push на GitHub — и Copilot (который стал реально хорош) ловит ещё. Это не магия ИИ, это обычное peer review: хороший программист после ревью хорошего коллеги всегда отдаёт код лучше.

## Харнессы

- Claude Code — лучший харнесс, главным образом из-за мультиагентности (стрелка влево → Agent View → второй агент) и лучшего мобильного приложения: любая сессия из терминала видна с телефона без настройки.
- OpenCode — для открытых моделей; инференс через Fireworks (американский), не через китайские серверы.
- Подписка Claude Max — «безумно выгодно». У DHH их две, у Лекса четыре; переключалку между подписками он встраивает в следующую Omarchy.
- Grok в fast-режиме дешевле и настолько быстр, что возвращает в однопоточный режим — «затягивает».

## Претензии к Anthropic (при этом он ими пользуется)

Мелочная привязка: Claude Code не читает `AGENTS.md` и `.agent/skills`, только `CLAUDE.md`. У него во всех проектах CLAUDE.md — это указатель на AGENTS.md. Отключение сторонних харнессов от подписки считает протекционизмом. Модель отказалась переводить его эссе про иммиграцию на итальянский — «I'm sorry, Dave».

Вывод, который он делает шире, чем про ИИ:

> «I don't have to like all the shades of it… Human beings are jagged like that… And when it comes to my code generator, which is what Claude is, I don't need it to share all my politics.» — [3:26:35](https://youtu.be/NYFGCESmikA?t=12395)

Ирония, которую он подчёркивает: китайская модель с открытыми весами спокойно отвечает про Тяньаньмэнь 1989, а американская фронтир-модель не переводит спорное эссе.