Sonnet 5 внезапно обошёл всех. Итоги моего бенчмарка на реальных задачах

Сегодня не было настроения работать. Жарковато.

Поэтому я решил продолжить развлечение, которое началось с простого вопроса:

Вышла Claude Opus 5. А мне от этого что?

Я немного подустал от бесконечных новостей про очередную «самую умную модель». Производители показывают красивые графики и результаты на собственных бенчмарках, но меня интересует гораздо более приземлённая вещь:

Какая связка лучше справляется именно с моими задачами?

Не с олимпиадными головоломками, не с генерацией приложения по одному предложению и не с тестами, специально подготовленными разработчиками моделей. С обычными задачами из моих реальных проектов.

Как устроен тест

У меня накопилось 37 репозиториев с кодом. Из истории изменений я собрал десять задач, которые когда-то действительно приходилось решать:

  1. Свежесть напоминаний, Python/WordPress: пропускать свежие записи и корректно учитывать GMT.
  2. Путь к кешу, PHP/Yii/W3TC: разбирать URL и защищаться от некорректных путей.
  3. Даты комментариев, WordPress/PHP: обрабатывать ближайшее будущее, локальное время и GMT.
  4. Очистка бэкапов, Bash: удалять дампы только нужного проекта.
  5. Onboarding-чеклист, vanilla JS: добавить закрываемый блок в дашборд, стили и тесты.
  6. Аномальный объём IMOEX, Python: находить многоминутную волну, учитывать cooldown и хранить состояние.
  7. MCP и Zod 4, JavaScript: реализовать свободные object-схемы в параметрах и request body.
  8. Runtime-пути, Python/Docker: разобраться с миграциями, контрактами, окружением и healthcheck.
  9. Backup/restore, Bash/Docker: корректно работать с Compose-проектом, overlays и пустыми дампами.
  10. VPN-маршрут, macOS/Bash: добавить host route, fallback и идемпотентность.

Стенд локальный и воспроизводимый. Для каждого запуска создаётся отдельный снимок репозитория, поэтому агент может свободно менять файлы, не рискуя испортить оригинальный проект.

Задача выполняется полностью без моего участия. Агент не видит эталонный патч и скрытые проверки.

Оценка складывается из нескольких параметров:

  • решена ли задача вообще
  • прошли ли автоматические тесты
  • соблюдены ли требования и ограничения
  • не сломано ли что-нибудь побочное
  • сколько потребовалось времени
  • сколько израсходовано токенов
  • сколько стоил запуск

Сравниваются не модели в вакууме, а конкретные связки агента, модели и настроек. Сейчас проверены Codex и Claude Code с доступными для них моделями. Все результаты на картинке относятся к последним валидным прогонам с effort=medium.

Пока это один полный проход каждой модели. Больше за один круг не получается: Claude Code начинает упираться в пятичасовой лимит.

И вот тут началось интересное

Первое место внезапно занял Sonnet 5:

  • Score — 76,94%
  • успешно выполнено 7 задач из 10
  • время — 18 минут 6 секунд
  • стоимость — $4,54

Это единственная модель, которая закрыла семь задач. Она же оказалась самой быстрой среди участников.

Я Sonnet 5 запускал буквально «просто посмотреть». И вот пожалуйста.

На втором месте оказался мой привычный Opus 4.8:

  • Score — 76,04%
  • 6 задач из 10
  • 25 минут 17 секунд
  • 4,30 млн входных и выходных токенов
  • стоимость — $6,76

Разница с Sonnet 5 — меньше одного процентного пункта. При этом из тройки лидеров Opus 4.8 израсходовал меньше всего токенов.

На третьем месте новый Opus 5:

  • Score — 75,71%
  • 6 задач из 10
  • 28 минут 28 секунд
  • 6,06 млн токенов
  • стоимость — $8,69

То есть убедительного преимущества перед Opus 4.8 я пока не увидел. Результат немного хуже, времени и токенов потребовалось больше, запуск обошёлся дороже.

Возможно, Opus 5 можно поднять выше другими настройками или небольшими изменениями в организации работы агента. У меня уже есть пара идей. Поэкспериментирую в следующие выходные.

Самые неожиданные результаты

Fable 5 набрал 74,94% и расположился сразу за Opus 5. С задачами он справился не лучше двух Opus, зато один прогон обошёлся в $14,74.

Это самая дорогая модель в таблице. Какого-то практического смысла использовать её на моих задачах я пока не вижу.

Но главное открытие для меня — семейство GPT-5.6.

GPT-5.6-luna получила 73,58%, а GPT-5.6-terra — 70,38%.

Обе модели на этом наборе задач обошли:

  • GPT-5.6-sol — 64,58%
  • GPT-5.5 — 63,19%

Я Luna и Terra тоже запускал «просто глянуть». В итоге Luna оказалась лучшей GPT-моделью в текущем чарте, а Terra заметно опередила и Sol, и GPT-5.5.

Сижу, перевариваю.

Отдельно удивил Haiku 4.5. Формально он оказался самым дешёвым — $3,57, но работал 40 минут 55 секунд и переработал 16,4 млн токенов. Это почти в четыре раза больше, чем Opus 4.8.

Экономия получилась довольно специфическая.

GLM-5.2 набрал 69,37%. Вполне рабочий результат, но причин менять на него основную связку я пока не обнаружил.

Что я буду использовать

Если смотреть исключительно на итоговый Score, победитель первого прохода — Sonnet 5.

Но для 90% моих рабочих задач основным вариантом пока остаётся:

Opus 4.8 с effort=medium.

Он практически не уступил лидеру, предсказуемо работает на моих проектах и расходует заметно меньше токенов, чем Sonnet 5 и Opus 5.

Собственно, Opus 4.8 я в основном и использовал. После выхода пятой версии появилось ощущение, что я что-то упускаю.

Оказалось — нет. Всё нормально 🙂

Для более простых задач я, скорее всего, заменю GPT-5.5 на GPT-5.6-sol. Например, для небольших доработок проектов, отдельных скриптов, серверного администрирования и других задач, где не требуется долго разбираться в архитектуре.

Общий результат у Sol ниже, но на таких задачах возможностей модели мне достаточно, а токенов в тестовом прогоне она израсходовала меньше: 3,98 млн против 5,30 млн у GPT-5.5.

Использовать остальные модели в повседневной работе пока не планирую. Не вижу практического смысла.

Что дальше

Теперь у меня есть готовый стенд, на который можно отправлять каждую новую модель сразу после выхода и проверять, действительно ли она даёт мне какой-то выигрыш.

В дальнейшем можно:

  • расширить набор до 20, 50 или 80 задач
  • сделать несколько прогонов каждой связки
  • оценивать не только средний Score, но и стабильность
  • разделить тесты по типам задач
  • отдельно сравнить разные значения effort
  • проверить влияние промптов и организации агентного цикла

После нескольких повторных прогонов рейтинг наверняка немного изменится. Один проход — это ещё не полноценная статистика.

И главное: этот бенчмарк не универсальный. Он ничего не доказывает про абсолютный интеллект моделей и не отвечает на вопрос, какая модель «лучшая вообще».

Он отвечает только на один вопрос:

Какая связка лучше справляется с моими типами задач, в моих проектах и при моём способе работы?

Текущий чарт — на картинке. Каких-то дополнительных выводов у меня пока нет.

Ушёл ещё раз много думать.

Не является инвестиционной рекомендацией 🙂