harnsy

Claude Sonnet или Opus для агентов: модель и effort — по ролям

«Sonnet или Opus?» спрашивают так, будто один ответ подходит всей команде. В команде агентов роли делают разную работу, поэтому и ответ разный, и он больше про подходящую работу и риск, чем про цену. Что говорит производитель, что на самом деле делают цены и что мы измерили, а что нет.

12 мин чтенияPavel Buchnev

Главное

0,20 $
за миллион токенов чтения из кэша, одинаково у Sonnet 5.5 и у Opus 5.5; остальные статьи цены у Sonnet вдвое ниже
10–34%
сколько роль сэкономила бы при переходе на Sonnet 5.5 с тем же числом шагов (в среднем 16%); это арифметика, а не замер
0 из 29 771
запросов нашего продуктового проекта с 10 по 29 сентября, до пилота, шли на Sonnet 5.5 или на effort high, так что результата пока нет
−2%
ожидаемое изменение веса недели в нашем продуктовом проекте (3 033 $ по ценам API) при таблице ролей в том виде, как она применена: экономия и дополнительные траты в основном гасят друг друга
В этой статье
  1. Что говорит производитель
  2. Цена и одна строка, которая не меняется
  3. Почему экономия меньше, чем кажется
  4. Effort меняет число шагов, а не только длину ответа
  5. Роль за ролью: наша пилотная таблица
  6. Две вещи, которые не стоит менять на ходу
  7. Другие харнесы — то же решение
  8. Что измерено, а что пока пилот
  9. Где здесь harnsy
  10. Источники

Что говорит производитель

Anthropic выпустила Sonnet 5.5 28 сентября 2026 года и описывает его как «более быстрое и недорогое дополнение к Claude Opus 5.5». В руководстве по промптам для модели добавлено: «для самой трудной долгой работы лучше подходит модель Opus». Страница о расходах Claude Code объясняет разделение одной строкой: «Sonnet хорошо справляется с большинством задач по коду и стоит дешевле Opus. Opus оставьте для сложных архитектурных решений и рассуждений в несколько шагов». Для команд агентов там сказано: «Используйте Sonnet для участников команды» (цитаты в нашем переводе).

Бенчмарки из анонса указывают в ту же сторону, но с оговоркой: это не результаты на среднем effort.

БенчмаркSonnet 5.5Opus 5.5Effort в анонсе
Terminal-Bench 4.070,6%66,4%xhigh или max
FrontierCode 1.146,2%54,4%max
CursorBench 4.055,5%57,8%не указан
GDPval-AA18441846не указан
Sonnet 5.5 и Opus 5.5 по данным анонса Anthropic

Если прочитать просто: на повседневной работе они близки, на Terminal-Bench впереди Sonnet, а на самом трудном коде Opus впереди на восемь пунктов. Это довод подбирать модель под работу, но пока ничего не говорит о вашем репозитории.

Цена и одна строка, которая не меняется

Опубликованные цены API Anthropic для двух моделей, за миллион токенов:

СтатьяSonnet 5.5Opus 5.5
Вход$2$4
Запись в кэш, 5 мин$2,50$5
Запись в кэш, 1 ч$4$8
Чтение из кэша$0,20$0,20
Вывод$10$20

Чтение из кэша стоит одинаково у обеих моделей.

Опубликованные цены Claude API на 2026-09-29, $ за миллион токенов

Всё у Sonnet вдвое дешевле, кроме чтения из кэша. Anthropic оценивает чтение из кэша у Opus 5.5 в 0,05 от цены входа, а у Sonnet 5.5 в 0,1, и обе цены равны 0,20 $. Шаг агента перечитывает весь разговор, поэтому эта равная строка решает больше остальных. Неделю, которую мы считали, разбирает статья «Куда уходят токены агентов»; здесь нам нужно только то, что из неё следует.

Почему экономия меньше, чем кажется

В нашу неделю 23–29 сентября 2026 года (наш продуктовый проект, всё на Opus 5.5, 3 033 $ по ценам API) чтение из кэша было самой крупной частью веса роли: 81% у лида, 76% у копирайтера лендинга, 68% у ревьюера и 32% у архитектора, чья работа коротка. Мы посчитали те же шаги по ценам Sonnet 5.5. Экономия — от 10% у лида до 34% у архитектора и 16% за неделю (495 $ из 3 033 $, с учётом веса ролей, а не простое среднее по ролям) при том же числе шагов.

Доля чтения из кэша в весе роли и экономия на Sonnet 5.5

РольЧтение из кэша, доля весаSonnet, те же шаги
Лид81%−10%
Копирайтер лендинга76%−12%
Ревьюер68%−16%
Фронтенд65%−17%
Разработчик64%−18%
Документация58%−21%
Архитектор32%−34%

Чем длиннее контекст роли, тем меньше экономит Sonnet. Лид и копирайтер несут около 430 тыс. токенов на шаг и экономят 10–12%; архитектор несёт 92 тыс. и экономит 34% на 13 $ в неделю.

По ценам API, неделя 23–29 сентября 2026; экономия — арифметика при том же числе шагов.

Две оговорки. Если Sonnet понадобится примерно на 20% больше шагов для той же работы (это наше предположение, не замер), экономия ролей с длинным контекстом исчезает. И семь полос — это роли с полной неделей работы; короткоживущие роли стоят слишком мало, чтобы это имело значение.

Effort меняет число шагов, а не только длину ответа

Effort — настройка модели, которая, по описанию Anthropic, влияет на «все токены» ответа: текст, вызовы инструментов и размышления. Это «сигнал поведения, а не жёсткий бюджет токенов». Для агента важнее всего вызовы инструментов. Низкий effort — меньше вызовов и короче; высокий — больше вызовов, план перед действием и длиннее сводки. Каждый лишний вызов — это ещё один шаг, а каждый шаг перечитывает весь разговор (цитаты в нашем переводе).

  1. low

    Самый экономный: простые задачи, где нужны скорость и низкая цена, например субагенты.

  2. medium

    Сбалансированный: агентные задачи, где нужен баланс скорости, цены и качества.

    Opus 5.5 по умолчаниюSonnet 5.5 в Claude Code
  3. high

    Сложные рассуждения, трудные задачи по коду, агентные задачи.

    Sonnet 5.5 в API
  4. xhigh

    Долгие агентные задачи и задачи по коду, дольше 30 минут, с бюджетом в миллионы токенов.

  5. max

    Без ограничения расхода токенов; для самых глубоких рассуждений.

Уровни effort в описании Anthropic

Для агентной работы с кодом на Sonnet 5.5 Anthropic советует начинать с medium для чётко поставленных задач и переходить на high для более трудных или долгих. Там же сказано, что на low модель может не проверить свою правку, а на low и medium в долгих задачах чаще останавливается и переспрашивает, прежде чем закончить.

В нашу неделю собственный ответ модели, вместе с размышлениями, составлял лишь 8–29% веса роли, а размышления — 12–29% от него. Так что effort повлиял бы на наши расходы в основном через лишние шаги, а не через более длинные ответы. Это вывод из описания производителя и из нашего разреза; замера на high у нас нет.

Роль за ролью: наша пилотная таблица

Основной довод выбирать по ролям — подходящая работа и риск: где ошибка дорога, берите более сильную настройку; где работа чётко очерчена — более быструю. Цена вторична. Это таблица в собственных шаблонах ролей компании harnsy с 29 сентября 2026 года (её наследуют все проекты, ни один её не переопределяет), с одним исключением, отмеченным ниже.

Пилотная таблица, с 29 сентября 2026

РольМодельEffortПочему
ЛидOpus 5.5mediumРешения и приёмка; ошибка расходится по команде. Чтение из кэша — 81% веса, так что Sonnet сэкономил бы лишь 10%.
РазработчикOpus 5.5mediumКод с инвариантами. Разрыв в бенчмарках Anthropic шире всего на трудном коде.
РевьюерOpus 5.5highПоследний фильтр перед выкладкой, ради него стоит взять более сильную настройку. Anthropic указывает high для трудных задач по коду и агентных задач.
ИнтеграцияSonnet 5.5mediumПроцедура по шагам: слить, собрать, проверить, выкатить. Sonnet впереди на Terminal-Bench.
ФронтендSonnet 5.5mediumЧётко очерченная работа с интерфейсом по понятным правилам.
Документация, копирайтер лендинга, маркетологSonnet 5.5mediumДокументы и тексты: чётко очерченная рутинная работа, возвраты редки (документация 7%, копирайтер 0 из 98).
Эксперт по редакциямSonnet 5.5highПравила, которые попадают в лицензию; high компенсирует более лёгкую модель.
Дизайнер, UXOpus 5.5mediumВкус и суждение, при небольшой цене.
ЮристOpus 5.5highЮридический текст, где ошибка стоит денег.
Роли, которые работают с ключами и криптографиейOpus 5.5highРекомендуется, пока не применено: строки в шаблоне нет. Их работа возвращается чаще всего.
Модель и effort по ролям: пилот, а не результат

Строки мы выбирали отчасти по тому, как часто ревьюер возвращал работу роли. Это отказы ревьюера по роли автора с 24 сентября 2026 года, с размерами выборок:

  • Роли, которые работают с ключами и криптографией: 25% (13 из 52), небольшая выборка.
  • Юрист: 25% (1 из 4), совсем маленькая выборка.
  • Разработчик: 12% (32 из 271).
  • Интеграция: 9% (8 из 86).
  • Документация: 7% (4 из 54).
  • Дизайнер: 7% (1 из 15), совсем маленькая выборка.
  • Фронтенд: 2% (2 из 87).
  • Копирайтер лендинга: 0 из 98.

Доля возвратов говорит, как часто проверка что-то нашла, а не насколько хорош автор. Читайте её как подсказку, куда потратить более сильную настройку, и не более.

Две вещи, которые не стоит менять на ходу

Не меняйте модель внутри живой сессии. У каждой модели свой кэш промптов, поэтому после смены, по словам документации Claude Code, «следующий запрос читает всю историю разговора без попаданий в кэш»; пока кэш тёплый, Claude Code просит подтвердить смену. Выбирайте модель при запуске агента или при передаче дел. Та же страница отмечает, что opusplan, который использует Opus в режиме плана и Sonnet для выполнения, превращает каждое переключение режима плана в смену модели, а каждая смена начинает новый кэш (цитата в нашем переводе).

С effort мягче. На Opus 5.5 и Sonnet 5.5 смена effort в Claude Code сохраняет кэш (с ключом API или подпиской Claude). В API кэш сохраняет и смена effort для отдельного сообщения (это бета), а новое значение effort верхнего уровня между запросами не сохраняет, так что держите его постоянным внутри разговора, который опирается на кэш.

Ещё одно из руководства Anthropic по Sonnet 5.5 относится к списку рисков, а не к списку находок. Там сказано, что модель обучена противостоять внедрённым инструкциям и «иногда принимает настоящее сообщение пользователя за возможную инъекцию», особенно когда сообщение пользователя приходит сразу после результата инструмента посреди хода. В команде, где сообщения приходят, пока агент работает, за этим стоит следить. Мы записываем это как риск: на своей работе мы этого не видели (цитата в нашем переводе).

Другие харнесы — то же решение

«Выбор по ролям» не заканчивается на одном производителе. Настройки запуска в harnsy начинаются с харнеса (Claude Code, Codex или OpenCode) и только потом модель. Наши собственные цифры по Codex скудны и относятся к другому периоду: за все месяцы, что есть в файлах его сессий, средний шаг нёс 113–131 тыс. токенов контекста против 318 тыс. у Claude по всем нашим проектам за неделю выше, а 96,5% его входа шло из кэша против 99,0%. В сентябре Codex нёс примерно двадцатую часть входных токенов Claude. Это говорит о том, как мы его используем, а не о том, насколько он хорош. Сравнения качества у нас нет, поэтому мы его не делаем.

Что измерено, а что пока пилот

  • Измерено

    С 10 по 29 сентября, до пилота, наш продуктовый проект отправил 29 771 запрос, все на Opus 5.5 с effort medium, ни одного на Sonnet 5.5 или на high. Доли чтения из кэша, вес по ролям, возвраты ревьюера по ролям и арифметика цен.

  • Оценено

    Таблица ролей в том виде, как она применена, сдвигает неделю примерно на −2%: роли на Sonnet экономят около 146 $, а роли на high добавляют около 81 $, в итоге около −65 $ на неделе в 3 033 $ нашего продуктового проекта по ценам API. Таблица в первоначальном предложении, с большим числом ролей на high и на Sonnet, давала −1,5%. Для high принято +20% к стоимости (диапазон 10–40%).

  • Пока не измерено

    Как Sonnet 5.5 ведёт себя на нашей работе. Что high делает с числом шагов. Сколько недельного лимита тратит Sonnet по сравнению с Opus: Anthropic не публикует соотношения, а в Claude Code есть отдельные сообщения о лимите для семейств Opus и Sonnet.

Измерено, оценено и пока не измерено

Таблица попала в шаблоны ролей компании 29 сентября 2026 года, так что она новая и результатов нет. Вторая измеряемая неделя начнётся 6 октября или позже. Она сравнивает пилотную неделю с базовой неделей 23–29 сентября: расход по ролям, какая доля лимита Sonnet против лимита Opus тратится, доля возвратов по ролям, доработки человеком, неудачные выкладки и ошибки git у роли интеграции, скорость. Итог — решение по каждой роли: оставить, вернуть или поменять effort.

Где здесь harnsy

В harnsy у каждой роли есть раздел «Запуск» с тремя полями в таком порядке: среда, модель, effort. Среда — выбор, пустое значение наследуется. Модель — свободный текст с подсказками; лучше указывать полный id модели, потому что алиас сам переезжает на следующую версию. Effort появляется, только если у среды есть уровни: у Claude это low, medium, high, xhigh и max, у Codex свой список, у OpenCode их нет. При смене среды модель и effort очищаются.

ревьюерsite · Этот проект
Запуск
средаclaude
модельclaude-opus-5-5
efforthigh
Сохранить запускКак в шаблоне

Свой запуск в этом проекте: новые агенты роли стартуют с ним; при открытии и восстановлении агент остаётся на харнесе своего места и берёт модель и effort, только если харнес тот же.

Раздел «Запуск» роли, сокращённый до трёх полей. Значения — пример.

Уровней два: шаблон компании, который наследуют все проекты, и собственная роль проекта, которая его перекрывает. Значение, заданное на один запуск, сильнее обоих. Изменение действует только для новых сессий (запуск, передача дел, восстановление): сохранение никого не перезапускает. Открытие или восстановление агента оставляет ту среду, в которой он уже работает, и берёт модель и effort роли, только если это среда роли.

Сам по себе выбор никакой вариант не удешевляет; он закрепляет сделанный вами выбор за ролью, и следующая передача дел начнётся на выбранной настройке. Наша таблица — лишь отправная точка для вашей первой недели, а вторая неделя скажет, что стоит оставить. Установите harnsy, чтобы задавать запуск по ролям.

Источники

Задайте модель и effort для каждой роли

harnsy соединяет ваших агентов Claude Code, Codex и OpenCode в одну команду с ролями, и каждая роль стартует с той средой, моделью и effort, которые вы выбрали.

Установить harnsy
site-3fлид · Claude Codeна связитолько смотреть
❯ Распланируй #42 с командой.

Жду разбор от analyst-7a…

от analyst-7a через harnsy❯ #42 разобрана: три критерия приёмки, включая повтор через 24 ч.

Передаю #42 разработчику site-9a.

❯