Claude Sonnet или Opus для агентов: модель и effort — по ролям
«Sonnet или Opus?» спрашивают так, будто один ответ подходит всей команде. В команде агентов роли делают разную работу, поэтому и ответ разный, и он больше про подходящую работу и риск, чем про цену. Что говорит производитель, что на самом деле делают цены и что мы измерили, а что нет.
Главное
- 0,20 $
- за миллион токенов чтения из кэша, одинаково у Sonnet 5.5 и у Opus 5.5; остальные статьи цены у Sonnet вдвое ниже
- 10–34%
- сколько роль сэкономила бы при переходе на Sonnet 5.5 с тем же числом шагов (в среднем 16%); это арифметика, а не замер
- 0 из 29 771
- запросов нашего продуктового проекта с 10 по 29 сентября, до пилота, шли на Sonnet 5.5 или на effort high, так что результата пока нет
- −2%
- ожидаемое изменение веса недели в нашем продуктовом проекте (3 033 $ по ценам API) при таблице ролей в том виде, как она применена: экономия и дополнительные траты в основном гасят друг друга
В этой статье
- Что говорит производитель
- Цена и одна строка, которая не меняется
- Почему экономия меньше, чем кажется
- Effort меняет число шагов, а не только длину ответа
- Роль за ролью: наша пилотная таблица
- Две вещи, которые не стоит менять на ходу
- Другие харнесы — то же решение
- Что измерено, а что пока пилот
- Где здесь harnsy
- Источники
Что говорит производитель
Anthropic выпустила Sonnet 5.5 28 сентября 2026 года и описывает его как «более быстрое и недорогое дополнение к Claude Opus 5.5». В руководстве по промптам для модели добавлено: «для самой трудной долгой работы лучше подходит модель Opus». Страница о расходах Claude Code объясняет разделение одной строкой: «Sonnet хорошо справляется с большинством задач по коду и стоит дешевле Opus. Opus оставьте для сложных архитектурных решений и рассуждений в несколько шагов». Для команд агентов там сказано: «Используйте Sonnet для участников команды» (цитаты в нашем переводе).
Бенчмарки из анонса указывают в ту же сторону, но с оговоркой: это не результаты на среднем effort.
| Бенчмарк | Sonnet 5.5 | Opus 5.5 | Effort в анонсе |
|---|---|---|---|
| Terminal-Bench 4.0 | 70,6% | 66,4% | xhigh или max |
| FrontierCode 1.1 | 46,2% | 54,4% | max |
| CursorBench 4.0 | 55,5% | 57,8% | не указан |
| GDPval-AA | 1844 | 1846 | не указан |
Если прочитать просто: на повседневной работе они близки, на Terminal-Bench впереди Sonnet, а на самом трудном коде Opus впереди на восемь пунктов. Это довод подбирать модель под работу, но пока ничего не говорит о вашем репозитории.
Цена и одна строка, которая не меняется
Опубликованные цены API Anthropic для двух моделей, за миллион токенов:
| Статья | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Вход | $2 | $4 |
| Запись в кэш, 5 мин | $2,50 | $5 |
| Запись в кэш, 1 ч | $4 | $8 |
| Чтение из кэша | $0,20 | $0,20 |
| Вывод | $10 | $20 |
Чтение из кэша стоит одинаково у обеих моделей.
Всё у Sonnet вдвое дешевле, кроме чтения из кэша. Anthropic оценивает чтение из кэша у Opus 5.5 в 0,05 от цены входа, а у Sonnet 5.5 в 0,1, и обе цены равны 0,20 $. Шаг агента перечитывает весь разговор, поэтому эта равная строка решает больше остальных. Неделю, которую мы считали, разбирает статья «Куда уходят токены агентов»; здесь нам нужно только то, что из неё следует.
Почему экономия меньше, чем кажется
В нашу неделю 23–29 сентября 2026 года (наш продуктовый проект, всё на Opus 5.5, 3 033 $ по ценам API) чтение из кэша было самой крупной частью веса роли: 81% у лида, 76% у копирайтера лендинга, 68% у ревьюера и 32% у архитектора, чья работа коротка. Мы посчитали те же шаги по ценам Sonnet 5.5. Экономия — от 10% у лида до 34% у архитектора и 16% за неделю (495 $ из 3 033 $, с учётом веса ролей, а не простое среднее по ролям) при том же числе шагов.
| Роль | Чтение из кэша, доля веса | Sonnet, те же шаги |
|---|---|---|
| Лид | 81% | −10% |
| Копирайтер лендинга | 76% | −12% |
| Ревьюер | 68% | −16% |
| Фронтенд | 65% | −17% |
| Разработчик | 64% | −18% |
| Документация | 58% | −21% |
| Архитектор | 32% | −34% |
Чем длиннее контекст роли, тем меньше экономит Sonnet. Лид и копирайтер несут около 430 тыс. токенов на шаг и экономят 10–12%; архитектор несёт 92 тыс. и экономит 34% на 13 $ в неделю.
Две оговорки. Если Sonnet понадобится примерно на 20% больше шагов для той же работы (это наше предположение, не замер), экономия ролей с длинным контекстом исчезает. И семь полос — это роли с полной неделей работы; короткоживущие роли стоят слишком мало, чтобы это имело значение.
Effort меняет число шагов, а не только длину ответа
Effort — настройка модели, которая, по описанию Anthropic, влияет на «все токены» ответа: текст, вызовы инструментов и размышления. Это «сигнал поведения, а не жёсткий бюджет токенов». Для агента важнее всего вызовы инструментов. Низкий effort — меньше вызовов и короче; высокий — больше вызовов, план перед действием и длиннее сводки. Каждый лишний вызов — это ещё один шаг, а каждый шаг перечитывает весь разговор (цитаты в нашем переводе).
- low
Самый экономный: простые задачи, где нужны скорость и низкая цена, например субагенты.
- medium
Сбалансированный: агентные задачи, где нужен баланс скорости, цены и качества.
Opus 5.5 по умолчаниюSonnet 5.5 в Claude Code - high
Сложные рассуждения, трудные задачи по коду, агентные задачи.
Sonnet 5.5 в API - xhigh
Долгие агентные задачи и задачи по коду, дольше 30 минут, с бюджетом в миллионы токенов.
- max
Без ограничения расхода токенов; для самых глубоких рассуждений.
Для агентной работы с кодом на Sonnet 5.5 Anthropic советует начинать с medium для чётко поставленных задач и переходить на high для более трудных или долгих. Там же сказано, что на low модель может не проверить свою правку, а на low и medium в долгих задачах чаще останавливается и переспрашивает, прежде чем закончить.
В нашу неделю собственный ответ модели, вместе с размышлениями, составлял лишь 8–29% веса роли, а размышления — 12–29% от него. Так что effort повлиял бы на наши расходы в основном через лишние шаги, а не через более длинные ответы. Это вывод из описания производителя и из нашего разреза; замера на high у нас нет.
Роль за ролью: наша пилотная таблица
Основной довод выбирать по ролям — подходящая работа и риск: где ошибка дорога, берите более сильную настройку; где работа чётко очерчена — более быструю. Цена вторична. Это таблица в собственных шаблонах ролей компании harnsy с 29 сентября 2026 года (её наследуют все проекты, ни один её не переопределяет), с одним исключением, отмеченным ниже.
Пилотная таблица, с 29 сентября 2026
| Роль | Модель | Effort | Почему |
|---|---|---|---|
| Лид | Opus 5.5 | medium | Решения и приёмка; ошибка расходится по команде. Чтение из кэша — 81% веса, так что Sonnet сэкономил бы лишь 10%. |
| Разработчик | Opus 5.5 | medium | Код с инвариантами. Разрыв в бенчмарках Anthropic шире всего на трудном коде. |
| Ревьюер | Opus 5.5 | high | Последний фильтр перед выкладкой, ради него стоит взять более сильную настройку. Anthropic указывает high для трудных задач по коду и агентных задач. |
| Интеграция | Sonnet 5.5 | medium | Процедура по шагам: слить, собрать, проверить, выкатить. Sonnet впереди на Terminal-Bench. |
| Фронтенд | Sonnet 5.5 | medium | Чётко очерченная работа с интерфейсом по понятным правилам. |
| Документация, копирайтер лендинга, маркетолог | Sonnet 5.5 | medium | Документы и тексты: чётко очерченная рутинная работа, возвраты редки (документация 7%, копирайтер 0 из 98). |
| Эксперт по редакциям | Sonnet 5.5 | high | Правила, которые попадают в лицензию; high компенсирует более лёгкую модель. |
| Дизайнер, UX | Opus 5.5 | medium | Вкус и суждение, при небольшой цене. |
| Юрист | Opus 5.5 | high | Юридический текст, где ошибка стоит денег. |
| Роли, которые работают с ключами и криптографией | Opus 5.5 | high | Рекомендуется, пока не применено: строки в шаблоне нет. Их работа возвращается чаще всего. |
Строки мы выбирали отчасти по тому, как часто ревьюер возвращал работу роли. Это отказы ревьюера по роли автора с 24 сентября 2026 года, с размерами выборок:
- Роли, которые работают с ключами и криптографией: 25% (13 из 52), небольшая выборка.
- Юрист: 25% (1 из 4), совсем маленькая выборка.
- Разработчик: 12% (32 из 271).
- Интеграция: 9% (8 из 86).
- Документация: 7% (4 из 54).
- Дизайнер: 7% (1 из 15), совсем маленькая выборка.
- Фронтенд: 2% (2 из 87).
- Копирайтер лендинга: 0 из 98.
Доля возвратов говорит, как часто проверка что-то нашла, а не насколько хорош автор. Читайте её как подсказку, куда потратить более сильную настройку, и не более.
Две вещи, которые не стоит менять на ходу
Не меняйте модель внутри живой сессии. У каждой модели свой кэш промптов, поэтому после смены, по словам документации Claude Code, «следующий запрос читает всю историю разговора без попаданий в кэш»; пока кэш тёплый, Claude Code просит подтвердить смену. Выбирайте модель при запуске агента или при передаче дел. Та же страница отмечает, что opusplan, который использует Opus в режиме плана и Sonnet для выполнения, превращает каждое переключение режима плана в смену модели, а каждая смена начинает новый кэш (цитата в нашем переводе).
С effort мягче. На Opus 5.5 и Sonnet 5.5 смена effort в Claude Code сохраняет кэш (с ключом API или подпиской Claude). В API кэш сохраняет и смена effort для отдельного сообщения (это бета), а новое значение effort верхнего уровня между запросами не сохраняет, так что держите его постоянным внутри разговора, который опирается на кэш.
Ещё одно из руководства Anthropic по Sonnet 5.5 относится к списку рисков, а не к списку находок. Там сказано, что модель обучена противостоять внедрённым инструкциям и «иногда принимает настоящее сообщение пользователя за возможную инъекцию», особенно когда сообщение пользователя приходит сразу после результата инструмента посреди хода. В команде, где сообщения приходят, пока агент работает, за этим стоит следить. Мы записываем это как риск: на своей работе мы этого не видели (цитата в нашем переводе).
Другие харнесы — то же решение
«Выбор по ролям» не заканчивается на одном производителе. Настройки запуска в harnsy начинаются с харнеса (Claude Code, Codex или OpenCode) и только потом модель. Наши собственные цифры по Codex скудны и относятся к другому периоду: за все месяцы, что есть в файлах его сессий, средний шаг нёс 113–131 тыс. токенов контекста против 318 тыс. у Claude по всем нашим проектам за неделю выше, а 96,5% его входа шло из кэша против 99,0%. В сентябре Codex нёс примерно двадцатую часть входных токенов Claude. Это говорит о том, как мы его используем, а не о том, насколько он хорош. Сравнения качества у нас нет, поэтому мы его не делаем.
Что измерено, а что пока пилот
- Измерено
С 10 по 29 сентября, до пилота, наш продуктовый проект отправил 29 771 запрос, все на Opus 5.5 с effort medium, ни одного на Sonnet 5.5 или на high. Доли чтения из кэша, вес по ролям, возвраты ревьюера по ролям и арифметика цен.
- Оценено
Таблица ролей в том виде, как она применена, сдвигает неделю примерно на −2%: роли на Sonnet экономят около 146 $, а роли на high добавляют около 81 $, в итоге около −65 $ на неделе в 3 033 $ нашего продуктового проекта по ценам API. Таблица в первоначальном предложении, с большим числом ролей на high и на Sonnet, давала −1,5%. Для high принято +20% к стоимости (диапазон 10–40%).
- Пока не измерено
Как Sonnet 5.5 ведёт себя на нашей работе. Что high делает с числом шагов. Сколько недельного лимита тратит Sonnet по сравнению с Opus: Anthropic не публикует соотношения, а в Claude Code есть отдельные сообщения о лимите для семейств Opus и Sonnet.
Таблица попала в шаблоны ролей компании 29 сентября 2026 года, так что она новая и результатов нет. Вторая измеряемая неделя начнётся 6 октября или позже. Она сравнивает пилотную неделю с базовой неделей 23–29 сентября: расход по ролям, какая доля лимита Sonnet против лимита Opus тратится, доля возвратов по ролям, доработки человеком, неудачные выкладки и ошибки git у роли интеграции, скорость. Итог — решение по каждой роли: оставить, вернуть или поменять effort.
Где здесь harnsy
В harnsy у каждой роли есть раздел «Запуск» с тремя полями в таком порядке: среда, модель, effort. Среда — выбор, пустое значение наследуется. Модель — свободный текст с подсказками; лучше указывать полный id модели, потому что алиас сам переезжает на следующую версию. Effort появляется, только если у среды есть уровни: у Claude это low, medium, high, xhigh и max, у Codex свой список, у OpenCode их нет. При смене среды модель и effort очищаются.
Свой запуск в этом проекте: новые агенты роли стартуют с ним; при открытии и восстановлении агент остаётся на харнесе своего места и берёт модель и effort, только если харнес тот же.
Уровней два: шаблон компании, который наследуют все проекты, и собственная роль проекта, которая его перекрывает. Значение, заданное на один запуск, сильнее обоих. Изменение действует только для новых сессий (запуск, передача дел, восстановление): сохранение никого не перезапускает. Открытие или восстановление агента оставляет ту среду, в которой он уже работает, и берёт модель и effort роли, только если это среда роли.
Сам по себе выбор никакой вариант не удешевляет; он закрепляет сделанный вами выбор за ролью, и следующая передача дел начнётся на выбранной настройке. Наша таблица — лишь отправная точка для вашей первой недели, а вторая неделя скажет, что стоит оставить. Установите harnsy, чтобы задавать запуск по ролям.
Источники
- Anthropic, анонс Claude Sonnet 5.5, 28 сентября 2026: anthropic.com.
- Цены Claude API: platform.claude.com.
- Effort: platform.claude.com.
- Prompting Claude Sonnet 5.5: platform.claude.com.
- Claude Code, настройка модели: code.claude.com.
- Claude Code, расходы: code.claude.com.
- Claude Code, как он использует кэш промптов: code.claude.com.
Задайте модель и effort для каждой роли
harnsy соединяет ваших агентов Claude Code, Codex и OpenCode в одну команду с ролями, и каждая роль стартует с той средой, моделью и effort, которые вы выбрали.
Установить harnsy