Claude Opus 5: что изменилось в новой модели Anthropic

Claude Opus 5: цена, API, ключевые изменения и первые тесты Artificial Analysis — качество, стоимость задачи и скорость модели.

Официальная иллюстрация Anthropic к анонсу Claude Opus 5

Факты проверены 25 июля 2026 года. Claude Opus 5 — новая модель Anthropic для сложных агентных задач, программирования и корпоративной работы. Она вышла 24 июля по базовой цене Opus 4.8: $5 за миллион входных и $25 за миллион выходных токенов.

Главное изменение скрыто не в рекордах на тестах, а в поведении модели. Режим рассуждения теперь включён по умолчанию, Opus 5 чаще перепроверяет результат и дольше доводит задачу до конца. Разработчикам придётся пересмотреть лимиты вывода, настройки effort и инструкции, которые раньше заставляли модель отдельно проверять свою работу.

Коротко

  • Идентификатор модели в Claude API — claude-opus-5; Opus 4.8 остаётся доступна.
  • Контекстное окно составляет 1 млн токенов, максимальный вывод — 128 тыс. токенов.
  • Thinking включён по умолчанию, а шкала effort получила уровни low, medium, high, xhigh и max.
  • Базовая цена не изменилась: $5/$25 за миллион входных/выходных токенов. Fast mode стоит $10/$50 и работает примерно в 2,5 раза быстрее.
  • Защитные ограничения уже, чем у Fable 5. На пользовательских сервисах заблокированный запрос по умолчанию уходит в Opus 4.8; в API автоматический fallback нужно включать отдельно.
Что изменилось Как работает Важная оговорка
Самопроверка результата Anthropic пишет, что Opus 5 чаще проверяет свою работу и повторяет попытки до успешного результата Это наблюдение компании и ранних клиентов, а не гарантия для любой задачи. Источник
Thinking и effort Thinking включён по умолчанию; доступны пять уровней effort вплоть до max Отключить thinking при xhigh или max нельзя: API вернёт ошибку 400. Источник
Защитные ограничения Модель может искать уязвимости в исходном коде, но блокирует часть задач по бинарному анализу, пентестам и созданию эксплойтов Anthropic оценивает, что классификаторы будут срабатывать примерно на 85% реже, чем у Fable 5. Это внутренний прогноз компании. Источник
Fallback в API Бета-функция может повторно отправить отклонённый запрос в рекомендованную резервную модель Функция не включена безусловно: нужен параметр fallbacks и бета-заголовок. Источник
Цена и Fast mode Обычный режим стоит $5/$25, быстрый — $10/$50 за миллион входных/выходных токенов Fast mode доступен как исследовательская версия только в Claude API, но не у облачных партнёров. Источник

Claude Opus 5 меняет поведение агентных систем

Anthropic описывает Opus 5 как более самостоятельную и настойчивую модель. В одном тесте она получила изображение детали без готового способа его просмотреть, написала собственный конвейер компьютерного зрения и восстановила трёхмерную модель. В другом случае нашла первопричину ошибки в популярном диспетчере пакетов и исправила крайний случай, пропущенный в патче сообщества.

Эти примеры показывают ожидаемый стиль работы, но не измеряют надёжность на произвольном проекте. Практическая рекомендация Anthropic интереснее: из системных инструкций стоит убрать требования вроде «обязательно проведи финальную проверку». Opus 5 и без них склонна перепроверять результат, а дублирующая команда может привести к лишним итерациям и расходу токенов.

Модель также чаще сообщает о ходе работы и охотнее делегирует задачи дочерним агентам. Для многоагентных систем это повод проверить бюджет, число параллельных исполнителей и условия остановки. Простая замена идентификатора модели может сделать прежний процесс длиннее и дороже, даже при той же цене токена.

Что нужно поменять в Claude API

Для миграции достаточно заменить claude-opus-4-8 на claude-opus-5, но поведение запроса изменится. На Opus 4.8 рассуждение нужно было включать явно. Opus 5 сама решает, когда и сколько рассуждать, если разработчик не передал другое значение thinking.

Параметр max_tokens ограничивает одновременно скрытое рассуждение и видимый ответ. Поэтому старый лимит может обрезать результат. Особенно это касается уровней xhigh и max, рассчитанных на длинные цепочки действий и работу с инструментами.

Есть и несовместимое изменение. thinking: {"type": "disabled"} принимается только при effort не выше high. Сочетание отключённого thinking с xhigh или max возвращает HTTP 400. При выключенном рассуждении документация также предупреждает о редких сбоях: модель может вывести вызов инструмента обычным текстом или показать внутренние XML-теги.

Контекстное окно Opus 5 составляет 1 млн токенов, максимальный вывод — 128 тыс. Минимальная длина кэшируемой подсказки снизилась с 1024 до 512 токенов. В бета-режиме разработчик может менять список инструментов между сообщениями и сохранять кэш подсказки.

Подробности возможностей предшественника собраны в нашем разборе Claude Opus 4.8 и агентных рабочих процессов.

График Anthropic: результат Claude Opus 5 на Frontier-Bench при разных уровнях effort и стоимости попытки
Anthropic сравнила модели на внутреннем прогоне Frontier-Bench v0.1. Каждую задачу запускали пять раз; при отказах классификатора для Opus 5 и Fable 5 использовалась Opus 4.8. График: Anthropic.

Бенчмарки Anthropic требуют оговорок

По данным Anthropic, Opus 5 получила 43,3% на Frontier-Bench v0.1 против 33,7% у Fable 5 и 21,1% у Opus 4.8. На ARC-AGI 3 заявлены 30,2%, а на OSWorld 2.0 — 70,6%. При этом Fable 5 немного впереди на DeepSWE и FrontierCode, а Mythos 5 лучше справляется с частью задач по кибербезопасности и биологии.

Эти цифры нельзя читать как независимую таблицу лидеров. Frontier-Bench в анонсе запускала сама Anthropic на mini-SWE-agent и инфраструктуре Google Kubernetes Engine, по пять попыток на задачу. Отказы Opus 5 и Fable 5 перенаправлялись в Opus 4.8. Такой fallback влияет на то, что именно измеряет итоговая цифра: одну модель или продуктовый маршрут из нескольких моделей.

Официальная таблица Anthropic с результатами Claude Opus 5, Fable 5, Opus 4.8 и GPT-5.6 Sol
Результаты из анонса Anthropic. Лучший показатель зависит от задачи: Opus 5 лидирует не во всех строках, а методика отличается между тестами. Изображение: Anthropic.

Корректный вывод уже маркетингового лозунга: в собственных тестах Anthropic Opus 5 заметно улучшилась относительно Opus 4.8 и приблизилась к Fable 5, но не заменила её во всех сценариях. Fable 5 остаётся более мощной широко доступной моделью Anthropic для самых сложных и продолжительных задач.

Что показывают первые сторонние тесты

Данные проверены 25 июля 2026 года. Artificial Analysis получила предрелизный доступ к Opus 5 при содействии Anthropic и прогнала модель по собственной методике. В режиме max она набрала 61 балл в Artificial Analysis Intelligence Index v4.1. Fable 5 в том же сравнении получила 60 баллов, GPT-5.6 Sol — 59, а Opus 4.8 — 56.

Показатель Opus 5 в режиме max Результат Как читать
Intelligence Index v4.1 61 балл Сводный индекс из девяти оценок. Источник
Средняя стоимость задачи $2,03 На 26% ниже результата Fable 5 с fallback ($2,75), но выше Opus 4.8 ($1,80) и Sonnet 5 ($1,53). Источник
Скорость и задержка 52,8 токена/с; 62,68 с до первого токена Скорость считается после начала ответа, поэтому её нельзя путать с полной задержкой. Источник
Расход на полный прогон индекса $3 835,51; 100 млн выходных токенов Показывает цену максимального effort на всём наборе, а не тариф API. Источник

Сторонний тест уточняет рекламную формулировку Anthropic. Токены Opus 5 действительно стоят вдвое дешевле, чем у Fable 5, но средняя стоимость завершённой задачи в этом прогоне снизилась на 26%, а не на 50%. Максимальный effort расходует больше токенов и заметно увеличивает ожидание первого ответа.

Есть ещё одна оговорка: прогоны Intelligence Index выполнялись с fallback на Opus 4.8. Итоговый балл описывает настроенный маршрут из моделей, а не только необработанные ответы Opus 5. Для сравнения на своём проекте нужны одинаковый effort, один агентный контур и стоимость успешно завершённой задачи.

Контроль тестовых доступов остаётся отдельной проблемой. Её хорошо показывает инцидент с OpenAI, Hugging Face и ExploitGym, а ограничения и воспроизводимость таких измерений мы разбирали в материале о том, почему оценки передовых моделей не успевают за самими моделями.

Как работают safeguards и автоматический fallback

Opus 5 получила более строгие ограничения только для узкого набора киберзадач. По описанию Anthropic, модель может искать уязвимости в исходном коде, но блокирует анализ бинарных файлов, тестирование на проникновение и создание эксплойтов. В биологии набор ограничений близок к Opus 4.8.

Компания ожидает, что защитные классификаторы Opus 5 будут срабатывать примерно на 85% реже, чем у Fable 5. Это прогноз по внутренним тестам Anthropic, а не независимо измеренная частота отказов у пользователей.

На Claude.ai, в Claude Code и Claude Cowork отклонённый запрос по умолчанию перенаправляется в Opus 4.8. В API разработчик должен сам включить серверный fallback. Режим fallbacks: "default" находится в бета-тестировании и требует заголовок server-side-fallback-2026-07-01. Без этой настройки нельзя обещать, что API автоматически ответит другой моделью.

Механизм уже применялся в старшей линейке; мы разбирали его в материале о том, как Anthropic возвращала доступ к Fable 5 через резервную модель.

Цена Claude Opus 5 и место в линейке

Базовая цена Claude Opus 5 совпадает с Opus 4.8: $5 за миллион входных и $25 за миллион выходных токенов. Fast mode работает примерно в 2,5 раза быстрее и стоит вдвое дороже — $10/$50. Режим доступен в Claude API как исследовательская версия; в Claude Code его можно использовать за кредиты использования (usage credits). У облачных партнёров Fast mode для Opus 5 пока нет.

Anthropic позиционирует Opus 5 между повседневными задачами и верхним уровнем Fable 5. Новая модель стала стандартной для подписки Claude Max и самой сильной моделью в Claude Pro. Fable 5 стоит $10/$50 и остаётся верхним уровнем для долгих агентных задач; Mythos 5 предназначена для ограниченного круга клиентов и специализированной работы.

Opus 5 доступна в Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry. Opus 4.8 компания не снимает с платформ, поэтому команды могут провести собственные тесты и мигрировать постепенно.

Кому стоит переходить на Opus 5

Миграция выглядит разумной для долгих задач программирования, исследований и процессов с инструментами, где Opus 4.8 требовала явной самопроверки. Перед заменой модели стоит сравнить не только качество ответа, но и число шагов, расход токенов, частоту делегирования и время до результата.

Минимальный тест для разработчика состоит из трёх частей: запустить собственный набор задач на Opus 4.8 и Opus 5, явно подобрать effort, затем проверить отказы с включённым и выключенным fallback. Такая проверка покажет реальную стоимость миграции лучше, чем средняя строка в чужом бенчмарке.

Telegram-канал @toolarium