Claude Opus 5 установил рекорд ARC-AGI-3 — но Witness охлаждает выводы

Claude Opus 5 установил рекорд ARC-AGI-3. Сверяем scorecard ARC Prize с частным Witness и отделяем рост рассуждений от заявлений об AGI.

Результат Claude Opus 5 в ARC-AGI-3 и Witness

Claude Opus 5 на ARC-AGI-3 набрал 30,16% и почти вчетверо поднял предыдущий официальный рекорд. Результат появился в проверенной карточке ARC Prize 24 июля 2026 года. Там же есть первая оговорка: модель тестировали на 25 публичных демонстрационных средах и только с уровнем рассуждений High.

Число 30,16% не означает, что модель решила треть задач. ARC-AGI-3 оценивает эффективность действий относительно человеческой базы. В официальной таблице новая версия Opus полностью прошла пять сред из 25. Отдельный частный тест Witness показал прирост к Opus 4.8, но гораздо меньший.

По состоянию на 26 июля 2026 года корректный вывод звучит так: ARC Prize подтвердил сильный скачок в публичном тесте адаптивного рассуждения. Столь же крупный перенос на другие незнакомые среды пока не подтверждён. Общие возможности, цену и API модели мы разбираем отдельно в материале о том, что изменилось в Claude Opus 5.

Проверка Результат модели Что важно учесть Источник
ARC-AGI-3 Public Demo 30,16% при High reasoning effort 25 публичных сред; это показатель эффективности действий, а не доля решённых задач ARC Prize
Полностью пройденные среды 5 из 25 получили 100% ARC Prize называет все пять ранее не пройденными ни одной моделью ARC Prize
Предыдущий официальный рекорд 7,78% у GPT-5.6 Sol Max ARC Prize сравнивает лучшие проверенные варианты моделей, хотя уровень усилий у них различается ARC Prize
Witness 43,4 ± 3,2 балла Частный набор с другой шкалой; текущие результаты предварительные и пока не воспроизводятся независимо Гуанхан Нин

Рекорд Claude Opus 5 на ARC-AGI-3: что подтверждено

Проверенная карточка ARC Prize фиксирует 30,16% для новой модели с уровнем рассуждений High. Прежний максимум принадлежал GPT-5.6 Sol Max и составлял 7,78%. ARC Prize также сообщает о пяти публичных средах, которые Opus 5 прошла на 100% и которые до этого не удавалось полностью пройти другим моделям.

В таблице результатов это AR25, FT09, LP85, R11L и S5I5. Следующая среда, VC33, получила 98,8%, поэтому записывать её в полностью пройденные нельзя. Именно здесь пересказ новости легко превращает пять подтверждённых побед в шесть.

В анонсе результата команда ARC Prize связала скачок с более сильным логическим рассуждением. По её наблюдениям, модель переводила пространственные задачи в алгебраическую запись и самостоятельно выводила уравнения отражения. Это анализ траекторий самой ARC Prize, а не объяснение Anthropic того, как модель обучали.

График ARC Prize с результатом Claude Opus 5 на ARC-AGI-3
Результат 30,16% заметно выше прежнего официального рекорда. Источник: ARC Prize.

Что измеряет ARC-AGI-3

ARC-AGI-3 состоит из 135 абстрактных интерактивных сред. Модель не получает правил и явной цели. Ей нужно исследовать интерфейс, понять механику, построить внутреннюю модель происходящего, выбрать цель и спланировать действия. Так ARC Prize пытается измерить адаптивное рассуждение в новой ситуации, а не воспроизведение известного ответа.

Оценка строится на Relative Human Action Efficiency, относительной эффективности действий человека. Завершить уровень недостаточно: система получает более высокий балл, если тратит на решение примерно столько же действий, сколько человек из базовой выборки. После обновления методики человеческая база привязана к медианному результату на каждом уровне. Подробно о прежних провалах моделей мы писали в разборе, какие ошибки ARC-AGI-3 находил у фронтирных систем.

Главное ограничение спрятано не в сноске, а в техническом отчёте ARC-AGI-3. Авторы прямо называют публичный набор демонстрацией формата и предупреждают, что результат на нём нельзя считать надёжной мерой прогресса к AGI. Публичные среды уже известны разработчикам, поэтому модели и обвязки могут становиться лучше именно в этом жанре задач.

Witness показал более узкий прирост

Гуанхан Нин проверил новую версию Opus на Witness, своём частном наборе интерактивных головоломок в духе ARC-AGI-3. При одинаковой обвязке и бюджете модель получила 43,4 ± 3,2 балла. Fable 5 набрала 43,8 ± 9,7, Kimi K3 — 42,8 ± 1,9. По этим интервалам три модели статистически не различаются. Opus 4.8 получила 34,8 балла.

Разница с предыдущей Opus есть, но она несопоставима со скачком с 7,78% до 30,16% в официальной карточке ARC Prize. Сравнивать сами числа 43,4 и 30,16% нельзя: у Witness другой набор, другая шкала и собственная нормализация эффективности.

Нин описал две характерные траектории. В задаче с классическими механиками The Witness новая модель вывела скрытые правила до первого действия и пять раз подряд построила одинаковое оптимальное решение. В более необычной задаче с «ластиками», которые поглощают нарушения ограничений, Opus 5 зацикливалась на заранее выбранной теории и уступила Opus 4.8.

Результаты Claude Opus 5, Fable 5, Kimi K3 и Opus 4.8 в тесте Witness
В предварительном частном тесте Witness Opus 5 статистически не отличается от Fable 5 и Kimi K3. Источник: Гуанхан Нин.

У этого контрсигнала жёсткие пределы. Автор Witness уточнил, что набор ещё не опубликован, текущая версия результатов предварительная, а состав игр не зафиксирован. Он также смягчил первоначальный вывод: перенос улучшений на Witness есть, просто он заметно слабее, чем на ARC-AGI-3.

Рекорд не доказывает AGI и не опровергнут Witness

Публичный результат на ARC-AGI-3 остаётся проверенным рекордом в заявленной конфигурации. Witness его не повторяет и не обязан повторять: это отдельный частный тест. Он показывает, что преимущество новой модели зависит от механики задачи и пока не выглядит одинаково большим за пределами официального публичного набора.

С другой стороны, Witness не доказывает загрязнение обучающих данных. Формат ARC-AGI-3 был опубликован до выхода Opus 5, поэтому Anthropic могла целенаправленно усиливать исследование среды, поиск правил и планирование. Из этого не следует, что компания обучала модель на точных тестовых заданиях. Данных для такого утверждения нет.

Грег Камрадт из ARC Prize обратил внимание ещё на одну проблему: вывод о слабой обобщаемости опирался на две показательные игры без полной детализации частного набора. Сам Witness тоже создан в жанре ARC-AGI-3. Рост на нём может отражать настоящий перенос навыков, пусть и менее резкий.

Поэтому крайние трактовки одинаково плохи. «Claude достиг AGI» игнорирует ограничения публичного набора. «Рекорд нарисован под тест» выдаёт правдоподобную гипотезу за установленный факт. Подробнее о таких ловушках есть в нашем материале о том, почему один результат теста нельзя читать без методики.

Коротко о смысле результата

Что означает 30,16%?

Claude Opus 5 установил проверенный рекорд ARC-AGI-3 Public Demo при High reasoning effort и полностью прошёл пять сред. Число 30,16% показывает эффективность действий относительно человеческой базы, а не долю решённых задач.

Доказывает ли рекорд появление AGI?

Нет. Подтверждён скачок в конкретном важном тесте адаптивного рассуждения. Witness показывает перенос части улучшений на другой набор, но отрыв там меньше, а данные пока частные и предварительные. Широкий прорыв к общему интеллекту ещё предстоит доказать.

Читайте также

Telegram-канал @toolarium