Claude Opus 5 установил рекорд ARC-AGI-3 — но Witness охлаждает выводы
Claude Opus 5 установил рекорд ARC-AGI-3. Сверяем scorecard ARC Prize с частным Witness и отделяем рост рассуждений от заявлений об AGI.
Claude Opus 5 на ARC-AGI-3 набрал 30,16% и почти вчетверо поднял предыдущий официальный рекорд. Результат появился в проверенной карточке ARC Prize 24 июля 2026 года. Там же есть первая оговорка: модель тестировали на 25 публичных демонстрационных средах и только с уровнем рассуждений High.
Число 30,16% не означает, что модель решила треть задач. ARC-AGI-3 оценивает эффективность действий относительно человеческой базы. В официальной таблице новая версия Opus полностью прошла пять сред из 25. Отдельный частный тест Witness показал прирост к Opus 4.8, но гораздо меньший.
По состоянию на 26 июля 2026 года корректный вывод звучит так: ARC Prize подтвердил сильный скачок в публичном тесте адаптивного рассуждения. Столь же крупный перенос на другие незнакомые среды пока не подтверждён. Общие возможности, цену и API модели мы разбираем отдельно в материале о том, что изменилось в Claude Opus 5.
| Проверка | Результат модели | Что важно учесть | Источник |
|---|---|---|---|
| ARC-AGI-3 Public Demo | 30,16% при High reasoning effort | 25 публичных сред; это показатель эффективности действий, а не доля решённых задач | ARC Prize |
| Полностью пройденные среды | 5 из 25 получили 100% | ARC Prize называет все пять ранее не пройденными ни одной моделью | ARC Prize |
| Предыдущий официальный рекорд | 7,78% у GPT-5.6 Sol Max | ARC Prize сравнивает лучшие проверенные варианты моделей, хотя уровень усилий у них различается | ARC Prize |
| Witness | 43,4 ± 3,2 балла | Частный набор с другой шкалой; текущие результаты предварительные и пока не воспроизводятся независимо | Гуанхан Нин |
Рекорд Claude Opus 5 на ARC-AGI-3: что подтверждено
Проверенная карточка ARC Prize фиксирует 30,16% для новой модели с уровнем рассуждений High. Прежний максимум принадлежал GPT-5.6 Sol Max и составлял 7,78%. ARC Prize также сообщает о пяти публичных средах, которые Opus 5 прошла на 100% и которые до этого не удавалось полностью пройти другим моделям.
В таблице результатов это AR25, FT09, LP85, R11L и S5I5. Следующая среда, VC33, получила 98,8%, поэтому записывать её в полностью пройденные нельзя. Именно здесь пересказ новости легко превращает пять подтверждённых побед в шесть.
В анонсе результата команда ARC Prize связала скачок с более сильным логическим рассуждением. По её наблюдениям, модель переводила пространственные задачи в алгебраическую запись и самостоятельно выводила уравнения отражения. Это анализ траекторий самой ARC Prize, а не объяснение Anthropic того, как модель обучали.

Что измеряет ARC-AGI-3
ARC-AGI-3 состоит из 135 абстрактных интерактивных сред. Модель не получает правил и явной цели. Ей нужно исследовать интерфейс, понять механику, построить внутреннюю модель происходящего, выбрать цель и спланировать действия. Так ARC Prize пытается измерить адаптивное рассуждение в новой ситуации, а не воспроизведение известного ответа.
Оценка строится на Relative Human Action Efficiency, относительной эффективности действий человека. Завершить уровень недостаточно: система получает более высокий балл, если тратит на решение примерно столько же действий, сколько человек из базовой выборки. После обновления методики человеческая база привязана к медианному результату на каждом уровне. Подробно о прежних провалах моделей мы писали в разборе, какие ошибки ARC-AGI-3 находил у фронтирных систем.
Главное ограничение спрятано не в сноске, а в техническом отчёте ARC-AGI-3. Авторы прямо называют публичный набор демонстрацией формата и предупреждают, что результат на нём нельзя считать надёжной мерой прогресса к AGI. Публичные среды уже известны разработчикам, поэтому модели и обвязки могут становиться лучше именно в этом жанре задач.
Witness показал более узкий прирост
Гуанхан Нин проверил новую версию Opus на Witness, своём частном наборе интерактивных головоломок в духе ARC-AGI-3. При одинаковой обвязке и бюджете модель получила 43,4 ± 3,2 балла. Fable 5 набрала 43,8 ± 9,7, Kimi K3 — 42,8 ± 1,9. По этим интервалам три модели статистически не различаются. Opus 4.8 получила 34,8 балла.
Разница с предыдущей Opus есть, но она несопоставима со скачком с 7,78% до 30,16% в официальной карточке ARC Prize. Сравнивать сами числа 43,4 и 30,16% нельзя: у Witness другой набор, другая шкала и собственная нормализация эффективности.
Нин описал две характерные траектории. В задаче с классическими механиками The Witness новая модель вывела скрытые правила до первого действия и пять раз подряд построила одинаковое оптимальное решение. В более необычной задаче с «ластиками», которые поглощают нарушения ограничений, Opus 5 зацикливалась на заранее выбранной теории и уступила Opus 4.8.

У этого контрсигнала жёсткие пределы. Автор Witness уточнил, что набор ещё не опубликован, текущая версия результатов предварительная, а состав игр не зафиксирован. Он также смягчил первоначальный вывод: перенос улучшений на Witness есть, просто он заметно слабее, чем на ARC-AGI-3.
Рекорд не доказывает AGI и не опровергнут Witness
Публичный результат на ARC-AGI-3 остаётся проверенным рекордом в заявленной конфигурации. Witness его не повторяет и не обязан повторять: это отдельный частный тест. Он показывает, что преимущество новой модели зависит от механики задачи и пока не выглядит одинаково большим за пределами официального публичного набора.
С другой стороны, Witness не доказывает загрязнение обучающих данных. Формат ARC-AGI-3 был опубликован до выхода Opus 5, поэтому Anthropic могла целенаправленно усиливать исследование среды, поиск правил и планирование. Из этого не следует, что компания обучала модель на точных тестовых заданиях. Данных для такого утверждения нет.
Грег Камрадт из ARC Prize обратил внимание ещё на одну проблему: вывод о слабой обобщаемости опирался на две показательные игры без полной детализации частного набора. Сам Witness тоже создан в жанре ARC-AGI-3. Рост на нём может отражать настоящий перенос навыков, пусть и менее резкий.
Поэтому крайние трактовки одинаково плохи. «Claude достиг AGI» игнорирует ограничения публичного набора. «Рекорд нарисован под тест» выдаёт правдоподобную гипотезу за установленный факт. Подробнее о таких ловушках есть в нашем материале о том, почему один результат теста нельзя читать без методики.
Коротко о смысле результата
Что означает 30,16%?
Claude Opus 5 установил проверенный рекорд ARC-AGI-3 Public Demo при High reasoning effort и полностью прошёл пять сред. Число 30,16% показывает эффективность действий относительно человеческой базы, а не долю решённых задач.
Доказывает ли рекорд появление AGI?
Нет. Подтверждён скачок в конкретном важном тесте адаптивного рассуждения. Witness показывает перенос части улучшений на другой набор, но отрыв там меньше, а данные пока частные и предварительные. Широкий прорыв к общему интеллекту ещё предстоит доказать.