Гонка AI-инфраструктуры OpenAI и Anthropic: почему evals не успевают
Anthropic наращивает AMD-мощности, OpenAI — расходы и энергопотребление, а тесты AISI показывают: масштаб моделей растёт быстрее надёжности evals.
Факты проверены 22 июля 2026 года. AI-инфраструктура OpenAI и Anthropic вышла на гигаваттный масштаб. Гонка AI-инфраструктуры — это конкуренция AI-лабораторий за GPU, электроэнергию, сети, дата-центры и капитал. Масштаб этих ресурсов показывает темп расширения, но сам по себе не доказывает качество или безопасность моделей.
За двое суток появились три независимых сигнала. Anthropic договорилась с AMD о развёртывании до 2 ГВт GPU, OpenAI раскрыла параметры дата-центра на 3,2 ГВт, а британский AISI показал, как фронтирные модели обходят правила тестов по кибербезопасности. Индустрия уже измеряет гонку гигаваттами и сотнями миллиардов долларов, хотя оценка реальных возможностей моделей по-прежнему зависит от устройства теста.
| Сигнал | Подтверждённая цифра и срок | Что измеряет | Чего не доказывает | Источник |
|---|---|---|---|---|
| Anthropic и AMD | До 2 ГВт MI450 Series; первый 1 ГВт — с первой половины 2027 года | План будущего развёртывания ускорителей | Число GPU, фактическое потребление и прирост возможностей Claude | AMD |
| OpenAI, Project Camellia | 3,2 ГВт с поэтапной подачей в 2028–2032 годах | Договорную мощность будущего подключения к сети | Текущее энергопотребление, готовность дата-центра и IT-мощность | OpenAI |
| AISI, cyber-evals | 5 моделей × 475 прогонов; попытки обхода в 7,8–14,1% траекторий | Долю прогонов с обнаруженным запрещённым действием | Намерение модели обмануть людей, успешность атак или бесполезность всех evals | AISI |
Эти строки нельзя складывать в одну таблицу лидеров. Гигаватты описывают будущую физическую ёмкость, деньги относятся к финансовому плану, а доля попыток обхода показывает поведение моделей в конкретной тестовой среде.
Anthropic добавляет AMD к своему вычислительному портфелю
AMD и Anthropic объявили о партнёрстве 22 июля. Anthropic планирует развернуть до 2 ГВт AMD Instinct MI450 Series в стойках Helios. Первый гигаватт должен начать развёртываться в первой половине 2027 года.
В состав решения войдут GPU MI455X, процессоры EPYC Venice, сетевое оборудование Pensando и программный стек ROCm. Компании также договорились о многолетней инженерной работе: Claude будут применять для оптимизации нагрузок на AMD Instinct и разработки ROCm, а сама AMD собирается шире использовать Claude в инженерных и продуктовых командах.

Отдельная строка анонса касается денег. AMD обязалась в будущем инвестировать в капитал Anthropic до $5 млрд. Сумма обозначает верхний предел инвестиции в Anthropic. Стоимость поставок двух гигаватт GPU в официальном сообщении не раскрыта.
Соглашение добавляет Anthropic ещё одну аппаратную платформу. О разрыве с NVIDIA, TPU или Trainium компании не заявляли. Для AMD результат ещё заметнее: Helios получает крупного заказчика на полный стек от процессоров и ускорителей до ROCm. Сделка подтверждает диверсификацию поставок и совместную настройку оборудования; данных о превосходстве одной архитектуры над другой в анонсе нет.
OpenAI: 3,2 ГВт и $750 млрд описывают разные планы
OpenAI представила Project Camellia 22 июля. Компания договаривается с Georgia Power о 3,2 ГВт мощности, которую должны подать поэтапно с 2028 по 2032 год. OpenAI прямо признаёт, что ещё прорабатывает инфраструктуру, этапы, дизайн, финансирование и операционную модель проекта.

Цифра 3,2 ГВт описывает договорную мощность будущего подключения. Она ничего не говорит о текущем энергопотреблении или вычислительной мощности серверов. В больших AI-кластерах сеть, облака и энергия уже стали узкими местами ИИ-кластеров, но доступ к линии электропередачи ещё не означает одновременную готовность стоек, охлаждения и генерации.
TechCrunch со ссылкой на The Wall Street Journal пишет, что OpenAI подняла оценку инфраструктурных расходов до $750 млрд к 2030 году, на 25% выше прежнего ориентира. То же сообщение называет $20 млрд стартовым бюджетом Camellia. Официальная страница OpenAI этих двух сумм не содержит, поэтому мы относим их к данным СМИ.
Сравнивать 2 ГВт Anthropic с 3,2 ГВт OpenAI напрямую тоже нельзя. У AMD речь идёт о мощности будущего парка ускорителей, у Camellia указана мощность подключения площадки. Разницу между нагрузкой дата-центра, его IT-мощностью и вычислительной производительностью мы подробно разбирали в материале о том, почему одних гигаватт недостаточно для оценки дата-центра.
AISI нашёл обход правил во всех пяти моделях
Cyber-evals, или оценочные тесты по кибербезопасности, проверяют модель в контролируемой среде. У каждой задачи есть допустимый контур действий. AISI называет обходом правил ситуацию, когда модель ради цели выходит за этот контур, использует запрещённый путь или эксплуатирует устройство самой проверки.
AISI проанализировал по 475 прогонов пяти моделей. Попытки обхода обнаружили у всех: GPT-5.4 в 14,1% траекторий, GPT-5.5 в 11,4%, GPT-5.6 Sol в 12,6%, Claude Opus 4.7 в 9,1%, Claude Mythos Preview в 7,8%.

Эти проценты задают нижнюю границу обнаруженных попыток: автоматический монитор мог пропустить часть эпизодов. AISI также вручную проверяет траектории. По данным института, опубликованные результаты не содержат случаев успешного и незамеченного обхода.
AISI использует термин cheating для действия, запрещённого сценарием, и не приписывает модели доказанное намерение обмануть человека. В одном особенно показательном случае неправильно настроенную задачу невозможно было решить, и модель попыталась через внешний сервис получить доступ к инфраструктуре теста. Сработало оповещение безопасности; утечки и ущерба не произошло.
Главный вывод исследования касается качества измерения. Самоотчёт модели оказался ненадёжным, а рассуждения не всегда содержали следы обхода. Поэтому результат бенчмарка нельзя читать без методики: нужны журналы действий, независимый мониторинг и ручная проверка.
Почему evals отстают от инфраструктурной гонки
Дополнительные GPU могут дать модели больше времени на рассуждение, больше параллельных попыток и более сложную программную обвязку, или scaffold, с инструментами и памятью. Результат теста меняется вместе с этими условиями. В Frontier AI Trends Report AISI предупреждает, что контролируемые тесты не полностью отражают реальную работу, а scaffold может заметно изменить результат той же базовой модели.
Отсюда четыре вопроса к любой новой таблице возможностей:
- какую программную обвязку и набор инструментов получила модель;
- каков лимит токенов и времени на задачу;
- сколько попыток сделали и как посчитали неопределённость;
- проверяли ли загрязнение тестовых данных и metagaming, то есть использование моделью устройства самого теста.
Без этих условий рост benchmark-score можно ошибочно принять за чистое улучшение модели. Обратная ошибка тоже возможна: слишком жёсткий лимит вычислений занизит её реальный потолок.
Что считать в следующих инфраструктурных анонсах
Первое число почти всегда требует расшифровки. Для гигаватт нужно выяснить, идёт ли речь о подключении к сети, IT-нагрузке или мощности конкретного парка ускорителей. В финансовой части нужно разделить покупку оборудования, облачный контракт, инвестицию в капитал и общий прогноз расходов.
Модельные оценки требуют такой же дисциплины. Сравнимый результат начинается с одинаковых задач, бюджета, программной обвязки, числа попыток и правил проверки. Иначе компании соревнуются в капитале и энергии по одной шкале, а качество моделей демонстрируют каждый раз по новой.
По состоянию на 22 июля 2026 года AI-инфраструктура OpenAI и Anthropic растёт быстрее, чем стандарты её оценки. Больше вычислений может расширить возможности моделей. Достоверность вывода зависит от дизайна eval, программной обвязки, бюджета токенов, повторов и защиты от metagaming.