Frontier AI safety reviews: как проверяют модели до релиза

Разбираем frontier AI safety reviews: что проверяют до релиза, чем отличаются оценка и аудит и какие роли получают CAISI и независимые эксперты.

Указ США и blueprint OpenAI для frontier AI safety reviews

Проверено 20 июля 2026 года. Frontier AI safety reviews — это проверки самых мощных моделей до широкого выпуска или передачи внешним партнёрам. Они должны ответить на три вопроса: какие опасные возможности уже есть у модели, работают ли заявленные ограничения и сможет ли разработчик удержать под контролем веса, доступ и критические инциденты.

Единого обязательного стандарта в США пока нет. Указ президента США № 14409 поручил ведомствам создать закрытый тест продвинутых кибервозможностей и добровольный контур раннего доступа. OpenAI предложила более широкую федеральную систему: оценки CAISI, независимые технические проверки, ежегодные аудиты и отчётность об инцидентах. Этот материал сравнивает именно механизмы проверки. Узкий разбор указа № 14409 и его 30-дневного окна вынесен в отдельную статью.

Что проверяют до релиза frontier-модели

Сильный результат на обычном наборе задач ещё не показывает, насколько безопасно выпускать модель. Предрелизная проверка смотрит на возможности и защитные меры вместе. В предложении OpenAI перечислены киберриски, химические, биологические, радиологические и ядерные угрозы, потеря контроля, рассогласование поведения модели с намерениями разработчика и ускорение исследований ИИ с помощью самого ИИ.

Проверяющим нужны не только ответы модели на тесты. Они оценивают ограничения доступа, устойчивость защит, мониторинг внутренних развёртываний, защиту невыпущенных весов и процедуру работы с инцидентами. Поэтому evaluation и аудит — разные вещи. Оценка измеряет возможности и действие защит на конкретной версии модели. Аудит проверяет, исполняет ли компания собственную рамку безопасности, внутренние правила и требования к отчётности.

Четыре уровня проверки

Уровень Что проверяют Кто проводит Что получается на выходе
Внутренняя оценка разработчика Опасные возможности модели, ограничения и остаточный риск в конкретном сценарии запуска. Команда разработчика и приглашённые специалисты по поиску уязвимостей. Решение о выпуске, описание защит и публичная рамка безопасности.
Государственная оценка до выпуска В указе № 14409 — продвинутые кибервозможности и порог для категории covered frontier model. Федеральные ведомства США; определение порога возглавляет директор NSA при участии профильных структур. Классификация по порогу и данные для решения о защищённом раннем доступе. Указ не даёт государству права лицензировать релиз.
Независимая техническая проверка Возможности, внутренние развёртывания, безопасность модели, мониторинг и работа защит со временем. В предложении OpenAI — организации, сертифицированные CAISI. Отдельное заключение, которое не зависит только от самооценки лаборатории.
Аудит соблюдения требований Исполнение рамки безопасности, внутренний контроль, управление, отчётность об инцидентах и защита весов. Независимая третья сторона. Ежегодная проверка процесса, а не повтор одного набора тестов модели.

Последние два уровня пока относятся к проекту федеральной рамки OpenAI, а не к действующему общенациональному закону. Эта граница принципиальна: предложение компании описывает желаемую систему, но само по себе не создаёт обязанностей для других разработчиков.

Что уже задал указ США

Раздел Secure Frontier Model Deployment в указе № 14409 поручает федеральным ведомствам за 60 дней разработать и поддерживать закрытый тест продвинутых кибервозможностей. По результатам должен определяться порог, при котором модель считается covered frontier model именно для целей этого указа.

Вторая часть поручения — добровольная рамка работы с разработчиками. Компания сможет уточнить статус модели, предоставить государству защищённый доступ максимум на 30 дней до передачи модели другим доверенным партнёрам и вместе с ведомствами выбрать таких партнёров. Требования к конфиденциальности, кибербезопасности, внутренним угрозам и интеллектуальной собственности должны быть частью этой процедуры.

Официальная страница указа США № 14409 о безопасности и инновациях в сфере ИИ
Указ № 14409 поручает создать закрытый кибербенчмарк и добровольную процедуру раннего доступа к отдельным frontier-моделям. Источник: White House.

Указ охватывает только один срез проверки: продвинутые кибервозможности. В нём нет режима ежегодного аудита, публичных отчётов о соблюдении рамки безопасности или общей обязанности сообщать о критических инцидентах. Подробно практическая схема раннего доступа в США разобрана в отдельном материале.

Чем рамка OpenAI шире указа

Blueprint OpenAI от 2 июня 2026 года предлагает федеральную систему из трёх частей: общие правила на основе законов штатов, усиление CAISI и государственный план устойчивости к рискам frontier AI. Документ расширяет и набор угроз, и состав проверок.

  • Крупные разработчики должны оценивать киберриски, риски в области химии и биологии, потерю контроля, рассогласование и прогресс в ускорении исследований ИИ.
  • Компании должны публиковать рамки безопасности и отчёты о том, как они оценивают риск, применяют защитные меры и принимают решения о выпуске.
  • Независимая сторона должна ежегодно проверять исполнение требований, внутренний контроль и систему управления.
  • Критические инциденты и несанкционированный доступ к чувствительным весам модели должны попадать в отдельную отчётность.
  • Невыпущенные веса предлагается защищать от внешних атак и внутренних злоупотреблений, а сотрудников — от преследования за обоснованные сообщения о серьёзных рисках.
Первая страница плана OpenAI по федеральной рамке безопасности frontier AI
OpenAI предлагает объединить оценки моделей, независимые проверки, аудиты, отчётность и защиту весов в одной федеральной рамке. Источник: OpenAI.

Самая заметная часть предложения касается CAISI. После набора специалистов, полномочий, финансирования и защищённой вычислительной инфраструктуры центр должен оценивать самые мощные модели до публичного выпуска. При этом OpenAI отдельно пишет, что CAISI должен проводить оценку и рекомендовать меры снижения риска, но не одобрять и не запрещать запуск. Решение о выпуске остаётся за разработчиком, который обязан раскрыть результаты и свою реакцию на них.

Как разделены роли CAISI, независимого оценщика и аудитора

CAISI при NIST позиционируется как основная точка контакта индустрии с правительством США по тестированию коммерческих ИИ-систем и совместным исследованиям. У государства есть доступ к закрытым данным и экспертизе в национальной безопасности, которых нет у обычного аудитора. Зато один государственный центр не может постоянно проверять все версии моделей и внутренние процессы каждой компании.

Поэтому OpenAI предлагает разделить роли. CAISI разрабатывает методы, проводит оценки самых мощных систем и сертифицирует сторонних проверяющих. Независимые технические организации наблюдают, как меняются возможности и защиты между крупными релизами. Аудиторы проверяют соблюдение правил внутри компании. Такая схема снижает зависимость от одной лаборатории или одного государственного ведомства.

Где рамки расходятся

Американский указ, blueprint OpenAI и европейская система отвечают на разные вопросы. Указ № 14409 нужен федеральным ведомствам для кибербезопасности и раннего доступа к отдельным моделям. OpenAI предлагает постоянные институты и требования к крупнейшим разработчикам. В ЕС спор чаще упирается в полномочия органов надзора и доступ к закрытым моделям; об этом есть отдельный разбор проверки frontier AI в Евросоюзе.

Законы штатов добавляют ещё один слой. OpenAI называет California SB 53, New York RAISE Act и Illinois SB 315 основой для будущей федеральной рамки. Иллинойсский SB 315, например, относится к отчётности, рамкам безопасности и реакции на инциденты. Эти правила не заменяют техническую оценку модели, но задают требования к тому, как компания её организует и документирует.

Как читать результат safety review

Фраза «модель прошла проверку» почти ничего не говорит без метода и условий. Полезный отчёт должен отвечать хотя бы на пять вопросов:

  • какую версию модели и какой способ развёртывания проверяли;
  • какие опасные возможности измеряли и где проходит порог риска;
  • проверяли ли модель с включёнными защитами и без них;
  • кто получил доступ к исходным данным, журналам и внутренним тестам;
  • какие ограничения разработчик добавил после оценки.

Без этих деталей safety review легко превращается в значок качества. Особенно опасно смешивать оценку возможностей с аудитом компании: модель может успешно пройти один тест, пока процедура обработки инцидентов или защита её весов остаётся слабой.

FAQ

Что такое frontier AI safety reviews?

Это предрелизные и периодические проверки самых мощных ИИ-моделей. Они измеряют опасные возможности, работу защит, безопасность весов и готовность разработчика выявлять и раскрывать критические инциденты.

Обязательны ли такие проверки в США?

Указ № 14409 создаёт добровольную рамку раннего доступа и прямо исключает обязательное лицензирование или предварительное разрешение релизов. Обязательные оценки CAISI и ежегодные аудиты описаны в предложении OpenAI, которое пока не стало федеральным законом.

Может ли CAISI запретить выпуск модели?

В blueprint OpenAI центр должен оценивать модели и рекомендовать меры снижения риска, но не одобрять и не блокировать выпуск. Решение остаётся за разработчиком, а подотчётность должна обеспечиваться раскрытием результатов, отчётностью и аудитом.

Главное

Frontier AI safety review шире одного бенчмарка и не даёт чиновнику права разрешать релиз. Рабочая система соединяет оценку возможностей, проверку защит, независимый контроль, аудит процессов, отчётность об инцидентах и защиту весов.

По состоянию на 20 июля 2026 года США только собирают эту систему из нескольких частей. Указ № 14409 задаёт добровольный киберконтур. OpenAI предлагает более строгую федеральную рамку. CAISI должен стать техническим центром, но его реальная роль будет зависеть от полномочий, специалистов, инфраструктуры и доступа к моделям.

Источники и дата проверки

  • White House: Executive Order 14409, опубликован 2 июня 2026 года; использован для закрытого кибербенчмарка, добровольного доступа максимум на 30 дней и ограничения на лицензирование, проверено 20 июля 2026 года.
  • OpenAI: A blueprint for democratic governance of frontier AI, опубликовано 3 июня 2026 года; использовано для структуры федерального предложения, проверено 20 июля 2026 года.
  • OpenAI: Democratic Governance of Frontier AI, документ от 2 июня 2026 года; использован для состава оценок, роли CAISI, независимых проверок, аудита, отчётности и защиты весов, проверено 20 июля 2026 года.
  • NIST: Center for AI Standards and Innovation, использован для текущего описания роли CAISI, проверено 20 июля 2026 года.
Telegram-канал @toolarium