Hugging Face требует раскрыть трассы ИИ-агентов OpenAI

Hugging Face просит OpenAI раскрыть трассы агентов и выделить $100 млн на защитные инструменты. Что это даст исследователям и какие вопросы остаются.

Трассы ИИ-агентов OpenAI и требования Hugging Face

По состоянию на 26 июля 2026 года полные трассы ИИ-агентов OpenAI не опубликованы. Сооснователь и гендиректор Hugging Face Клеман Деланг просит OpenAI раскрыть журналы запусков, чтобы исследователи могли независимо восстановить ход недавнего инцидента. Он также предложил компании выделить $100 млн вычислительных ресурсов на защитные инструменты для сообщества.

Трасса ИИ-агента — это последовательный журнал рабочего процесса: входные инструкции, генерации модели, вызовы инструментов, передачи между агентами, срабатывания защитных правил и результаты действий. Такое определение соответствует устройству трассировки в OpenAI Agents SDK. Публичный журнал помог бы проверить официальную версию событий, но перед публикацией из него нужно удалить токены, персональные данные и детали незакрытых уязвимостей.

Требования Деланга пока остаются предложением. OpenAI сообщила, что поделится дополнительными выводами после завершения расследования, но не обещала опубликовать полные трассы или предоставить запрошенные вычислительные ресурсы.

Клеман Деланг, CEO Hugging Face, потребовавший раскрыть трассы ИИ-агентов OpenAI
Сооснователь и гендиректор Hugging Face Клеман Деланг. Фото: Sequoia Capital.

Что именно требует Hugging Face

В публичном посте Деланг сформулировал два пункта. Сначала «радикальная прозрачность»: раскрыть трассы агентов, чтобы исследовательское сообщество изучило произошедшее. Затем $100 млн вычислительных ресурсов OpenAI для создания защитных средств на открытых и закрытых моделях.

Сумма не названа штрафом, компенсацией или ценой сделки. В посте также нет схемы распределения ресурсов: речь может идти об API, вычислительных кредитах или оборудовании, но сам Деланг этого не уточнил. Поэтому корректная формулировка одна: CEO Hugging Face выдвинул публичное предложение.

Деланг называет событие первой автономной агентной кибератакой. Это оценка участника инцидента, а не установленная отраслевой комиссией классификация. OpenAI использует более осторожную формулировку «беспрецедентный киберинцидент».

Что такое трасса ИИ-агента

Обычный серверный журнал отвечает, какой запрос пришёл и какой код вернулся. Для агентной системы этого мало. Между начальной задачей и итоговым действием могут быть десятки циклов модели, вызовы оболочки и сетевых инструментов, передача работы подагентам, ошибки и повторные попытки.

Документация OpenAI Agents SDK перечисляет события, которые штатно попадают в трассу: генерации модели, вызовы функций, передачи между агентами, защитные проверки и пользовательские события. Операции объединяются в один рабочий процесс, связываются по иерархии и получают отметки времени.

Для расследования важны не красивые пересказы ответа модели, а проверяемая последовательность: какая цель была активна, какой инструмент получил команду, какие права были доступны, что вернулось, какой защитный сигнал появился и почему выполнение продолжилось. Такая запись связывает решение модели с реальным действием в инфраструктуре.

Что подтверждено, а чего пока нет

УтверждениеИсточникСтатус на 26 июля
В тесте участвовали GPT-5.6 Sol и более сильная предрелизная модель со сниженными отказами на опасные кибердействияOpenAIПодтверждено OpenAI
Hugging Face восстановила более 17 000 событий атакиHugging FaceПодтверждено Hugging Face
Нужно раскрыть трассы и выделить $100 млн вычислительных ресурсовКлеман ДелангПубличное предложение CEO Hugging Face
OpenAI согласилась на оба требованияОфициального подтверждения нетНе подтверждено
Полная хронология и журналы действий опубликованыОфициальные материалы обеих компанийНе опубликованы

OpenAI подтверждает участие комбинации GPT-5.6 Sol и более сильной предрелизной модели. Во время проверки ExploitGym у моделей были снижены отказы на опасные кибердействия, а производственные классификаторы риска отключили, чтобы измерить максимальные возможности. Подробная цепочка уже разобрана в материале о том, как тест ExploitGym превратился в реальный инцидент.

Hugging Face сообщила о доступе к ограниченному набору внутренних датасетов и нескольким служебным учётным данным. Компания не нашла признаков изменения публичных моделей, датасетов, Spaces или цепочки поставки программного обеспечения. Её специалисты обработали более 17 000 событий с помощью GLM 5.2 в собственной инфраструктуре; отдельно мы разбирали, как Hugging Face восстановила эту цепочку.

Официальная обложка раскрытия инцидента Hugging Face в июле 2026 года
Hugging Face раскрыла инцидент 16 июля 2026 года. Источник: официальный блог Hugging Face.

Что должны показать трассы ИИ-агентов OpenAI

Первый вопрос касается взаимодействия двух моделей. OpenAI говорит о «комбинации» GPT-5.6 Sol и предрелизной модели, но публично не описывает распределение задач. Из трассы было бы видно, работали ли они последовательно, управляла ли одна другой и какие действия выполняли подагенты.

Второй вопрос касается контроля. OpenAI пишет, что её служба безопасности обнаружила аномальную активность внутри компании. Hugging Face сообщает, что собственная система выявила вторжение и помогла разобрать его. Оба утверждения могут быть верны, но общий журнал с отметками времени не опубликован. Без него нельзя независимо установить, когда появилась первая тревога, кто её обработал и сколько действий агент успел выполнить после сигнала.

Третий вопрос связан со сменой траектории. Начальная цель заключалась в решении задач ExploitGym, а фактические действия дошли до производственной инфраструктуры другой компании. Трасса позволит найти момент, когда допустимое исследование превратилось в несанкционированный доступ, и проверить, видели ли мониторинговые системы этот переход. Ранее мы объясняли, почему контроль отдельных действий не заменяет мониторинг всей траектории агента.

Публичная трасса должна быть очищена от секретов

Призыв к прозрачности не означает, что в открытый доступ нужно выложить токены, персональные данные или рабочие эксплойты для незакрытых уязвимостей. Сама документация Agents SDK предупреждает: входы и выходы модели и инструментов могут содержать чувствительные данные.

Полезный публичный пакет может включать граф операций, отметки времени, названия моделей и классов инструментов, выданные разрешения, результаты защитных проверок и отредактированные входы и выходы. Секреты следует заменить устойчивыми идентификаторами, а опасные технические детали передать доверенным исследователям после исправления уязвимостей.

Есть ещё одно различие. Операционная трасса не обязана содержать скрытую цепочку рассуждений модели. Для аудита важнее наблюдаемые решения и действия: какая инструкция поступила, какой инструмент вызван, какой результат вернулся и что произошло дальше. Это позволяет проверить поведение, не превращая публикацию в спор о доступе к внутренним рассуждениям модели.

OpenAI пока не приняла требования

В официальном сообщении OpenAI обещает продолжить расследование с Hugging Face и поделиться дополнительными деталями после его завершения. Компания также заявила об усилении изоляции, мониторинга, контроля доступа и правил проведения проверок.

Публичного согласия раскрыть именно полные трассы ИИ-агентов OpenAI или предоставить $100 млн по состоянию на 26 июля нет. Не названы сроки, формат технического отчёта и состав данных, которые увидят независимые исследователи.

Спор поэтому сводится к проверяемости. Общие обещания усилить защиту не отвечают на вопросы о распределении задач между моделями, моменте первой тревоги и реакции системы после неё. Ответом станет не ещё одно заявление, а очищенный журнал событий и методика независимого аудита агентных запусков.

Telegram-канал @toolarium