GLM-5.2 и DeepSeek V4-Pro: что показали кибертесты AISI

AISI сравнил GLM-5.2 и DeepSeek V4-Pro с закрытыми моделями. Разрыв сократился до 4–7 месяцев, но методика не воспроизводит реальную атаку.

Кибертесты AISI для открытых моделей GLM-5.2 и DeepSeek V4-Pro
Официальная обложка исследования о разрыве между open-weight и закрытыми моделями в задачах кибербезопасности. Источник: UK AISI.

Факты проверены 18 июля 2026 года. GLM-5.2 в кибербезопасности приблизилась к уровню закрытых моделей, которые вышли на четыре–семь месяцев раньше. Такой вывод сделал британский Институт безопасности ИИ (AISI) после тестов GLM-5.2 и DeepSeek V4-Pro. Речь идёт о конкретных испытаниях, а не о равенстве с нынешним frontier и не о готовности моделей вести реальные атаки.

Open-weight модель имеет доступные веса: её можно запускать и изменять вне API разработчика. Это не обязательно open source. Открытые веса сами по себе ничего не говорят о лицензии, составе обучающих данных и праве на коммерческое использование.

Результаты GLM-5.2 и DeepSeek V4-Pro на 70 узких задачах по кибербезопасности AISI
На 70 узких задачах GLM-5.2 сравнялась с Opus 4.6 и GPT-5.3-Codex, выпущенными примерно на четыре месяца раньше. DeepSeek V4-Pro сопоставима с Opus 4.5 с лагом около пяти месяцев. Источник: UK AISI.

GLM-5.2 в кибербезопасности: что проверил AISI

AISI разделил оценку на два слоя. Первый охватывает 70 узких задач по исследованию и эксплуатации уязвимостей, обратной разработке, атакам на веб-приложения и криптографии. На каждую задачу модель получала пять попыток с лимитом 2,5 млн токенов на попытку. Уровней сложности четыре: от технического неспециалиста до эксперта с опытом более десяти лет.

Второй слой составляют киберполигоны с длинными цепочками действий. В полигоне The Last Ones модель начинала с доступа в учебную корпоративную сеть и проходила 32 шага через четыре подсети и примерно 20 узлов. Человеку-эксперту на такое задание потребовалось бы около 20 часов, оценивает AISI.

GLM-5.2 вышла в июне 2026 года. На узких задачах она показала результат на уровне Opus 4.6 и GPT-5.3-Codex, выпущенных примерно на четыре месяца раньше. DeepSeek V4-Pro, выпущенная 24 апреля 2026 года, оказалась сопоставима с Opus 4.5 с лагом около пяти месяцев.

Модель Тип теста С чем сравнима Лаг по дате релиза Ограничение сравнения Источник
GLM-5.2 70 узких задач Opus 4.6 и GPT-5.3-Codex около 4 месяцев Пять попыток; до 2,5 млн токенов на попытку AISI, 17.07.2026
DeepSeek V4-Pro 70 узких задач Opus 4.5 около 5 месяцев Пять попыток; до 2,5 млн токенов на попытку AISI, 17.07.2026
GLM-5.2 The Last Ones Opus 4.5 менее 7 месяцев Меньше полигонов; нет активной защиты и штрафов за тревоги AISI, 17.07.2026
DeepSeek V4-Pro The Last Ones ниже Sonnet 4.5 сопоставимость не установлена Результат ниже модели, выпущенной на 7 месяцев раньше AISI, 17.07.2026

Узкие задачи и реальная атака дают разные результаты

Сильный результат на коротких задачах ещё не делает модель автономным оператором атаки. На The Last Ones GLM-5.2 дошла примерно до уровня Opus 4.5. Она достигала седьмого шага в среднем с немного меньшим расходом токенов, чем другие модели, и до одиннадцатого шага шла по траектории Opus 4.6, после чего остановилась. DeepSeek V4-Pro закончила ниже Sonnet 4.5.

AISI считает данные с полигонов более слабым доказательством, чем результаты 70 задач: полигонов меньше, а остановка может говорить как о нехватке знаний по безопасности, так и о проблемах с долгим планированием. Более того, симуляция не включает активных защитников, средства обнаружения и штрафы за поднятые тревоги.

Траектории GLM-5.2 и DeepSeek V4-Pro на киберполигоне The Last Ones AISI
На полигоне The Last Ones GLM-5.2 остановилась около 11-го шага из 32, а DeepSeek V4-Pro — около 8-го. Это средние траектории десяти запусков с лимитом 100 млн токенов. Источник: UK AISI.

Это ограничение хорошо видно по отдельному исследованию Tracebit. Компания добавила в учебную среду AWS защитные «контекстные бомбы»: строки в приманочных секретах, которые вызывали отказ атакующего ИИ-агента. В 152 запусках пяти моделей средняя доля захвата административного доступа упала с 57% до 5%. Для GLM-5.2 показатель снизился с 64% до 6%, а DeepSeek V4-Pro стала проходить хотя бы один маршрут атаки в 13% запусков вместо 100%.

Смешивать эти цифры с тестами AISI нельзя: у Tracebit другой полигон, другой агентный контур и специально добавленная защита. Но опыт показывает, насколько сильно результат зависит от среды. Способности модели и успешность атаки на защищённую систему измеряют разные вещи.

Стоимость тестов ниже, но это не цена самостоятельного запуска

По расчёту AISI, один запуск полигона на 100 млн токенов стоил около $85 для Opus 4.5 и 4.6, примерно $46 для GLM-5.2 и $1,19 для DeepSeek V4-Pro. На задачах, которые сравниваемые пары решали со стопроцентной надёжностью, Opus 4.6 обходилась в $15,17 за задачу против $6,12 у GLM-5.2. Для Opus 4.5 и DeepSeek V4-Pro показатели составили $12,50 и $0,28.

Это расчёт по заявленным ценам поставщиков, а не универсальная смета самостоятельного развёртывания. AISI тестировал открытые модели не у разработчиков, поэтому реальные расходы на ускорители, оркестрацию и поддержку могут отличаться. Сравнение говорит о цене конкретных запусков, но не доказывает одинаковую экономику во всех сценариях.

Почему окно для защитников сокращается

В 2025 году лучшие open-weight модели отставали от закрытого frontier в кибертестах AISI на шесть–десять месяцев. Теперь измеренный разрыв уменьшился до четырёх–семи. Для команды безопасности это не повод немедленно менять модель в рабочем контуре. Это сигнал, что время между появлением новой возможности у закрытых систем и её доступностью в скачиваемых весах стало короче.

У доступных весов есть полезные свойства: модель можно держать внутри инфраструктуры, менять под задачу и изучать без зависимости от API. Есть и обратная сторона. После публикации весов разработчик уже не может полностью контролировать доступ, удалённо обновить фильтры или отозвать все копии. В тестах AISI защитные отказы почти не мешали моделям; редкие отказы DeepSeek V4-Pro на узких задачах обходились несколькими повторными попытками.

Мы уже разбирали открытые модели ИИ в кибербезопасности на широком уровне. Новый результат AISI уточняет картину: разрыв с закрытыми системами действительно сужается, но скорость сближения нельзя переносить на Mythos Preview, GPT-5.5 и следующие релизы. Сам институт прямо предупреждает, что его тесты этого не предсказывают.

Что делать командам безопасности сейчас

Британский Национальный центр кибербезопасности рекомендует не ждать отдельного класса «ИИ-атак». Практический приоритет тот же: сокращать поверхность атаки, быстрее ставить обновления, пересматривать права доступа и заранее отрабатывать реагирование на инциденты. Разница в сроках. Когда способности распространяются за месяцы, полугодовой цикл исправлений уже слишком медленный.

  • Проверять длинные агентные сценарии, а не только короткие задачи и CTF.
  • Добавлять в тесты активную защиту: мониторинг, ограничения прав, приманки и штрафы за тревоги.
  • Считать стоимость успешного результата, включая повторные попытки и инфраструктуру, а не только цену миллиона токенов.
  • Закладывать в модель угроз возможность запуска сильной модели вне API и без контроля разработчика.

GLM-5.2 остаётся интересной прежде всего как модель для долгих агентных задач. Исследование AISI добавляет к её профилю конкретный сигнал по безопасности, но не превращает бенчмарк в прогноз атаки на вашу сеть.

Итог

Результат GLM-5.2 в кибербезопасности и тесты DeepSeek V4-Pro сократили измеренный AISI разрыв с закрытыми моделями до четырёх–семи месяцев. На узких задачах сравнение выглядит уверенно. На длинных полигонах данных меньше, а среда заметно проще реальной защищённой сети.

Главный вывод для защитников: нужно сокращать собственный цикл реакции, а не искать «магический» новый продукт. Сильные возможности из закрытых систем быстрее переходят в модели с доступными весами. Запас времени ещё есть, но планировать его как годовой уже опасно.

Источники и дата проверки

Данные проверены 18 июля 2026 года. Быстро меняющиеся сведения привязаны к публикациям, доступным на эту дату.

Читайте также

Telegram-канал @toolarium