GLM-5.2 и DeepSeek V4-Pro: что показали кибертесты AISI
AISI сравнил GLM-5.2 и DeepSeek V4-Pro с закрытыми моделями. Разрыв сократился до 4–7 месяцев, но методика не воспроизводит реальную атаку.
Факты проверены 18 июля 2026 года. GLM-5.2 в кибербезопасности приблизилась к уровню закрытых моделей, которые вышли на четыре–семь месяцев раньше. Такой вывод сделал британский Институт безопасности ИИ (AISI) после тестов GLM-5.2 и DeepSeek V4-Pro. Речь идёт о конкретных испытаниях, а не о равенстве с нынешним frontier и не о готовности моделей вести реальные атаки.
Open-weight модель имеет доступные веса: её можно запускать и изменять вне API разработчика. Это не обязательно open source. Открытые веса сами по себе ничего не говорят о лицензии, составе обучающих данных и праве на коммерческое использование.

GLM-5.2 в кибербезопасности: что проверил AISI
AISI разделил оценку на два слоя. Первый охватывает 70 узких задач по исследованию и эксплуатации уязвимостей, обратной разработке, атакам на веб-приложения и криптографии. На каждую задачу модель получала пять попыток с лимитом 2,5 млн токенов на попытку. Уровней сложности четыре: от технического неспециалиста до эксперта с опытом более десяти лет.
Второй слой составляют киберполигоны с длинными цепочками действий. В полигоне The Last Ones модель начинала с доступа в учебную корпоративную сеть и проходила 32 шага через четыре подсети и примерно 20 узлов. Человеку-эксперту на такое задание потребовалось бы около 20 часов, оценивает AISI.
GLM-5.2 вышла в июне 2026 года. На узких задачах она показала результат на уровне Opus 4.6 и GPT-5.3-Codex, выпущенных примерно на четыре месяца раньше. DeepSeek V4-Pro, выпущенная 24 апреля 2026 года, оказалась сопоставима с Opus 4.5 с лагом около пяти месяцев.
| Модель | Тип теста | С чем сравнима | Лаг по дате релиза | Ограничение сравнения | Источник |
|---|---|---|---|---|---|
| GLM-5.2 | 70 узких задач | Opus 4.6 и GPT-5.3-Codex | около 4 месяцев | Пять попыток; до 2,5 млн токенов на попытку | AISI, 17.07.2026 |
| DeepSeek V4-Pro | 70 узких задач | Opus 4.5 | около 5 месяцев | Пять попыток; до 2,5 млн токенов на попытку | AISI, 17.07.2026 |
| GLM-5.2 | The Last Ones | Opus 4.5 | менее 7 месяцев | Меньше полигонов; нет активной защиты и штрафов за тревоги | AISI, 17.07.2026 |
| DeepSeek V4-Pro | The Last Ones | ниже Sonnet 4.5 | сопоставимость не установлена | Результат ниже модели, выпущенной на 7 месяцев раньше | AISI, 17.07.2026 |
Узкие задачи и реальная атака дают разные результаты
Сильный результат на коротких задачах ещё не делает модель автономным оператором атаки. На The Last Ones GLM-5.2 дошла примерно до уровня Opus 4.5. Она достигала седьмого шага в среднем с немного меньшим расходом токенов, чем другие модели, и до одиннадцатого шага шла по траектории Opus 4.6, после чего остановилась. DeepSeek V4-Pro закончила ниже Sonnet 4.5.
AISI считает данные с полигонов более слабым доказательством, чем результаты 70 задач: полигонов меньше, а остановка может говорить как о нехватке знаний по безопасности, так и о проблемах с долгим планированием. Более того, симуляция не включает активных защитников, средства обнаружения и штрафы за поднятые тревоги.

Это ограничение хорошо видно по отдельному исследованию Tracebit. Компания добавила в учебную среду AWS защитные «контекстные бомбы»: строки в приманочных секретах, которые вызывали отказ атакующего ИИ-агента. В 152 запусках пяти моделей средняя доля захвата административного доступа упала с 57% до 5%. Для GLM-5.2 показатель снизился с 64% до 6%, а DeepSeek V4-Pro стала проходить хотя бы один маршрут атаки в 13% запусков вместо 100%.
Смешивать эти цифры с тестами AISI нельзя: у Tracebit другой полигон, другой агентный контур и специально добавленная защита. Но опыт показывает, насколько сильно результат зависит от среды. Способности модели и успешность атаки на защищённую систему измеряют разные вещи.
Стоимость тестов ниже, но это не цена самостоятельного запуска
По расчёту AISI, один запуск полигона на 100 млн токенов стоил около $85 для Opus 4.5 и 4.6, примерно $46 для GLM-5.2 и $1,19 для DeepSeek V4-Pro. На задачах, которые сравниваемые пары решали со стопроцентной надёжностью, Opus 4.6 обходилась в $15,17 за задачу против $6,12 у GLM-5.2. Для Opus 4.5 и DeepSeek V4-Pro показатели составили $12,50 и $0,28.
Это расчёт по заявленным ценам поставщиков, а не универсальная смета самостоятельного развёртывания. AISI тестировал открытые модели не у разработчиков, поэтому реальные расходы на ускорители, оркестрацию и поддержку могут отличаться. Сравнение говорит о цене конкретных запусков, но не доказывает одинаковую экономику во всех сценариях.
Почему окно для защитников сокращается
В 2025 году лучшие open-weight модели отставали от закрытого frontier в кибертестах AISI на шесть–десять месяцев. Теперь измеренный разрыв уменьшился до четырёх–семи. Для команды безопасности это не повод немедленно менять модель в рабочем контуре. Это сигнал, что время между появлением новой возможности у закрытых систем и её доступностью в скачиваемых весах стало короче.
У доступных весов есть полезные свойства: модель можно держать внутри инфраструктуры, менять под задачу и изучать без зависимости от API. Есть и обратная сторона. После публикации весов разработчик уже не может полностью контролировать доступ, удалённо обновить фильтры или отозвать все копии. В тестах AISI защитные отказы почти не мешали моделям; редкие отказы DeepSeek V4-Pro на узких задачах обходились несколькими повторными попытками.
Мы уже разбирали открытые модели ИИ в кибербезопасности на широком уровне. Новый результат AISI уточняет картину: разрыв с закрытыми системами действительно сужается, но скорость сближения нельзя переносить на Mythos Preview, GPT-5.5 и следующие релизы. Сам институт прямо предупреждает, что его тесты этого не предсказывают.
Что делать командам безопасности сейчас
Британский Национальный центр кибербезопасности рекомендует не ждать отдельного класса «ИИ-атак». Практический приоритет тот же: сокращать поверхность атаки, быстрее ставить обновления, пересматривать права доступа и заранее отрабатывать реагирование на инциденты. Разница в сроках. Когда способности распространяются за месяцы, полугодовой цикл исправлений уже слишком медленный.
- Проверять длинные агентные сценарии, а не только короткие задачи и CTF.
- Добавлять в тесты активную защиту: мониторинг, ограничения прав, приманки и штрафы за тревоги.
- Считать стоимость успешного результата, включая повторные попытки и инфраструктуру, а не только цену миллиона токенов.
- Закладывать в модель угроз возможность запуска сильной модели вне API и без контроля разработчика.
GLM-5.2 остаётся интересной прежде всего как модель для долгих агентных задач. Исследование AISI добавляет к её профилю конкретный сигнал по безопасности, но не превращает бенчмарк в прогноз атаки на вашу сеть.
Итог
Результат GLM-5.2 в кибербезопасности и тесты DeepSeek V4-Pro сократили измеренный AISI разрыв с закрытыми моделями до четырёх–семи месяцев. На узких задачах сравнение выглядит уверенно. На длинных полигонах данных меньше, а среда заметно проще реальной защищённой сети.
Главный вывод для защитников: нужно сокращать собственный цикл реакции, а не искать «магический» новый продукт. Сильные возможности из закрытых систем быстрее переходят в модели с доступными весами. Запас времени ещё есть, но планировать его как годовой уже опасно.
Источники и дата проверки
Данные проверены 18 июля 2026 года. Быстро меняющиеся сведения привязаны к публикациям, доступным на эту дату.
- UK AISI: How Far Behind the Frontier are Leading Open Weight Models on Cyber?, 17 июля 2026 года. Методика, результаты, стоимость и ограничения.
- Tracebit Research: Context Bombs, июль 2026 года. 152 запуска с активной защитой и результаты GLM-5.2 и DeepSeek V4-Pro.
- Z.ai: GLM-5.2, Built for Long-Horizon Tasks, июнь 2026 года. Официальный анонс модели.
- DeepSeek: V4 Preview Release, 24 апреля 2026 года. Дата релиза V4-Pro и открытые веса.
- NCSC: The AI shift in cyber risk, 22 июня 2026 года. Рекомендации по базовым мерам защиты.