Z.ai выпускает веса GLM-5.3 после проверки безопасности в сфере кибербезопасности
После дообучения GLM-5.3 достигла заявленного разработчиком результата 84.5% на CyberGym, что побудило Z.ai отложить публикацию скачиваемых весов для проверки безопасности.
Содержание · 11
- 1. Улучшение обеспечило дообучение, а не новая базовая модель
- 2. CyberGym измеряет воспроизводимое срабатывание уязвимостей
- 3. Эксплуатация улучшилась резко, но всё ещё уступает проприетарным моделям
- 4. Пауза по соображениям безопасности завершилась, и веса доступны
- Частые вопросы
- Что такое GLM-5.3?
- Достигла ли GLM-5.3 результата 84.5% на CyberGym независимо?
- Означает ли результат CyberGym, что GLM-5.3 — лучшая модель для взлома?
- Доступны ли веса GLM-5.3 сейчас?
- Почему Z.ai отложила публикацию весов?
- Источники
Z.ai выпустила скачиваемые веса GLM-5.3, удерживая их в течение двух недель для дополнительной оценки безопасности и усиления защитных мер. Компания запустила облачный доступ к модели 14 августа 2026 года, но отложила публикацию весов после того, как процесс дообучения дал неожиданно сильные возможности в области кибербезопасности.
Главный результат — заявленный разработчиком показатель 84.5% на CyberGym, что на 7.3 процентного пункта выше 77.2% у GLM-5.2. В текущей сравнительной таблице Z.ai GLM-5.3 опережает Fable 5 с 83.8% и GPT-5.6 Sol с 83.6% в рамках настройки оценки компании.
Этот результат требует важной оговорки: его получила Z.ai, а не независимый оператор бенчмарка. Тем не менее компания опубликовала необычно подробную информацию об агентном harness, числе задач, настройках инференса, сетевых ограничениях и методе подсчёта результатов.
1. Улучшение обеспечило дообучение, а не новая базовая модель
GLM-5.3 использует ту же базовую модель, что и GLM-5.2. По словам Z.ai, каждое заявленное улучшение стало результатом масштабирования дообучения в течение месяца между двумя релизами, а не нового прогона предобучения или изменения базовой модели.
Компания расширила число и разнообразие исполняемых сред, применяемых для обучения модели задачам с длинным горизонтом. В этих средах агент должен взаимодействовать с инструментами, наблюдать промежуточные результаты, пересматривать подход и продолжать работу, пока не выполнит задачу либо не исчерпает выделенный бюджет.
Стек обучения Z.ai объединяет IndexShare для обработки длинного контекста, SAO для обучения с подкреплением на задачах с длинным горизонтом и slime — её открытый асинхронный фреймворк обучения с подкреплением. Slime связывает обучение на основе Megatron с rollout-процессами SGLang и позволяет использовать песочницы для кода, верификаторы, математические задачи и агентные среды как компоненты генерации данных в процессе обучения.
Для GLM-5.3 Z.ai добавила в эту смесь дообучения примеры поиска уязвимостей и интерактивные среды безопасности. Предполагалось получить модель, способную анализировать код и рассуждать об уязвимостях. По данным компании, производительность на более поздних этапах эксплуатации улучшалась быстрее, чем ожидалось.
Это различие важно, поскольку «та же базовая модель» не означает, что поведение модели осталось по существу неизменным. Обучение с подкреплением может изменить то, как фиксированная предобученная модель планирует, использует инструменты, сохраняет настойчивость при сбоях и выбирает действия в рамках длительной задачи. GLM-5.3 показывает, что такие изменения способны существенно расширять возможности двойного назначения без нового цикла обучения базовой модели.
2. CyberGym измеряет воспроизводимое срабатывание уязвимостей
CyberGym был представлен исследователями из Калифорнийского университета в Беркли как бенчмарк для оценки агентов на реальных уязвимостях программного обеспечения. Его набор данных содержит 1,507 уязвимостей в 188 программных проектах, взятых из ошибок, которые уже были обнаружены и исправлены.
Бенчмарк в первую очередь требует от агента сгенерировать входные данные proof-of-concept, воспроизводящие известную уязвимость. Для успеха необходимо ориентироваться в кодовой базе, найти релевантные пути выполнения и создать входные данные, вызывающие сбой из точки входа программы. Это конкретнее, чем ответы на вопросы по кибербезопасности, но уже, чем проведение полноценной атаки на неизвестную цель.
Z.ai оценила GLM-5.3 на всех 1,507 задачах, используя Claude Code 2.1.207 в качестве агентного harness. Компания установила максимальный уровень усилий рассуждения, отключила веб-инструменты, разрешила до 128,000 сгенерированных токенов и не ввела ограничения времени для отдельных задач. Она сообщила результат Pass@1 для одного запуска.
Агент выполнялся внутри контейнера каждой задачи. Z.ai заявляет, что удалила метаданные Git и ограничила сетевой доступ небольшим белым списком доменов, включая источники пакетов, необходимые для установки инструментов, чтобы сократить возможности получения ответов или использования внешних сервисов.
Эти настройки делают результат 84.5% более интерпретируемым, но не превращают его в независимо воспроизведённый показатель. Агентные бенчмарки чувствительны к окружающему harness, доступным инструментам, контексту, политике повторных попыток, временному бюджету и мерам против жульничества. Сравнения наиболее убедительны, когда каждая модель тестируется в одной и той же раскрытой конфигурации.
CyberGym также не следует воспринимать как общий показатель «взлома». Он измеряет, способен ли агент воспроизводить известные уязвимости на основе исходного кода и связанных с задачей материалов. Поиск неизвестной ошибки, создание надёжного эксплойта, работа с развернутой целью и поддержание сквозной атаки требуют дополнительных возможностей.
3. Эксплуатация улучшилась резко, но всё ещё уступает проприетарным моделям
Z.ai протестировала GLM-5.3 на двух дополнительных бенчмарках, предназначенных для представления этапов после воспроизведения уязвимостей.
На ExploitBench GLM-5.3 набрала 54.4% против 24.4% у GLM-5.2. Рост на 30 пунктов более чем удвоил показатель предшественницы, однако текущая таблица Z.ai сообщает 78.0% для Fable 5 и 76.5% для GPT-5.6 Sol.
Для оценки ExploitBench использовался тот же harness Claude Code с отключённым веб-доступом и максимумом 300 раундов взаимодействия агента со средой. Z.ai рассчитала среднее покрытие по 41 задаче, каждая из которых запускалась в трёх ревизиях.
На ExploitGym GLM-5.3 выполнила 105 задач при нормализованном двухчасовом бюджете и 130 — при шестичасовом. GLM-5.2 выполнила соответственно 29 и 39 задач. Согласно таблице Z.ai, Fable 5 выполнила 181 и 247 задач, а GPT-5.6 Sol — 216 и 293.
ExploitGym содержит 869 задач. Его временные бюджеты нормализованы с учётом характерной для каждой модели скорости генерации токенов, поэтому эти значения представляют собой контролируемое сравнение, а не буквальное прошедшее время на идентичном оборудовании.
В совокупности результаты показывают две вещи. Наибольшие улучшения GLM-5.3 относительно GLM-5.2 проявились в более требовательных оценках эксплуатации, однако на тех же тестах модель всё ещё существенно уступала сильнейшим проприетарным системам. Поэтому лидерство в CyberGym не доказывает общего лидерства в автономной наступательной безопасности.
4. Пауза по соображениям безопасности завершилась, и веса доступны
При запуске 14 августа Z.ai заявила, что отложит выпуск открытых весов на две недели, пока завершает оценку безопасности и усиление защитных мер. Axios сообщал, что в этот промежуточный период отдельные партнёры по безопасности могли получить контролируемый доступ.
Эта задержка больше не актуальна. По состоянию на 2 сентября официальный репозиторий Hugging Face содержит файлы модели GLM-5.3 и инструкции по запуску модели через Transformers, vLLM, SGLang, KTransformers и другие фреймворки инференса. Hugging Face указывает, что checkpoint представляет собой модель с 753 миллиардами параметров, и перечисляет пользовательскую лицензию glm-5.3.
Карточка модели также раскрывает три настройки усилий рассуждения: low, high и max; по умолчанию используется max, и именно он необходим для воспроизведения заявленной Z.ai конфигурации бенчмарка.
Публикация весов меняет границу безопасности. Облачный провайдер может мониторить запросы, ограничивать инструменты, обновлять защитные меры или отзывать доступ. Скачанные веса можно развернуть приватно, модифицировать, дообучать и подключать к произвольным агентным фреймворкам без постоянного надзора со стороны первоначального разработчика.
Z.ai не опубликовала достаточно информации, чтобы независимо оценить, что изменилось в ходе двухнедельного периода усиления защиты. В объявлении о запуске указана цель задержки, но нет подробного отчёта по безопасности, списка мер снижения рисков или оценок до и после, демонстрирующих их эффект.
Компания представляет релиз как инструмент оборонительной безопасности. По её словам, модели GLM после экспертной проверки, фильтрации и дедупликации выявили 2,436 уязвимостей в 269 реальных проектах, включая 1,097 проблем со степенью серьёзности от средней до высокой. Эти итоги охватывают работу, проведённую начиная с GLM-5.2, и не должны относиться исключительно к GLM-5.3.
Для команд безопасности и сопровождающих open-source-проектов практическое изменение состоит в том, что высокопроизводительную модель анализа уязвимостей теперь можно оценивать и развертывать на приватном коде без отправки этого кода облачному провайдеру. Соответствующий риск заключается в том, что ту же автономность, навигацию по коду и генерацию proof-of-concept можно применять без контроля доступа Z.ai.
Частые вопросы
Что такое GLM-5.3?
GLM-5.3 — языковая модель Z.ai с 753 миллиардами параметров для программирования, использования инструментов, агентных задач с длинным горизонтом и задач кибербезопасности. Она использует ту же базовую модель, что и GLM-5.2, с дополнительным дообучением.
Достигла ли GLM-5.3 результата 84.5% на CyberGym независимо?
Независимое воспроизведение не упоминалось. Результат 84.5% был заявлен Z.ai с использованием раскрытой ею конфигурации оценки на основе Claude Code.
Означает ли результат CyberGym, что GLM-5.3 — лучшая модель для взлома?
Нет. CyberGym сосредоточен на воспроизведении известных уязвимостей по исходному коду. В более сложных сравнениях Z.ai на ExploitBench и ExploitGym GLM-5.3 уступала Fable 5 и GPT-5.6 Sol.
Доступны ли веса GLM-5.3 сейчас?
Да. Официальный репозиторий Hugging Face в настоящее время предоставляет скачиваемую модель и инструкции по локальному обслуживанию по лицензии glm-5.3.
Почему Z.ai отложила публикацию весов?
Z.ai заявила, что возможности модели в области кибербезопасности развивались в ходе дообучения быстрее, чем ожидалось, поэтому она удерживала веса в течение двух недель для дополнительной оценки безопасности и усиления защитных мер.
Источники
Share