AI News글자 수 3324읽는 시간9

Z.ai, 사이버보안 안전성 검토 후 GLM-5.3 가중치 공개

GLM-5.3은 포스트 트레이닝 후 CyberGym에서 공급업체 보고 기준 84.5%를 기록했으며, Z.ai는 안전성 테스트를 위해 다운로드 가능한 가중치 공개를 연기했다.

목차 · 11
  1. 1. 향상은 새로운 베이스 모델이 아니라 포스트 트레이닝에서 나왔다
  2. 2. CyberGym은 재현 가능한 취약점 트리거링을 측정한다
  3. 3. 익스플로잇 성능은 크게 향상됐지만 여전히 독점 모델에 뒤처진다
  4. 4. 안전성 공개 연기는 종료됐으며 가중치를 사용할 수 있다
  5. 자주 묻는 질문
  6. GLM-5.3이란 무엇인가요?
  7. GLM-5.3은 독립적으로 CyberGym에서 84.5%를 달성했나요?
  8. CyberGym 결과는 GLM-5.3이 해킹에 가장 뛰어난 모델이라는 뜻인가요?
  9. GLM-5.3 가중치는 지금 사용할 수 있나요?
  10. Z.ai는 왜 가중치 공개를 연기했나요?
  11. 참고 자료

Z.ai는 추가 안전성 평가와 하드닝을 위해 2주간 보류했던 GLM-5.3의 다운로드 가능한 가중치를 공개했다. 회사는 2026년 8월 14일 모델의 호스팅 액세스를 출시했지만, 포스트 트레이닝 과정에서 예상보다 강력한 사이버보안 역량이 나타나자 가중치 공개를 연기했다.

핵심 결과는 공급업체 보고 기준 CyberGym 점수 84.5%로, GLM-5.2의 77.2%보다 7.3%포인트 높다. Z.ai의 현재 비교 표에서는 회사의 평가 설정하에 GLM-5.3이 Fable 5의 83.8%와 GPT-5.6 Sol의 83.6%를 앞선다.

이 결과에는 중요한 단서가 필요하다. 이는 독립 벤치마크 운영기관이 아닌 Z.ai가 산출한 결과다. 다만 회사는 실행에 사용한 에이전트 하니스, 태스크 수, 추론 설정, 네트워크 제한, 채점 방식에 관한 이례적으로 상세한 정보를 공개했다.

1. 향상은 새로운 베이스 모델이 아니라 포스트 트레이닝에서 나왔다

GLM-5.3은 GLM-5.2와 동일한 베이스 모델을 사용한다. Z.ai는 보고된 모든 개선이 추가 사전학습 실행이나 기반 베이스 모델 변경이 아니라 두 출시 사이 한 달 동안 포스트 트레이닝을 스케일링한 결과라고 밝혔다.

회사는 장기 범위 태스크에서 모델을 훈련하는 데 사용한 실행 가능한 환경의 수와 다양성을 확대했다. 이러한 환경에서는 에이전트가 도구와 상호작용하고, 중간 결과를 관찰하며, 접근 방식을 수정한 뒤 태스크를 완료하거나 예산을 모두 소진할 때까지 계속해야 한다.

Z.ai의 훈련 스택은 장문 컨텍스트 처리를 위한 IndexShare, 장기 범위 태스크 강화학습을 위한 SAO, 그리고 오픈 소스 비동기 강화학습 프레임워크인 slime을 결합한다. Slime은 Megatron 기반 훈련을 SGLang 롤아웃과 연결하고, 코드 샌드박스, 검증기, 수학 태스크, 에이전트 환경이 데이터 생성 구성 요소로서 훈련 과정에 들어갈 수 있게 한다.

GLM-5.3을 위해 Z.ai는 해당 포스트 트레이닝 혼합물에 취약점 발견 예시와 대화형 보안 환경을 추가했다. 의도한 결과는 코드를 검사하고 취약점을 추론할 수 있는 모델이었다. 회사에 따르면 익스플로잇의 후반 단계에 대한 성능은 예상보다 빠르게 향상됐다.

이 구분은 중요하다. “동일한 베이스 모델”이라고 해서 모델의 행동이 실질적으로 변하지 않았다는 뜻은 아니다. 강화학습은 고정된 사전학습 모델이 계획을 세우고, 도구를 사용하며, 실패를 견디고, 장기 태스크 전반에서 행동을 선택하는 방식을 바꿀 수 있다. GLM-5.3은 새로운 파운데이션 모델 훈련 실행 없이도 그러한 변화가 이중 용도 역량을 실질적으로 확장할 수 있음을 보여주는 사례다.

2. CyberGym은 재현 가능한 취약점 트리거링을 측정한다

CyberGym은 실제 소프트웨어 취약점에 맞서 에이전트를 평가하기 위한 벤치마크로 캘리포니아 대학교 버클리 연구진이 도입했다. 데이터셋에는 이미 발견되고 패치된 버그에서 추출한 188개 소프트웨어 프로젝트의 취약점 1,507개가 포함된다.

이 벤치마크는 주로 에이전트에게 알려진 취약점을 재현하는 개념 증명 입력을 생성하도록 요구한다. 성공하려면 코드베이스를 탐색하고, 관련 실행 경로를 찾아내며, 프로그램의 진입점에서 결함을 트리거하는 입력을 만들어야 한다. 이는 사이버보안 질문에 답하는 것보다 더 구체적이지만, 알려지지 않은 표적을 상대로 완전한 공격을 수행하는 것보다는 범위가 좁다.

Z.ai는 Claude Code 2.1.207을 에이전트 하니스로 사용해 1,507개 전체 태스크에서 GLM-5.3을 평가했다. 회사는 추론 노력을 최고 수준으로 설정하고, 웹 도구를 비활성화했으며, 생성 토큰을 최대 128,000개까지 허용하고, 태스크별 타임아웃은 두지 않았다. 보고한 점수는 단일 실행 Pass@1이다.

에이전트는 각 태스크 컨테이너 내부에서 실행됐다. Z.ai는 답을 검색하거나 외부 서비스를 사용하는 기회를 줄이기 위해 Git 메타데이터를 제거하고, 도구 설치에 필요한 패키지 소스를 포함한 소수의 도메인 화이트리스트로 네트워크 액세스를 제한했다고 밝혔다.

이 설정은 84.5% 결과를 더 해석하기 쉽게 만들지만, 독립적으로 재현된 점수로 만들지는 않는다. 에이전트 벤치마크는 주변 하니스, 사용 가능한 도구, 컨텍스트, 재시도 정책, 시간 예산, 부정행위 방지 통제에 민감하다. 모든 모델이 동일하게 공개된 구성에서 시험될 때 비교의 신뢰성이 가장 높다.

CyberGym 역시 일반적인 “해킹” 점수로 해석해서는 안 된다. 이는 에이전트가 소스 코드와 관련 태스크 자료를 바탕으로 알려진 취약점을 재현할 수 있는지를 측정한다. 알려지지 않은 결함을 찾고, 신뢰성 있는 익스플로잇을 구축하며, 배포된 표적을 탐색하고, 엔드투엔드 공격을 지속하려면 추가 역량이 필요하다.

3. 익스플로잇 성능은 크게 향상됐지만 여전히 독점 모델에 뒤처진다

Z.ai는 취약점 재현을 넘어선 단계를 나타내기 위해 설계된 두 가지 추가 벤치마크에서 GLM-5.3을 시험했다.

ExploitBench에서 GLM-5.3은 54.4%를 기록했으며, GLM-5.2의 점수는 24.4%였다. 30포인트 상승은 이전 모델의 점수를 두 배 이상으로 끌어올렸지만, 현재 Z.ai 표에는 Fable 5가 78.0%, GPT-5.6 Sol이 76.5%로 보고돼 있다.

ExploitBench 평가는 웹 액세스를 비활성화하고 에이전트-환경 상호작용 라운드를 최대 300회로 제한한 동일한 Claude Code 하니스를 사용했다. Z.ai는 각각 세 번의 리비전으로 실행한 41개 태스크에 걸쳐 평균 커버리지를 계산했다.

ExploitGym에서 GLM-5.3은 2시간 정규화 예산으로 105개 태스크를 완료했고, 6시간 예산으로는 130개를 완료했다. GLM-5.2는 각각 29개와 39개를 완료했다. Z.ai의 표에서 Fable 5는 181개와 247개를, GPT-5.6 Sol은 216개와 293개를 완료했다.

ExploitGym에는 869개 태스크가 포함된다. 시간 예산은 모델별 토큰 생성 속도를 사용해 정규화되므로, 이 수치는 동일 하드웨어에서의 실제 경과 시간이 아니라 통제된 비교를 나타낸다.

종합하면, 결과는 두 가지를 보여준다. GLM-5.3이 GLM-5.2 대비 얻은 가장 큰 향상은 더 까다로운 익스플로잇 평가에서 나타났지만, 모델은 동일 시험에서 가장 강력한 독점 시스템보다 여전히 크게 뒤처졌다. 따라서 CyberGym 선두는 자율형 공격 보안 전반에서의 선두를 입증하지 않는다.

4. 안전성 공개 연기는 종료됐으며 가중치를 사용할 수 있다

8월 14일 출시 당시 Z.ai는 안전성 평가와 하드닝을 완료하는 동안 오픈 웨이트 공개를 2주간 연기하겠다고 밝혔다. Axios는 그 중간 기간에 선정된 보안 파트너가 통제된 액세스를 받을 수 있다고 보도했다.

그 보류는 더 이상 현재 상황이 아니다. 9월 2일 기준 공식 Hugging Face 리포지토리에는 GLM-5.3 모델 파일과 Transformers, vLLM, SGLang, KTransformers 및 기타 추론 프레임워크를 통해 모델을 실행하는 방법이 담겨 있다. Hugging Face는 이 체크포인트를 7,530억 파라미터 모델로 식별하고 맞춤형 glm-5.3 라이선스를 기재한다.

모델 카드는 low, high, max의 세 가지 추론 노력 설정도 제공한다. 기본값은 max이며, Z.ai가 보고한 벤치마크 구성을 재현하려면 이 설정이 필요하다.

가중치 공개는 보안 경계를 바꾼다. 호스팅 제공업체는 요청을 모니터링하고, 도구를 제한하며, 안전장치를 업데이트하거나, 액세스를 철회할 수 있다. 다운로드한 가중치는 원 개발자의 지속적인 감독 없이 비공개로 배포, 수정, 파인튜닝되고 임의의 에이전트 프레임워크와 연결될 수 있다.

Z.ai는 2주간의 하드닝 기간 동안 무엇이 바뀌었는지 독립적으로 평가하기에 충분한 정보를 공개하지 않았다. 출시 발표문은 연기의 목적을 명시하지만, 상세한 안전성 보고서, 완화 조치 목록, 또는 그 효과를 보여주는 전후 평가를 제공하지 않는다.

회사는 이번 공개를 방어 보안 도구로 제시한다. GLM 모델은 전문가 검토, 선별, 중복 제거 후 269개 실제 프로젝트에서 취약점 2,436개를 식별했으며, 여기에는 중간에서 높은 심각도로 평가된 이슈 1,097개가 포함된다고 회사는 밝혔다. 이 합계는 GLM-5.2 이후 수행된 작업을 포괄하며, 오로지 GLM-5.3의 성과로 귀속해서는 안 된다.

보안 팀과 오픈 소스 유지관리자에게 실질적인 변화는 고성능 취약점 분석 모델을 코드를 호스팅 제공업체에 보내지 않고도 비공개 코드에서 평가하고 배포할 수 있게 됐다는 점이다. 이에 상응하는 위험은 동일한 자율성, 코드 탐색, 개념 증명 생성이 Z.ai의 액세스 통제 없이 적용될 수 있다는 것이다.

자주 묻는 질문

GLM-5.3이란 무엇인가요?

GLM-5.3은 코딩, 도구 사용, 장기 범위 에이전트 태스크, 사이버보안 작업을 위한 Z.ai의 7,530억 파라미터 언어 모델이다. GLM-5.2와 동일한 베이스 모델에 추가 포스트 트레이닝을 적용했다.

GLM-5.3은 독립적으로 CyberGym에서 84.5%를 달성했나요?

독립 재현 결과는 인용되지 않았다. 84.5% 결과는 Z.ai가 공개한 Claude Code 기반 평가 구성으로 보고한 것이다.

CyberGym 결과는 GLM-5.3이 해킹에 가장 뛰어난 모델이라는 뜻인가요?

아니다. CyberGym은 소스 코드에서 알려진 취약점을 재현하는 데 초점을 둔다. GLM-5.3은 Z.ai의 더 어려운 ExploitBench 및 ExploitGym 비교에서 Fable 5와 GPT-5.6 Sol에 뒤처졌다.

GLM-5.3 가중치는 지금 사용할 수 있나요?

그렇다. 공식 Hugging Face 리포지토리는 현재 glm-5.3 라이선스에 따라 다운로드 가능한 모델과 로컬 서빙 지침을 제공한다.

Z.ai는 왜 가중치 공개를 연기했나요?

Z.ai는 포스트 트레이닝 과정에서 모델의 사이버보안 역량이 예상보다 빠르게 발전했기 때문에, 추가 안전성 평가와 하드닝을 수행하고자 가중치를 2주간 보류했다고 밝혔다.

참고 자료

Share

이 글 공유