목차
출시와 방법론: 같은 베이스, 후속 학습만
중국 베이징의 Z.ai(구 Zhipu AI)는 2026년 8월 중순, 743B 파라미터 텍스트 모델 GLM-5.3을 GLM 코딩 플랜과 ZCode를 통해 공개했으며, 시장에서 가장 강력한 오픈 가중치 코딩 모델로 홍보한다 ¹². 핵심은 규모가 아니라 방법론이다. Z.ai는 GLM-5.3이 GLM-5.2와 동일한 베이스 모델을 쓰고 모든 개선이 포스트트레이닝에서 나왔다고 명시한다 ². 디크립트가 재인용한 Z.ai 출시 포스트의 표현은 “GLM-5.3을 만들면서 우리가 한 것은 포스트트레이닝 스케일링뿐”이다 ¹. 즉 지난 한 달간 더 많은 환경, 더 다양한 태스크, 더 많은 컴퓨트를 기존 스택에 투입했고, 더 큰 사전학습 모델을 키우는 대신 그 길을 택했다는 것이다 ¹. 베이스 모델 스케일링과 포스트트레이닝 스케일링 사이의 이 선택 자체가 이번 릴리스의 쟁점이며, 주목받는 오픈 가중치 연구소가 프런티어급 코딩·에이전트 능력을 고정된 베이스에서 뽑아내는 데 내기를 걸었다는 의미를 담는다. ¹
코딩 벤치마크 성적과 경쟁 구도
자체 벤치마크인 Z.ai 코드 벤치에서 Z.ai는 코딩 성능이 50% 개선됐다고 보고한다 ². Z.ai는 토큰 효율도 향상됐다고 주장한다 ¹. “Max” 노력 수준에서 34.5%로 GLM-5.2의 23.4%를 넘었고, 태스크당 출력 토큰은 약 75K로 전작의 96K보다 줄었다 ¹. 이 수치는 모두 자사 발표다. 공식 문서는 또 Terminal-Bench 3.0이 4.6에서 28.3으로, DeepSWE v1.1이 46.2에서 66.9로, Agents’ Last Exam(CLI)이 23.8에서 28.5로 올랐고, 44개 직종을 포괄하는 GDPval-AA v2에서 1769점을 기록했다고 적는다 ². 폐쇄형 프런티어 모델과 비교하면 우위는 좁아진다. GLM-5.3은 Claude Opus 4.8보다 토큰 경제성에서 앞서지만, Claude Fable 5는 자사 코드 벤치 Max 기준 39.5%로 GLM-5.3을 앞선다 ¹. Terminal-Bench 3.0에서는 Fable 5(33.7)와 GPT-5.6 Sol(34.6)이 28.3을 앞섰고, DeepSWE v1.1에서는 오픈 라이벌 Kimi K3(67.5)와 Fable 5(69.7)가 66.9보다 높다 ¹. 정리하면 전작과 여러 오픈 동료는 앞서지만, 헤드라인 코딩 보드의 선두는 여전히 미국의 폐쇄형 모델이 차지하고 있다는 그림이다. 이는 디크립트의 해석이자 수치와도 일치한다.
벤더가 자체적으로 지목한 사이버 역량 점프
이번 릴리스에서 가장 무겁고 또 가장 주의를 요하는 결과는 사이버 보안이다. Z.ai 문서는 “의외로 나타난 사이버 보안 역량(emergent cybersecurity capabilities)“을 언급하며 GLM-5.3이 CyberGym에서 84.5%로 Mythos 5(83.8%)와 GPT-5.6 Sol(83.6%)을 근소하게 앞섰고, ExploitBench는 24.4%에서 54.4%로 뛰었다고 밝힌다 ². 디크립트는 실험실을 인용해 GLM-5.3이 269개 오픈소스 프로젝트에서 2436개의 취약점을 지목했고 그중 1097개가 중간~높은 심각도였다고 보도한다 ¹. “의외로 나타났다”는 표현은 벤더의 자체 판단이다. 장기 태스크 환경을 넓히는 과정에서 기대 이상의 능력이 드러났으며, 그 우위는 주로 취약점 공격 체인의 전단계에 있고 더 깊은 착취와 완전한 공방 태스크에는 개선 여지가 남았다는 설명이다 ². 이 개선이 선택된 벤치마크 밖에서도 일반화되는지, 그리고 이 착취 점프가 진짜 프런티어급 능력을 반영하는지 아니면 벤치마크 아티팩트인지는 독립적으로 검증되지 않았다. 따라서 “의외의 점프”라는 표현은 출처를 밝힌 주장으로 취급해야지 확정된 사실로 보아서는 안 된다. ¹²
단계적 공개와 2주 가중치 보류
배포는 의도적으로 단계적이다. GLM-5.3은 GLM 코딩 플랜 전 등급(Max, Pro, Lite)과 ZCode에서 즉시 이용 가능하다 ²³¹. 전환 가이드를 보면 Claude Code·Codex 등 다양한 코딩 에이전트에서 커스터마이즈 모델로 불러오며, Anthropic 호환·OpenAI 호환 엔드포인트를 사용하고 1M 토큰 컨텍스트(“[1m]” 접미사)와 최대 128K 출력 토큰을 지원하며 사고 강도를 조절하는 “/effort” 명령도 제공한다 ³². API와 오픈 가중치는 “엄격한 안전성 평가 이후 단계적으로” 공개되며, 출시 포스트는 가중치 공개 시점을 약 2주 뒤로 잡고 있다 ¹. 즉 “오픈 가중치”라는 표현은 지금 다운로드할 수 있는 것을 가리키는 것이 아니라 앞으로 공개될 것을 가리킨다 ¹. 경제성도 매력 포인트다. 이 플랜은 포인트 쿼터제로 비수기 호출은 절반 가격이며, GLM-5.2 공식 API 요금은 백만 토큰당 입력 1.40달러·출력 4.40달러로 GPT-5.3-Codex(1.75달러·14달러)보다 훨씬 싸다 ¹. 다만 GLM-5.3 자체의 정확한 토큰당 요금은 확인한 출처에 명시돼 있지 않다. 한편 Z.ai는 미국 수출관리 명부(Entity List)에 올라 있어 미국 기업은 통제기술을 이 연구소에 수출할 수 없다 ¹. 정리하면 이번 릴리스는 저명한 오픈 가중치 연구소가 베이스 모델 스케일링 대신 포스트트레이닝 컴퓨트 스케일링에 건 큰 내기이며, 동시에 벤더가 스스로 경고한 사이버 착취 역량의 예기치 못한 점프를 동반했다. ¹