Ngày 14/08, Z.ai, công ty phát triển mô hình GLM đến từ Trung Quốc, chính thức ra mắt GLM-5.3. Điểm đáng chú ý nhất của bản nâng cấp này là nó dùng chung base model với GLM-5.2, toàn bộ cải thiện đến từ việc tăng quy mô giai đoạn post-training (huấn luyện sau), cụ thể là kỹ thuật học tăng cường (RL) chạy trên hạ tầng long-horizon mà Z.ai đã xây từ các phiên bản trước.

Trên khía cạnh lập trình, Z.ai tuyên bố GLM-5.3 là mô hình open-weights mạnh nhất hiện tại, với mức cải thiện gần 50% so với GLM-5.2 trên benchmark nội bộ Z.ai Code Bench. Trên các tiêu chuẩn công khai, model này đạt SOTA (đứng đầu) ở nhóm open-source tại Terminal Bench 3.0 (từ 4.6 lên 28.3 điểm) và Agents’ Last Exam. Điểm cộng đặc biệt là hiệu quả token: ở mức effort cao, GLM-5.3 đạt 31.4% chỉ với khoảng 50K token output, vượt Claude Opus 4.8 (29.5% với gần 120K token). Dù vậy, nó vẫn xếp sau Claude Fable 5 trên các bài test khó.

Điểm gây chú ý và cũng gây tranh cãi nhất của GLM-5.3 nằm ở thứ Z.ai gọi là “năng lực an ninh mạng tự bùng nổ” (emergent cyber capability). Họ đưa dữ liệu tìm kiếm lỗ hổng vào quá trình huấn luyện, và kết quả vượt xa kỳ vọng: model không chỉ nhận diện lỗi đơn lẻ mà còn hình thành các chuỗi khai thác hoàn chỉnh. Trên benchmark CyberGym, GLM-5.3 đạt 84.5%, dẫn đầu cả Fable 5 (83.8%) và GPT-5.6 Sol (83.6%). Tuy nhiên, càng lên cao trong chuỗi khai thác, khoảng cách tới các model đóng càng rộng — tại ExploitBench, GLM-5.3 tăng gấp đôi (từ 24.4 lên 54.4) nhưng vẫn thua xa Fable 5 (78%) và GPT-5.6 Sol (76.5%).

Ngoài benchmark, Z.ai cho biết đã hợp tác với nhiều đội an ninh tại Trung Quốc để chạy model trên các kho mã nguồn thực tế, phát hiện 2.436 lỗ hổng trên 269 dự án, trong đó có 1.097 lỗi mức medium đến high. Nhiều lỗi tồn tại hàng chục năm, có lỗi ra đời từ năm 1981. Để minh bạch, công ty lập Z.ai Security Disclosure Ledger công khai theo dõi quá trình phát hành các lỗ hổng này. Hiện con số được công bố là 53, số còn lại vẫn đang trong quá trình embargo.

Về độ mở, Z.ai cam kết phát hành bộ trọng số (weights) sau khoảng 2 tuần kể từ khi ra mắt, sau khi hoàn tất đánh giá và gia cố an toàn. Đây cũng là điểm cần cân nhắc: một mô hình open-weights sở hữu khả năng khai thác lỗ hổng mạnh như vậy được phát hành công khai vừa là tiến bộ khoa học, vừa là rủi ro an ninh cần theo dõi chặt.

Nhìn chung, GLM-5.3 cho thấy chiến lược “chỉ cần scale post-training” của Z.ai đang phát huy hiệu quả ở mảng lập trình, nhưng vẫn còn khoảng cách rõ rệt so với các model đóng hàng đầu ở những tác vụ khó nhất.