Introducing GLM-5.3: Built to Code. Ready for Cyber Defense.
- Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model - A major leap in cybersecurity, setting a new standard among open models
GLM-5.3は、長時間のターミナル操作を含む「Terminal-Bench 3.0」、ソフトウェア開発タスクを扱う「DeepSWE v1.1」、長時間のエージェントタスクを評価する「Agents' Last Exam」の3つの公開ベンチマークすべてでClaude Opus 4.8を上回った。
Terminal-Bench 3.0とDeepSWE v1.1では、Fable 5(フォールバックあり)とGPT-5.6 Solに及ばなかった。一方、Agents' Last ExamではFable 5を上回り、GPT-5.6 Solとは28.5対28.6でほぼ並んだ。GLM-5.2との比較では、Terminal-Bench 3.0が4.6から28.3、DeepSWE v1.1が46.2から66.9、Agents' Last Examが23.8から28.5へ上昇した。