Begriff
GLM-5.3
GLM-5.3 ist Zhipu AIs Open-Weights-Modell vom August 2026 — ein MoE-Modell mit Fokus auf Coding und Cybersecurity, das bei agentischen Benchmarks die Spitze der offenen Modelle erreicht.
GLM-5.3 — ausführlicher erklärt
GLM-5.3 ist ein Modell mit offenen Gewichten des chinesischen Anbieters Zhipu AI und erschien am 14. August 2026. Die GLM-Linie steht für leistungsstarke, frei verfügbare Modelle; Zhipu beschreibt 5.3 mit dem Leitsatz „Scaling post-training is all we did for GLM-5.3“, der Fortschritt entstand also primär durch verstärktes Post-Training. Der Schwerpunkt liegt auf Coding und Cybersecurity, wo das Modell auf agentischen Benchmarks die Spitze unter den offenen Modellen erreicht.
Eckdaten
- Release: 14. August 2026; offene Gewichte auf Hugging Face folgten nach einem Risiko-Review um den 28. August 2026.
- Architektur: Mixture-of-Experts mit rund 744 Mrd. Parametern, davon etwa 40 Mrd. je Forward-Pass aktiv.
- Kontextfenster: 200.000 Tokens.
- Coding: rund 50 Prozent besser als GLM-5.2 im hauseigenen Benchmark; Terminal-Bench 3.0 stieg von 4,6 auf 28,3 (Platz eins unter offenen Modellen).
- Agenten/Security: Agents’ Last Exam (CLI) 28,5 (bester Open-Weight-Wert, knapp hinter GPT-5.6 Sol mit 28,6); CyberGym 84,5 Prozent, ExploitBench 54,4 Prozent.
Beispiel / Praxisbezug
GLM-5.3 richtet sich an Betreiber, die ein Spitzen-Coding-Modell selbst hosten wollen — für Coding-Agenten, Terminal-basierte Workflows und Security-Analysen. Zu beachten ist der Ressourcenbedarf: Für den Betrieb der vollen Gewichte werden mehrere GPUs (Berichten zufolge rund acht) benötigt. Die starken agentischen Coding-Werte machen das Modell zu einer der leistungsfähigsten offenen Alternativen zu proprietären Frontier-Modellen.
Abgrenzung
GLM-5.3 ist der Nachfolger von GLM-5.2 und positioniert sich als offenes Gegenstück zu proprietären Spitzenmodellen wie GPT Sol und Claude Mythos 5, an die es bei einzelnen agentischen und Security-Benchmarks heranreicht oder sie knapp übertrifft. Gegenüber diesen bleibt der Vorteil der offenen Gewichte und der Selbst-Hosting-Fähigkeit; der Nachteil ist der hohe Infrastruktur-Aufwand. Direkte Vergleichsmodelle sind DeepSeek V3.1 und Qwen 3.6.