GLM-5.3: Zhipus Open-Weights-Modell führt bei agentischem Coding
Zhipu AI (Marke Z.ai) hat am 14. August 2026 GLM-5.3 vorgestellt — das neue Flaggschiff seiner offenen GLM-Linie. Die offenen Gewichte folgten nach einem Risiko-Review um den 28. August 2026 auf Hugging Face. Der Punkt der Meldung ist nicht ein weiteres frei verfügbares Modell, sondern wo dieses landet: Bei agentischen Coding- und Security-Benchmarks erreicht GLM-5.3 die Spitze unter den offenen Modellen und reicht an proprietäre Frontier-Modelle heran.
Was neu ist
- Release: 14. August 2026; offene Gewichte auf Hugging Face nach Risiko-Review um den 28. August 2026.
- Architektur: Mixture-of-Experts mit rund 744 Mrd. Parametern, davon etwa 40 Mrd. je Forward-Pass aktiv. Kontextfenster: 200.000 Token.
- Coding: rund 50 Prozent besser als GLM-5.2 im hauseigenen Benchmark; Terminal-Bench 3.0 von 4,6 auf 28,3 — Platz eins unter den offenen Modellen.
- Agenten/Security: Agents’ Last Exam (CLI) 28,5 (bester Open-Weight-Wert, knapp hinter GPT-5.6 Sol mit 28,6); CyberGym 84,5 Prozent, ExploitBench 54,4 Prozent.
Was passiert ist
Zhipu beschreibt GLM-5.3 mit dem Leitsatz „Scaling post-training is all we did for GLM-5.3”. Der Fortschritt gegenüber GLM-5.2 kommt also nicht aus einer neuen Architektur, sondern aus verstärktem Post-Training. Das Ergebnis ist ein Modell mit klarem Schwerpunkt: Coding und Cybersecurity, gemessen an agentischen Benchmarks — also Aufgaben, bei denen das Modell Werkzeuge aufruft, Zwischenergebnisse bewertet und über mehrere Schritte weiterarbeitet.
Der sichtbarste Sprung ist Terminal-Bench 3.0, das den Umgang mit einer Kommandozeile misst: von 4,6 auf 28,3. Bei Agents’ Last Exam (CLI) liegt GLM-5.3 mit 28,5 knapp hinter GPT-5.6 Sol (28,6) — der beste Wert unter den offenen Modellen. Bei den Security-Benchmarks CyberGym (84,5 Prozent) und ExploitBench (54,4 Prozent) zeigt sich derselbe Schwerpunkt.
Warum das wichtig ist
Bislang war die Domäne der langen, agentischen Coding-Läufe klar bei den teuren, geschlossenen Frontier-Modellen. Ein offenes Modell, das bei genau diesen Aufgaben an GPT-5.6 Sol heranreicht, verschiebt die Rechnung für alle, die selbst hosten wollen oder müssen — aus Datenschutz-, Kosten- oder Souveränitätsgründen.
Der Preis dafür ist Infrastruktur: Für den Betrieb der vollen Gewichte werden Berichten zufolge rund acht GPUs benötigt. GLM-5.3 ist damit keine Option für den Laptop, sondern für Betreiber mit eigener Hardware oder gemietetem GPU-Cluster. Wer diesen Aufwand tragen kann, bekommt eine der leistungsfähigsten offenen Alternativen zu proprietären Spitzenmodellen — mit voller Kontrolle über Gewichte und Daten.
Einzuordnen bleibt: Die Benchmark-Werte stammen zum großen Teil aus Zhipus eigener Messung. Unabhängige Reproduktionen folgen bei chinesischen Open-Weight-Releases typischerweise mit einigen Wochen Verzögerung und fallen oft nüchterner aus als die Erstankündigung.
Was du jetzt tun kannst
Wenn du Coding-Agenten oder Terminal-Workflows selbst hostest: Teste GLM-5.3 gegen dein aktuelles offenes Modell an einer echten Aufgabe, nicht an der Benchmark-Liste — und rechne den GPU-Bedarf ehrlich in die Kosten ein.
Wenn Datenhoheit dein Kriterium ist: GLM-5.3 gehört auf die Auswahlliste, sobald selbst-hostbare Modelle bei agentischem Coding infrage kommen. Die Details zu Architektur, Lizenz und Benchmarks stehen im Glossar-Eintrag → GLM-5.3, die Einordnung der Linie im Hub → GLM.