GLM-5.3: Zhipus Open-Weights-Modell führt bei agentischem Coding

Redaktion · · 3 Min. Lesezeit

Zhipu AI (Marke Z.ai) hat am 14. August 2026 GLM-5.3 vorgestellt — das neue Flaggschiff seiner offenen GLM-Linie. Die offenen Gewichte folgten nach einem Risiko-Review um den 28. August 2026 auf Hugging Face. Der Punkt der Meldung ist nicht ein weiteres frei verfügbares Modell, sondern wo dieses landet: Bei agentischen Coding- und Security-Benchmarks erreicht GLM-5.3 die Spitze unter den offenen Modellen und reicht an proprietäre Frontier-Modelle heran.

Was passiert ist

Zhipu beschreibt GLM-5.3 mit dem Leitsatz „Scaling post-training is all we did for GLM-5.3”. Der Fortschritt gegenüber GLM-5.2 kommt also nicht aus einer neuen Architektur, sondern aus verstärktem Post-Training. Das Ergebnis ist ein Modell mit klarem Schwerpunkt: Coding und Cybersecurity, gemessen an agentischen Benchmarks — also Aufgaben, bei denen das Modell Werkzeuge aufruft, Zwischenergebnisse bewertet und über mehrere Schritte weiterarbeitet.

Der sichtbarste Sprung ist Terminal-Bench 3.0, das den Umgang mit einer Kommandozeile misst: von 4,6 auf 28,3. Bei Agents’ Last Exam (CLI) liegt GLM-5.3 mit 28,5 knapp hinter GPT-5.6 Sol (28,6) — der beste Wert unter den offenen Modellen. Bei den Security-Benchmarks CyberGym (84,5 Prozent) und ExploitBench (54,4 Prozent) zeigt sich derselbe Schwerpunkt.

Warum das wichtig ist

Bislang war die Domäne der langen, agentischen Coding-Läufe klar bei den teuren, geschlossenen Frontier-Modellen. Ein offenes Modell, das bei genau diesen Aufgaben an GPT-5.6 Sol heranreicht, verschiebt die Rechnung für alle, die selbst hosten wollen oder müssen — aus Datenschutz-, Kosten- oder Souveränitätsgründen.

Der Preis dafür ist Infrastruktur: Für den Betrieb der vollen Gewichte werden Berichten zufolge rund acht GPUs benötigt. GLM-5.3 ist damit keine Option für den Laptop, sondern für Betreiber mit eigener Hardware oder gemietetem GPU-Cluster. Wer diesen Aufwand tragen kann, bekommt eine der leistungsfähigsten offenen Alternativen zu proprietären Spitzenmodellen — mit voller Kontrolle über Gewichte und Daten.

Einzuordnen bleibt: Die Benchmark-Werte stammen zum großen Teil aus Zhipus eigener Messung. Unabhängige Reproduktionen folgen bei chinesischen Open-Weight-Releases typischerweise mit einigen Wochen Verzögerung und fallen oft nüchterner aus als die Erstankündigung.

Was du jetzt tun kannst

Wenn du Coding-Agenten oder Terminal-Workflows selbst hostest: Teste GLM-5.3 gegen dein aktuelles offenes Modell an einer echten Aufgabe, nicht an der Benchmark-Liste — und rechne den GPU-Bedarf ehrlich in die Kosten ein.

Wenn Datenhoheit dein Kriterium ist: GLM-5.3 gehört auf die Auswahlliste, sobald selbst-hostbare Modelle bei agentischem Coding infrage kommen. Die Details zu Architektur, Lizenz und Benchmarks stehen im Glossar-Eintrag → GLM-5.3, die Einordnung der Linie im Hub → GLM.

Alle Beiträge im Überblick:GLM