Begriff
DeepSeek V3.2
DeepSeek V3.2 (1. Dezember 2025) ist ein offenes MoE-Modell mit 685 Mrd. Parametern unter MIT-Lizenz — dank DeepSeek Sparse Attention besonders effizient bei langen Kontexten.
DeepSeek V3.2 — ausführlicher erklärt
DeepSeek veröffentlichte V3.2 am 1. Dezember 2025 als offenes Modell mit frei verfügbaren Gewichten unter MIT-Lizenz. Anders als proprietäre Modelle wie GPT oder Claude lässt sich V3.2 herunterladen und selbst hosten. Technisch ist es ein sehr großer Mixture-of-Experts-Transformer mit rund 685 Milliarden Parametern (etwa 690 GB Download). Kern der Version 3.2 sind zwei Effizienz-Mechanismen: DeepSeek Sparse Attention (DSA) und Multi-Head Latent Attention (MLA). DSA reduziert den Rechenaufwand vor allem bei langen Kontexten deutlich, ohne die Qualität stark zu senken.
Zusammen mit V3.2 erschien die Variante V3.2-Speciale, die ausschließlich auf tiefe Reasoning-Aufgaben trainiert wurde und Gold-Niveau bei Wettbewerben wie IMO, CMO, ICPC World Finals und IOI 2025 erreichte.
Beispiel / Praxisbezug
Für Anwender bedeutet die Sparse Attention konkret niedrigere Kosten bei langen Eingaben — etwa bei der Analyse großer Codebasen oder Dokumentsammlungen. DeepSeek nennt außerdem eine neue Methode zur Synthese von Agenten-Trainingsdaten über 1.800+ Umgebungen und 85.000+ komplexe Instruktionen; V3.2 integriert das Nachdenken direkt in die Werkzeugnutzung (Thinking-in-Tool-Use). Weil die Gewichte offen sind, eignet sich das Modell für Organisationen mit Daten-Souveränitäts-Anforderungen, die Inferenz auf eigener Infrastruktur betreiben wollen — statt an eine proprietäre API gebunden zu sein.
Abgrenzung
DeepSeek V3.2 gehört zur Klasse der offenen Gewichts-Modelle und steht damit im Gegensatz zu den geschlossenen APIs von OpenAI, Anthropic oder Google. Innerhalb der DeepSeek-V-Linie ist 3.2 der Nachfolger von V3.1 und schärft vor allem die Effizienz bei langem Kontext. Die Speciale-Variante ist kein Allzweckmodell, sondern ein auf Reasoning spezialisierter Ableger.