Zurück zum Glossar

Begriff

DeepSeek V3

DeepSeek V3 ist ein im Dezember 2024 veröffentlichtes offenes KI-Modell des chinesischen Anbieters DeepSeek. Es nutzt eine Mixture-of-Experts-Architektur mit 671 Milliarden Parametern (37 Mrd. aktiv je Token) und rund 128.000 Tokens Kontext.

DeepSeek V3 — ausführlicher erklärt

DeepSeek V3 ist ein offenes Sprachmodell (Open-Weight) des chinesischen Unternehmens DeepSeek, veröffentlicht im Dezember 2024. Der Code steht unter MIT-Lizenz, die Gewichte sind unter einem eigenen Modell-Abkommen frei verfügbar und kommerziell nutzbar. Damit lässt sich das Modell lokal oder auf eigener Infrastruktur betreiben.

Architektonisch ist DeepSeek V3 ein Mixture-of-Experts-Modell (MoE) mit insgesamt 671 Milliarden Parametern, von denen pro Token nur rund 37 Milliarden aktiviert werden. Das senkt die Rechenkosten je Anfrage erheblich. Zum Einsatz kommen Multi-head Latent Attention (MLA) und die DeepSeekMoE-Architektur; zusätzlich nutzt das Modell eine hilfsverlustfreie Lastverteilung und ein Multi-Token-Vorhersageziel im Training. Das Kontextfenster umfasst rund 128.000 Tokens.

Trainiert wurde DeepSeek V3 auf 14,8 Billionen überwiegend englischen und chinesischen Tokens über etwa 55 Tage auf 2.048 NVIDIA-H800-GPUs, bei geschätzten Trainingskosten von rund 5,6 Millionen US-Dollar. Diese Kosteneffizienz erregte in der Branche besondere Aufmerksamkeit.

Beispiel / Praxisbezug

DeepSeek V3 wird dort eingesetzt, wo starke Leistung bei niedrigen Betriebskosten gefragt ist — etwa in eigenem Hosting, bei Fine-Tuning-Projekten oder in Anwendungen, die Datenhoheit erfordern. Dank der MoE-Architektur bleibt der Rechenaufwand je Token trotz der großen Gesamtgröße moderat. Das Modell wird über zahlreiche Inferenz-Backends wie SGLang, vLLM und TensorRT-LLM unterstützt.

Abgrenzung

Als Open-Weight-Modell grenzt sich DeepSeek V3 von rein proprietären Modellen (etwa GPT oder Claude) ab. Innerhalb der DeepSeek-Reihe ist V3 das allgemeine Basismodell; darauf aufbauende Reasoning-Modelle (etwa die R-Reihe) sind gesondert auf schrittweises Schlussfolgern spezialisiert. Gegenüber anderen offenen Familien (Llama, Qwen) sticht V3 durch seine MoE-Effizienz und die geringen Trainingskosten hervor.

Alle Beiträge im Überblick:DeepSeek V