← VRAM Calculator

GLM

Zhipu AI / Z.ai · Dense & MoE · Juni 2025 – Juni 2026 · 151k–155k Vokabular · Lizenz: MIT (ab GLM-4.5)

glm4_moe Multimodal (V-Varianten) Thinking / Agentic Function Calling / MCP GQA-Attention MIT-Lizenz

Architektur & Parameter — Flaggschiffe (Server-/Multi-GPU-Hardware)

MoE 8/128 GLM-4.5-Air
Aktive Parameter12 B
Parameter gesamt106 B
Experten8 aktiv / 128 + 1 shared
Layer46
Hidden Dim4.096
AttentionGQA (96 Heads / 8 KV)
Kontextfenster128k Token
Vokabular151.552
VeröffentlichtJuli 2025
LizenzMIT
HuggingFacezai-org/GLM-4.5-Air
MoE 8/160 GLM-4.5
Aktive Parameter32 B
Parameter gesamt355 B
Experten8 aktiv / 160 + 1 shared
Layer92
Hidden Dim5.120
AttentionGQA (96 Heads / 8 KV)
Kontextfenster128k Token
Vokabular151.552
VeröffentlichtJuli 2025
LizenzMIT
HuggingFacezai-org/GLM-4.5
MoE 8/160 GLM-4.6
Aktive Parameter32 B
Parameter gesamt357 B
Experten8 aktiv / 160 + 1 shared
Layer92
Kontextfenster200k Token
Besonderheit~30 % weniger Tokenverbrauch als 4.5
VeröffentlichtSept./Okt. 2025
LizenzMIT
HuggingFacezai-org/GLM-4.6
MoE 8/160 GLM-4.7
Aktive Parameter~32 B
Parameter gesamt~358 B
Experten8 aktiv / 160 + 1 shared
Layer92
Kontextfenster200k Token
BesonderheitInterleaved/Preserved/Turn-Thinking · SWE-bench 73,8 %
VeröffentlichtJan. 2026
LizenzMIT
HuggingFacezai-org/GLM-4.7
MoE 8/256 GLM-5.2
Aktive Parameter~40 B
Parameter gesamt744 B
Experten8 aktiv / 256 + 1 shared
Layer78 (3 dense + 75 sparse)
AttentionDSA + IndexShare (Sparse)
Kontextfenster1.048.576 Token (1 M)
Besonderheit2 Thinking-Effort-Stufen (High/Max)
Veröffentlicht13. Juni 2026
LizenzMIT
HuggingFacezai-org/GLM-5.2

Architektur & Parameter — Kompakte & Vision-Modelle (Consumer-tauglich)

Dense GLM-4.1V-9B-Thinking
Parameter gesamt9 B
Layer40
Hidden Dim4.096
AttentionGQA (32 Heads / 2 KV)
Kontextfenster64k Token
Vokabular151.552
ModalitätenText · Bild
BasisGLM-4-9B-0414
VeröffentlichtJuni 2025
LizenzMIT
Dense GLM-4.6V-Flash
Parameter gesamt~9,4 B
Layer40
Hidden Dim4.096
AttentionGQA (32 Heads / 2 KV)
Kontextfenster128k Token
Vokabular151.552
ModalitätenText · Bild
Function CallingJa (MCP)
HinweisWerte aus lokalen GGUF-Metadaten
MoE 4/64 GLM-4.7-Flash
Aktive Parameter~3 B
Parameter gesamt30 B
Experten4 aktiv / 64 + 1 shared
Layer47
Hidden Dim2.048
Kontextfenster200k Token (Doku teils 128k)
Vokabular154.880
Function CallingJa (MCP)
Veröffentlicht19. Jan. 2026
LizenzMIT

VRAM-Kompatibilität — Flaggschiffe (Q4)

Modell Typ VRAM Q4 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. Intel Arc Pro B60 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
GLM-4.5-Air (106 B) MoE 8/128 ~60 GB Nicht möglich~10× größer als VRAM Nicht möglich~5× größer als VRAM Nicht möglich~3,8× größer als VRAM Nicht möglich~2,5× größer als VRAM Nicht möglichSprengt 16 GB RAM bei Weitem; nur mit 64 GB+ Unified RAM oder Multi-GPU nutzbar
GLM-4.5 (355 B) MoE 8/160 ~210 GB Nicht möglich~35× größer als VRAM Nicht möglich~17,5× größer als VRAM Nicht möglich~13× größer als VRAM Nicht möglich~8,8× größer als VRAM Nicht möglichNur Server-Hardware oder API praktikabel
GLM-4.6 (357 B) MoE 8/160 ~215 GB Nicht möglich~36× größer als VRAM Nicht möglich~18× größer als VRAM Nicht möglich~13,4× größer als VRAM Nicht möglich~9× größer als VRAM Nicht möglichNur Server-Hardware oder API praktikabel
GLM-4.7 (358 B) MoE 8/160 ~215 GB Nicht möglich~36× größer als VRAM Nicht möglich~18× größer als VRAM Nicht möglich~13,4× größer als VRAM Nicht möglich~9× größer als VRAM Nicht möglichNur Server-Hardware, Ollama Cloud oder API
GLM-5.2 (744 B) MoE 8/256 ~445 GB Nicht möglich~74× größer als VRAM Nicht möglich~37× größer als VRAM Nicht möglich~28× größer als VRAM Nicht möglich~18,5× größer als VRAM Nicht möglichNur Multi-GPU-Cluster, Ollama Cloud oder API praktikabel

VRAM-Kompatibilität — Kompakte & Vision-Modelle (Q4)

Modell Typ VRAM Q4 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. Intel Arc Pro B60 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
GLM-4.1V-9B-Thinking (9 B) Dense ~5–6 GB GrenzbereichText passt knapp; Vision-Encoder braucht zusätzlichen Puffer KomfortabelText + Bild gut nutzbar, ausreichend Kontext-Puffer Sehr komfortabelViel Puffer für lange Thinking-Ketten Ultra-komfortabelMassig Platz für parallele Anfragen Gut nutzbar~10–14 Tok/Sek · Passt komplett in RAM
GLM-4.6V-Flash (9,4 B) Dense ~5,7 GB GrenzbereichText passt; mit Vision-Encoder (+1,7 GB) kaum Puffer übrig KomfortabelText + Bild + brauchbarer Kontext-Puffer Sehr komfortabelRiesiger Kontext-Puffer frei Ultra-komfortabelMehrere Instanzen parallel möglich Akzeptabel~9–12 Tok/Sek · Vision-Encoder belegt zusätzlichen RAM
GLM-4.7-Flash (30 B, ~3 B aktiv) MoE 4/64 ~16,9 GB Nicht möglichVRAM viel zu klein Nicht möglichVRAM zu klein GrenzbereichPasst knapp; kaum Puffer für langen Kontext Sweet-SpotHohe Qualität bei niedrigen aktiven Parametern, viel Kontext-Puffer GrenzbereichQ4_K_M knapp über 16 GB RAM; kleinere Quants (Q3/Q2) laufen dank nur ~3 B aktiver Parameter dennoch flott

Modalitäten & Fähigkeiten

Modell Text Bild Thinking Function Calling Code Kontext Sprachen
GLM-4.1V-9B-Thinking 64k ZH · EN
GLM-4.5-Air 128k ZH · EN
GLM-4.5 128k ZH · EN
GLM-4.6 200k ZH · EN
GLM-4.6V-Flash 128k ZH · EN
GLM-4.7 200k ZH · EN
GLM-4.7-Flash 200k ZH · EN
GLM-5.2 1M ZH · EN

Quantisierungen

Modell Format Variante Gewichte Hinweis
4.1V-9B-Thinking GGUF Q3_K_S 4,3 GB Kleinstes lokal getestetes GGUF
4.1V-9B-Thinking GGUF Q4_K_M ~5,5 GB Empfehlung für 12-GB-GPUs
4.1V-9B-Thinking BF16 ~18 GB Volles Gewicht
4.6V-Flash GGUF Q4_K_M 5,7 GB Empfehlung für 12-GB-GPUs
4.6V-Flash mmproj (Vision) F16 1,7 GB Zusätzlich zum Sprachmodell nötig
4.6V-Flash BF16 ~18,8 GB Volles Gewicht
4.7-Flash GGUF Q4_K_M 16,9 GB Empfohlen für 24-GB-GPUs
4.7-Flash GGUF Q8_0 ~32 GB
4.7-Flash BF16 ~60 GB Volles Gewicht
4.5-Air GGUF Q4_K_M ~60 GB Kleinstes praktikables Flaggschiff-GGUF
4.5-Air BF16 ~212 GB Volles Gewicht
4.5 / 4.6 / 4.7 GGUF Q4_K_M ~210–215 GB Nur Multi-GPU-Server
4.5 / 4.6 / 4.7 BF16 ~710–716 GB Referenz-Precision
5.2 GGUF Q4_K_M ~445 GB Multi-GPU-Cluster
5.2 FP8 ~745 GB Empfohlene Referenz-Precision
5.2 BF16 ~1.490 GB Volles Gewicht

Deployment

Ollama Lokal & Cloud
4.7-Flash (lokal)ollama run glm-4.7-flash
4.7 / 5.2 (zu groß lokal)ollama run glm-4.7:cloud
LM Studio GUI-Support
Kompakte ModelleGGUF direkt aus HuggingFace wählbar
llama.cpp MoE-Experten-Offload
Experten auf CPU-ot ".ffn_.*_exps.=CPU"
EffektAttention/Shared-Layer im VRAM, Routed Experts im RAM
vLLM Flaggschiffe (Multi-GPU)
Befehlvllm serve zai-org/GLM-4.6
Tensor Parallel--tensor-parallel-size 8
Kontext--max-model-len 202752
SGLang Von Z.ai empfohlen
Befehlpython -m sglang.launch_server --model-path zai-org/GLM-4.6 --tp 8 --port 30000
vLLM Kompakt (24-GB-GPU)
Befehlvllm serve zai-org/GLM-4.7-Flash
Kontext--max-model-len 131072
Hinweise:
· VRAM-Werte gelten für Q4_K_M-Quantisierung ohne KV-Cache. Bei vollem Kontextfenster steigt der Bedarf deutlich, besonders bei GLM-5.2 (1 M Kontext).
· Die Flaggschiffe (4.5/4.5-Air/4.6/4.7) nutzen GQA (96 Attention-Heads / 8 KV-Heads) — keine Multi-head Latent Attention (MLA), obwohl die MoE-Routing-Strategie (Sigmoid-Gates, "noaux_tc") an DeepSeek-V3 erinnert. Manche GGUF-Tools ordnen kleinere GLM-MoE-Varianten intern trotzdem der "deepseek2"-Architektur zu (strukturelle Ähnlichkeit im Format), die tatsächliche HuggingFace-Architektur heißt glm4_moe bzw. glm4_moe_lite.
· GLM-5.2 führt DSA (Dynamic Sparse Attention) mit "IndexShare" ein: Der Indexer wird alle 4 sparsen Layer wiederverwendet und senkt die FLOPs pro Token bei 1-M-Kontext um Faktor 2,9 — die ersten 3 Layer bleiben dense.
· GLM-4.7-Flash: Kontextangaben schwanken zwischen Quellen (Modell-Konfiguration: 202.752 Token / manche Dokus nennen 128k) — hier wird der Konfigurationswert verwendet.
· GLM-4.6V-Flash und GLM-4.7-Flash sind sehr aktuelle Releases (Stand: Anfang 2026); ihre Spezifikationen stammen primär aus lokal geladenen GGUF-Metadaten statt aus vollständig dokumentierten offiziellen Modellkarten und können von späteren offiziellen Angaben abweichen.
· GLM-4.7-Flash: MoE mit nur ~3 B aktiven von 30 B Gesamtparametern — Rechenlast bleibt niedrig, auch wenn das komplette Modell im Speicher liegen muss.
· Zhipu AI firmiert international mittlerweile als "Z.ai".
· Alle Modelle ab GLM-4.5 stehen unter MIT-Lizenz — keine proprietären Nutzungsbeschränkungen.
· Wegen der enormen Gesamtparameterzahl der Flaggschiffe (bis 744 B) ist lokale Consumer-Hardware nur für die "Flash"/"Air"-Varianten bzw. die kompakten Vision-Modelle praktikabel; für die großen Modelle sind Multi-GPU-Server, Ollama Cloud oder die offizielle API die realistischen Optionen.