Zhipu AI / Z.ai · Dense & MoE · Juni 2025 – Juni 2026 · 151k–155k Vokabular · Lizenz: MIT (ab GLM-4.5)
| Modell | Typ | VRAM Q4 | 6 GB VRAMz. B. NVIDIA A2000 | 12 GB VRAMz. B. RTX 3060 Ti | 16 GB VRAMz. B. RTX 4060 Ti | 24 GB VRAMz. B. Intel Arc Pro B60 | CPU · 16 GB RAMz. B. Ryzen 7 (AM4) |
|---|---|---|---|---|---|---|---|
| GLM-4.5-Air (106 B) | MoE 8/128 | ~60 GB | Nicht möglich~10× größer als VRAM | Nicht möglich~5× größer als VRAM | Nicht möglich~3,8× größer als VRAM | Nicht möglich~2,5× größer als VRAM | Nicht möglichSprengt 16 GB RAM bei Weitem; nur mit 64 GB+ Unified RAM oder Multi-GPU nutzbar |
| GLM-4.5 (355 B) | MoE 8/160 | ~210 GB | Nicht möglich~35× größer als VRAM | Nicht möglich~17,5× größer als VRAM | Nicht möglich~13× größer als VRAM | Nicht möglich~8,8× größer als VRAM | Nicht möglichNur Server-Hardware oder API praktikabel |
| GLM-4.6 (357 B) | MoE 8/160 | ~215 GB | Nicht möglich~36× größer als VRAM | Nicht möglich~18× größer als VRAM | Nicht möglich~13,4× größer als VRAM | Nicht möglich~9× größer als VRAM | Nicht möglichNur Server-Hardware oder API praktikabel |
| GLM-4.7 (358 B) | MoE 8/160 | ~215 GB | Nicht möglich~36× größer als VRAM | Nicht möglich~18× größer als VRAM | Nicht möglich~13,4× größer als VRAM | Nicht möglich~9× größer als VRAM | Nicht möglichNur Server-Hardware, Ollama Cloud oder API |
| GLM-5.2 (744 B) | MoE 8/256 | ~445 GB | Nicht möglich~74× größer als VRAM | Nicht möglich~37× größer als VRAM | Nicht möglich~28× größer als VRAM | Nicht möglich~18,5× größer als VRAM | Nicht möglichNur Multi-GPU-Cluster, Ollama Cloud oder API praktikabel |
| Modell | Typ | VRAM Q4 | 6 GB VRAMz. B. NVIDIA A2000 | 12 GB VRAMz. B. RTX 3060 Ti | 16 GB VRAMz. B. RTX 4060 Ti | 24 GB VRAMz. B. Intel Arc Pro B60 | CPU · 16 GB RAMz. B. Ryzen 7 (AM4) |
|---|---|---|---|---|---|---|---|
| GLM-4.1V-9B-Thinking (9 B) | Dense | ~5–6 GB | GrenzbereichText passt knapp; Vision-Encoder braucht zusätzlichen Puffer | KomfortabelText + Bild gut nutzbar, ausreichend Kontext-Puffer | Sehr komfortabelViel Puffer für lange Thinking-Ketten | Ultra-komfortabelMassig Platz für parallele Anfragen | Gut nutzbar~10–14 Tok/Sek · Passt komplett in RAM |
| GLM-4.6V-Flash (9,4 B) | Dense | ~5,7 GB | GrenzbereichText passt; mit Vision-Encoder (+1,7 GB) kaum Puffer übrig | KomfortabelText + Bild + brauchbarer Kontext-Puffer | Sehr komfortabelRiesiger Kontext-Puffer frei | Ultra-komfortabelMehrere Instanzen parallel möglich | Akzeptabel~9–12 Tok/Sek · Vision-Encoder belegt zusätzlichen RAM |
| GLM-4.7-Flash (30 B, ~3 B aktiv) | MoE 4/64 | ~16,9 GB | Nicht möglichVRAM viel zu klein | Nicht möglichVRAM zu klein | GrenzbereichPasst knapp; kaum Puffer für langen Kontext | Sweet-SpotHohe Qualität bei niedrigen aktiven Parametern, viel Kontext-Puffer | GrenzbereichQ4_K_M knapp über 16 GB RAM; kleinere Quants (Q3/Q2) laufen dank nur ~3 B aktiver Parameter dennoch flott |
| Modell | Text | Bild | Thinking | Function Calling | Code | Kontext | Sprachen |
|---|---|---|---|---|---|---|---|
| GLM-4.1V-9B-Thinking | ✓ | ✓ | ✓ | ✗ | ✓ | 64k | ZH · EN |
| GLM-4.5-Air | ✓ | ✗ | ✓ | ✓ | ✓ | 128k | ZH · EN |
| GLM-4.5 | ✓ | ✗ | ✓ | ✓ | ✓ | 128k | ZH · EN |
| GLM-4.6 | ✓ | ✗ | ✓ | ✓ | ✓ | 200k | ZH · EN |
| GLM-4.6V-Flash | ✓ | ✓ | ✓ | ✓ | ✓ | 128k | ZH · EN |
| GLM-4.7 | ✓ | ✗ | ✓ | ✓ | ✓ | 200k | ZH · EN |
| GLM-4.7-Flash | ✓ | ✗ | ✓ | ✓ | ✓ | 200k | ZH · EN |
| GLM-5.2 | ✓ | ✗ | ✓ | ✓ | ✓ | 1M | ZH · EN |
| Modell | Format | Variante | Gewichte | Hinweis |
|---|---|---|---|---|
| 4.1V-9B-Thinking | GGUF | Q3_K_S | 4,3 GB | Kleinstes lokal getestetes GGUF |
| 4.1V-9B-Thinking | GGUF | Q4_K_M | ~5,5 GB | Empfehlung für 12-GB-GPUs |
| 4.1V-9B-Thinking | BF16 | — | ~18 GB | Volles Gewicht |
| 4.6V-Flash | GGUF | Q4_K_M | 5,7 GB | Empfehlung für 12-GB-GPUs |
| 4.6V-Flash | mmproj (Vision) | F16 | 1,7 GB | Zusätzlich zum Sprachmodell nötig |
| 4.6V-Flash | BF16 | — | ~18,8 GB | Volles Gewicht |
| 4.7-Flash | GGUF | Q4_K_M | 16,9 GB | Empfohlen für 24-GB-GPUs |
| 4.7-Flash | GGUF | Q8_0 | ~32 GB | |
| 4.7-Flash | BF16 | — | ~60 GB | Volles Gewicht |
| 4.5-Air | GGUF | Q4_K_M | ~60 GB | Kleinstes praktikables Flaggschiff-GGUF |
| 4.5-Air | BF16 | — | ~212 GB | Volles Gewicht |
| 4.5 / 4.6 / 4.7 | GGUF | Q4_K_M | ~210–215 GB | Nur Multi-GPU-Server |
| 4.5 / 4.6 / 4.7 | BF16 | — | ~710–716 GB | Referenz-Precision |
| 5.2 | GGUF | Q4_K_M | ~445 GB | Multi-GPU-Cluster |
| 5.2 | FP8 | — | ~745 GB | Empfohlene Referenz-Precision |
| 5.2 | BF16 | — | ~1.490 GB | Volles Gewicht |
glm4_moe bzw. glm4_moe_lite.