Ant Group · MIT-Lizenz · 128k Kontextfenster (YaRN bis 512k) · Bailing-MoE-Architektur (Ling 2.0)
| Modell | Typ | VRAM Q4_K_M | 6 GB VRAMz. B. NVIDIA A2000 | 12 GB VRAMz. B. RTX 3060 Ti | 16 GB VRAMz. B. RTX 4060 Ti | 24 GB VRAMz. B. RTX 3090 / 4090 | CPU · 16 GB RAMz. B. Ryzen 7 (AM4) |
|---|---|---|---|---|---|---|---|
| Ling-mini-2.0 / Ring-mini-2.0 | MoE | ~10 GB | Nicht möglichVRAM zu klein für 128k Kontext | Knapp möglichPasst, wenig Puffer bei langem Kontext | KomfortabelNur ~1,4 B aktive Parameter → sehr schnelle Inferenz | Sehr komfortabelViel Puffer für 128k+ Kontext | Gut nutzbarMoE-Routing hält CPU-Inferenz trotz 16 B Gesamtgröße flott |
| Ling-flash-2.0 / Ring-flash-2.0 | MoE | ~62 GB | Nicht möglich— | Nicht möglich— | Nicht möglich— | Nicht möglichBraucht Multi-GPU (z. B. 2× 48 GB) oder starkes Offloading | Nicht möglichSprengt 16 GB RAM deutlich |
| Ling-1T | MoE | ~620+ GB (Schätzung aus Parameterzahl) |
Nicht möglich— | Nicht möglich— | Nicht möglich— | Nicht möglichNur Multi-GPU-Cluster (Datacenter-Klasse) | Nicht möglich— |
| Modell | Text | Thinking | Tool Calling | MoE | Kontext | Aktive Parameter |
|---|---|---|---|---|---|---|
| Ling-mini-2.0 | ✓ | ✗ | ✓ | ✓ | 128k (512k YaRN) | ≈ 1,4 B |
| Ring-mini-2.0 | ✓ | ✓ | ✓ | ✓ | 128k (512k YaRN) | ≈ 1,4 B |
| Ling-flash-2.0 | ✓ | ✗ | ✓ | ✓ | 128k (512k YaRN) | ≈ 6,1 B |
| Ring-flash-2.0 | ✓ | ✓ | ✓ | ✓ | 128k (512k YaRN) | ≈ 6,1 B |
| Ling-1T | ✓ | ✗ | ✓ | ✓ | 128k (512k YaRN) | ≈ 50 B |