← VRAM Calculator

Ling / Ring (inclusionAI)

Ant Group · MIT-Lizenz · 128k Kontextfenster (YaRN bis 512k) · Bailing-MoE-Architektur (Ling 2.0)

bailingmoe2 MoE (Mixture-of-Experts) Thinking (Ring-Varianten) Tool Calling

Architektur & Parameter

MoE Ling-mini-2.0
Parameter gesamt16 B (≈ 1,4 B aktiv)
Aktivierungsrate1/32 (fine-grained Experts)
Training>20 Billionen Token, gefolgt von Mid-Training/SFT/RL
Kontextfenster128k native, via YaRN bis 512k
EinsatzzweckEffizientes Allround-Modell, Leistung vergleichbar mit ~7-8B Dense
LizenzMIT
MoE Thinking Ring-mini-2.0
Parameter gesamt16 B (≈ 1,4 B aktiv)
BasisLing-mini-2.0 + RL-Post-Training für langes Chain-of-Thought
FokusMathematik, Code, Logik-Reasoning
Kontextfenster128k native, via YaRN bis 512k
Tool CallingJa
LizenzMIT
MoE Ling-flash-2.0
Parameter gesamt100 B (≈ 6,1 B aktiv)
Aktivierungsrate1/16 (fine-grained Experts)
ArchitekturLing 2.0, gleiche Familie wie Ling-mini-2.0, hochskaliert
Kontextfenster128k native, via YaRN bis 512k
EinsatzzweckStärkerer Allrounder, mehr Kapazität als Mini bei ~4× aktiven Parametern
LizenzMIT
MoE Thinking Ring-flash-2.0
Parameter gesamt100 B (≈ 6,1 B aktiv)
BasisLing-flash-2.0 + RL-Post-Training für langes Chain-of-Thought
FokusMathematik, Code, Logik-Reasoning
Kontextfenster128k native, via YaRN bis 512k
Tool CallingJa
LizenzMIT
MoE Ling-1T Flagship
Parameter gesamt≈ 1 Billion (≈ 50 B aktiv)
ArchitekturLing 2.0 weiter hochskaliert, Evo-CoT-Training
Kontextfenster128k native, via YaRN bis 512k
EinsatzzweckFlaggschiff, konkurriert mit anderen Trillion-Parameter-MoE-Modellen
LizenzMIT

VRAM-Kompatibilität (Q4_K_M-Quantisierung, GGUF)

Modell Typ VRAM Q4_K_M 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. RTX 3090 / 4090 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
Ling-mini-2.0 / Ring-mini-2.0 MoE ~10 GB Nicht möglichVRAM zu klein für 128k Kontext Knapp möglichPasst, wenig Puffer bei langem Kontext KomfortabelNur ~1,4 B aktive Parameter → sehr schnelle Inferenz Sehr komfortabelViel Puffer für 128k+ Kontext Gut nutzbarMoE-Routing hält CPU-Inferenz trotz 16 B Gesamtgröße flott
Ling-flash-2.0 / Ring-flash-2.0 MoE ~62 GB Nicht möglich— Nicht möglich— Nicht möglich— Nicht möglichBraucht Multi-GPU (z. B. 2× 48 GB) oder starkes Offloading Nicht möglichSprengt 16 GB RAM deutlich
Ling-1T MoE ~620+ GB
(Schätzung aus Parameterzahl)
Nicht möglich— Nicht möglich— Nicht möglich— Nicht möglichNur Multi-GPU-Cluster (Datacenter-Klasse) Nicht möglich—

Fähigkeiten & Features

Modell Text Thinking Tool Calling MoE Kontext Aktive Parameter
Ling-mini-2.0 ✓ ✗ ✓ ✓ 128k (512k YaRN) ≈ 1,4 B
Ring-mini-2.0 ✓ ✓ ✓ ✓ 128k (512k YaRN) ≈ 1,4 B
Ling-flash-2.0 ✓ ✗ ✓ ✓ 128k (512k YaRN) ≈ 6,1 B
Ring-flash-2.0 ✓ ✓ ✓ ✓ 128k (512k YaRN) ≈ 6,1 B
Ling-1T ✓ ✗ ✓ ✓ 128k (512k YaRN) ≈ 50 B
Ling / Ring (inclusionAI, Ant Group): "inclusionAI" ist die Open-Source-Organisation von Ant Group (Alibaba-Finanztochter) auf Hugging Face. Die Ling-2.0-Serie sind reine "Instruct"/Base-Modelle für allgemeine Aufgaben, während die Ring-Serie dieselben Basismodelle über zusätzliches RL-Post-Training auf langes Chain-of-Thought-Reasoning spezialisiert (analog zu "Thinking"-Varianten anderer Familien wie ERNIE-Thinking oder Qwen3-Thinking). Beide Serien teilen sich Architektur und Parameterzahl je Größenstufe – Ring ist also kein eigenständiges Modell, sondern ein Reasoning-Finetune von Ling.

Bailing-MoE-Architektur: Ling 2.0 setzt auf feingranulare Experten mit sehr niedriger Aktivierungsrate (1/32 bei Mini, 1/16 bei Flash). Dadurch bleiben trotz hoher Gesamtparameterzahl nur wenige Milliarden Parameter pro Token aktiv, was die Inferenz auch auf bescheidener Hardware spürbar beschleunigt gegenüber dicht besetzten Modellen ähnlicher Gesamtgröße. Ling-mini-2.0 (16B/1,4B aktiv) positioniert sich damit als Alternative zu Modellen wie Qwen3-30B-A3B oder OLMoE für Nutzer mit 16–24 GB VRAM.

Ling-1T: Das Flaggschiff der Familie mit rund einer Billion Gesamtparametern (≈50 B aktiv) wurde Ende 2025 veröffentlicht und richtet sich an Multi-GPU-/Datacenter-Umgebungen. Für Consumer-Hardware unter 32 GB VRAM ist ausschließlich Ling-mini-2.0 bzw. Ring-mini-2.0 praktikabel.

Hinweis zu den Zahlen: Für Ling-flash-2.0 und Ling-1T liegen aktuell keine breit etablierten Standard-GGUF-Quantisierungen vor; die VRAM-Werte sind Schätzungen auf Basis der Gesamtparameterzahl (analog zur Berechnung bei Ling-mini-2.0). Angaben zu Parametern, Aktivierungsrate und Kontextfenster stammen aus den Hugging-Face-Modellkarten der inclusionAI-Organisation (inclusionAI/Ling-mini-2.0, inclusionAI/Ling-flash-2.0, inclusionAI/Ring-mini-2.0, inclusionAI/Ring-flash-2.0).