← VRAM Calculator

K2 Horizon (Institute of Foundation Models / MBZUAI)

Abu Dhabi · Apache 2.0 · vollständig offen (Gewichte, Code, Trainingsdaten, Checkpoints, Logs) · 6 Modelle von 0,9 B bis 375 B · veröffentlicht 03.09.2026

Dense & MoE MoVA (Mixture-of-Value-Attention) Reasoning-Parser Tool Calling Diffusion-Distillation (3× schneller)

Architektur & Parameter

Dense K2-Horizon-0.9B
Parameter gesamt1,08 B (inkl. Embeddings)
Kontextfenster131.072 Token (128k) nativ
EinsatzzweckConstrained-/Edge-Umgebungen, State-of-the-Art in seiner Größenklasse
LizenzApache 2.0
Dense K2-Horizon-3.7B
Parameter gesamt3,7 B
Kontextfensteröffentlich nicht separat bestätigt (vermutlich ≥128k)
EinsatzzweckFine-Tuning-Basis, On-Device (Smartphones)
LizenzApache 2.0
Dense K2-Horizon-7B
Parameter gesamt7 B
Kontextfensteröffentlich nicht separat bestätigt (vermutlich ≥128k)
EinsatzzweckOn-Device-Einsatz, State-of-the-Art in seiner Größenklasse
LizenzApache 2.0
Dense K2-Horizon-32B
Parameter gesamt32 B
Kontextfenster512k (Stage-1-Modellkarte)
EinsatzzweckLokales Hosting auf Single-GPU-Workstations
LizenzApache 2.0
MoE MoVA K2-Horizon-MoVA-36B-A4B
Parameter gesamt≈ 36 B (≈ 4 B aktiv)
ArchitekturMixture-of-Value-Attention: Experten-Routing zusätzlich in den Value-Projektionen der Attention
Kontextfenster524.288 Token (512k) nativ
EinsatzzweckÜberdurchschnittliche Leistung pro aktivem Parameter, lokal auf einer 24 GB-GPU nutzbar
LizenzApache 2.0
MoE K2-Horizon-375B-A23B Flagship
Parameter gesamt375 B (≈ 23 B aktiv)
ArchitekturSparse MoE, native 512k-Kontext, Diffusion-Distillation für parallele Token-Blöcke
Kontextfenster512k nativ
EinsatzzweckFlaggschiff, Frontier-Performance, nur Multi-GPU-/Datacenter-Klasse
LizenzApache 2.0

VRAM-Kompatibilität (Q4_K_M-Quantisierung, GGUF)

Modell Typ VRAM Q4_K_M 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. RTX 3090 / 4090 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
K2-Horizon-0.9B Dense ~0,7 GB Sehr komfortabelViel Puffer, auch bei 128k Kontext Sehr komfortabel— Sehr komfortabel— Sehr komfortabel— Gut nutzbarAuch auf schwacher CPU-Hardware flott
K2-Horizon-3.7B Dense ~2,3 GB KomfortabelPasst mit Puffer für moderaten Kontext Sehr komfortabel— Sehr komfortabel— Sehr komfortabel— Gut nutzbar—
K2-Horizon-7B Dense ~4,4 GB Knapp möglichWenig Puffer bei langem Kontext Komfortabel— Sehr komfortabel— Sehr komfortabel— Gut nutzbar—
K2-Horizon-32B Dense ~20 GB Nicht möglich— Nicht möglich— Nicht möglichModell selbst passt knapp nicht, 512k-KV-Cache erst recht nicht Knapp möglichNur bei stark reduziertem Kontext (weit unter 512k) Nicht möglichSprengt 16 GB RAM
K2-Horizon-MoVA-36B-A4B MoE ~23 GB Nicht möglich— Nicht möglich— Nicht möglichKnapp zu klein für Gewichte + Kontext Knapp möglichPasst bei moderatem Kontext, 512k sprengt den Puffer Gut nutzbarNur ~4 B aktive Parameter → trotz 36 B Gesamtgröße CPU-tauglich
K2-Horizon-375B-A23B MoE ~235 GB
(Schätzung aus Parameterzahl)
Nicht möglich— Nicht möglich— Nicht möglich— Nicht möglichBraucht Multi-GPU-Cluster (Datacenter-Klasse) Nicht möglich—

Fähigkeiten & Features

Modell Text Reasoning-Parser Tool Calling MoE Kontext Aktive Parameter
K2-Horizon-0.9B ✓ ✓ ✓ ✗ 128k 1,08 B
K2-Horizon-3.7B ✓ ✓ ✓ ✗ ≥128k* 3,7 B
K2-Horizon-7B ✓ ✓ ✓ ✗ ≥128k* 7 B
K2-Horizon-32B ✓ ✓ ✓ ✗ 512k 32 B
K2-Horizon-MoVA-36B-A4B ✓ ✓ ✓ ✓ 512k ≈ 4 B
K2-Horizon-375B-A23B ✓ ✓ ✓ ✓ 512k ≈ 23 B
K2 Horizon (Institute of Foundation Models, MBZUAI Abu Dhabi): Am 03.09.2026 veröffentlichte das IFM sechs zusammengehörige Modelle von 0,9 B bis 375 B Parametern als – nach eigener Darstellung – bislang größte vollständig offene Modell-Flotte: nicht nur Gewichte, sondern auch Trainingsdaten (soweit Lizenzen dies erlauben), Trainingscode, Zwischen-Checkpoints, Trainings-Logs und Evaluationsergebnisse stehen offen. Modelle und Code stehen unter Apache 2.0, einzelne Trainingsdatensätze behalten ihre jeweilige Lizenz (u. a. ODC-BY).

Mixture-of-Value-Attention (MoVA): Die beiden größten Modelle (36B-A4B und das 375B-A23B-Flaggschiff) erweitern die aus MoE bekannte Experten-Sparsity zusätzlich auf die Value-Projektionen der Attention-Köpfe. Das öffnet eine zweite Skalierungsachse neben dem klassischen FFN-Experten-Routing und soll Reasoning-Fähigkeit steigern, ohne zusätzliche Rechenlast pro Token zu erzeugen. Laut IFM liefert das MoVA-36B-A4B-Modell dadurch überdurchschnittliche Leistung im Verhältnis zu seinen nur ~4 B aktiven Parametern.

Diffusion-Distillation (≈3× Speedup): Zusätzlich zu den autoregressiven (eingefrorenen) Basisgewichten wird ein leichtgewichtiger Satz "Diffusions"-Parameter trainiert, der lernt, mehrere Token gleichzeitig als Block zu generieren statt strikt sequentiell eines nach dem anderen. Die Ausgabeverteilung des Basismodells bleibt dabei unverändert. Das beschleunigt die Inferenz laut IFM um etwa das Dreifache bei gleichbleibender Antwortqualität. Für die reine VRAM-Bedarfsrechnung ist dieser Mechanismus neutral (kein zusätzlicher Speicherbedarf in relevanter Größenordnung), wirkt sich aber direkt auf Tokens/Sekunde aus.

Sehr große native Kontextfenster: 32B, MoVA-36B-A4B und das 375B-A23B-Flaggschiff werben mit einem nativen Kontext von 512k (524.288) Token, deutlich mehr als bei den meisten anderen offenen Modellfamilien in dieser Übersicht. Die VRAM-Werte oben decken aber nur die reinen Modellgewichte ab. Der KV-Cache bei tatsächlicher Nutzung von 512k Kontext ist enorm und übersteigt auf Consumer-GPUs (6–24 GB) den verfügbaren Speicher bei weitem, selbst wenn die Gewichte allein noch passen würden.

Hinweis zu llama.cpp/GGUF: Die K2-Horizon-Architektur (k2_horizon) ist in Upstream-llama.cpp zum Zeitpunkt der Veröffentlichung noch nicht gemergt (PR ausstehend). Für GGUF-Inferenz wird aktuell der Fork MBZUAI-IFM/llama.cpp (Branch model/K2Horizon) benötigt. Die VRAM-Zahlen für 3.7B/7B/32B/36B-A4B/375B-A23B sind Schätzungen auf Basis der Gesamtparameterzahl (analog zur Berechnung bei anderen Familien in dieser Übersicht); nur für 0.9B liegt eine offiziell bestätigte Parameterzahl inkl. Embeddings vor. * Für 3.7B und 7B ist keine offiziell bestätigte Kontextlänge auffindbar.