← VRAM Calculator

LFM (Liquid Foundation Models)

Liquid AI · Liquid-Lizenz (frei bis 10 Mio. USD Jahresumsatz) · Hybrid-Architektur (Conv + Attention) · 32k–128k Kontext · Edge/On-Device-Fokus

lfm2 lfm2moe Thinking Mode Function Calling / MCP Vision-Extract Embedding / ColBERT

Architektur & Parameter (Textmodelle)

Dense LFM2.5-1.2B-Instruct
Parameter gesamt1,2 B
ArchitekturHybrid Conv + Attention (lfm2)
Layer16
Kontextfenster32k Token (Doku)
Attention32 Heads / 32 KV-Heads (volle Attn., kein GQA)
ModalitätenText · Function Calling
LizenzLiquid-Lizenz (<10 Mio. USD Umsatz frei)
Dense LFM2.5-1.2B-Thinking
Parameter gesamt1,2 B
ArchitekturHybrid Conv + Attention (lfm2)
Layer16
Kontextfenster32k Token (Doku)
FokusMathematik & Logik, Chain-of-Thought
ModalitätenText · Reasoning
LizenzLiquid-Lizenz (<10 Mio. USD Umsatz frei)
MoE 4/32 LFM2.5-8B-A1B
Aktive Parameter~1,5 B
Parameter gesamt8 B
Experten4 aktiv / 32
Layer24
Kontextfenster128k Token
ModalitätenText · Function Calling · MCP
LizenzLiquid-Lizenz (<10 Mio. USD Umsatz frei)
MoE 4/64 LFM2-24B-A2B Flagship
Aktive Parameter~2 B
Parameter gesamt24 B
Experten4 aktiv / 64
Layer40
Kontextfenster128k Token (GGUF-Header)
ModalitätenText
LizenzLiquid-Lizenz (<10 Mio. USD Umsatz frei)

VRAM-Kompatibilität (reale GGUF-Dateigrößen aus models_cache.json)

Modell Typ Größe (Quant) 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. RTX 3090 / 4090 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
LFM2.5-1.2B-Instruct Dense ~1,16 GB (Q8_0) Ultra-LeichtVerschwindend kleiner Fußabdruck; massig Puffer Ultra-LeichtPraktisch kostenlos in VRAM Ultra-LeichtDutzende parallele Instanzen möglich Ultra-LeichtKein sinnvoller Engpass mehr Sehr gutZielplattform: Wearables/Phones – auch ohne GPU flott
LFM2.5-1.2B-Thinking Dense ~1,16 GB (Q8_0) Ultra-LeichtPasst mehrfach parallel in 6 GB Ultra-LeichtKaum messbarer VRAM-Verbrauch Ultra-LeichtViel Reserve für langen Kontext Ultra-LeichtKein sinnvoller Engpass mehr Sehr gutReasoning läuft auch CPU-only ausreichend schnell
LFM2.5-8B-A1B MoE 4/32 ~3,67–4,51 GB (Q3_K_M / Q4_0) KomfortabelBeide Quants passen; Reserve für KV-Cache Sehr komfortabelViel Platz für 128k Kontext Sehr komfortabelAuch höhere Quants möglich Ultra-LeichtMassig Platz für Parallel-Sessions Gut nutzbarNur ~1,5 B aktive Parameter → schnell auch auf CPU
LFM2-24B-A2B MoE 4/64 ~13,4 GB (Q4_K_M) Nicht möglichVRAM viel zu klein Nicht möglich13,4 GB > 12 GB, kein Puffer Knapp möglichPasst (~13,4 GB), aber nur ~2,6 GB für KV-Cache/Kontext übrig Komfortabel~10 GB Reserve für langen Kontext Knapp nutzbarPasst knapp in 16 GB RAM; nur ~2 B aktive Parameter halten Speed dennoch brauchbar

Fähigkeiten & Features (Textmodelle)

Modell Text Thinking Function Calling MCP Formate Kontext (offiziell)
LFM2.5-1.2B-Instruct HF · GGUF · MLX · ONNX 32k
LFM2.5-1.2B-Thinking HF · GGUF · MLX · ONNX 32k
LFM2.5-8B-A1B HF · GGUF · MLX · ONNX 128k
LFM2-24B-A2B HF · GGUF · MLX 128k*

Liquid Nanos – spezialisierte Kompaktmodelle

Modell Parameter Aufgabe Kontext Details
LFM2.5-Embedding-350M ~354 M Dense-Vektor-Embeddings (Bi-Encoder) 512 Tok. (Doc) 1024-dim. Vektor pro Query/Dokument, Cosine-Similarity, 11 Sprachen, kleinster/schnellster Vektor-Index
LFM2.5-ColBERT-350M ~353 M Late-Interaction-Retrieval / Reranking 512 / 32 Tok.
(Doc/Query)
128-dim. Vektor pro Token, MaxSim-Scoring, höhere Retrieval-Qualität als Dense-Embedding, benötigt PyLate
LFM2.5-VL-1.6B-Extract ~1,6 B
(1,2B LM + ~400M Vision)
Vision → strukturiertes JSON 128k Einzelbild, dynamische Auflösung, YAML-Feld-Definition im System-Prompt, Greedy Decoding empfohlen
LFM2.5-VL-450M-Extract ~450 M
(350M LM + ~100M Vision)
Vision → strukturiertes JSON (Edge) 128k Kompakteste VL-Extract-Variante, für Edge-Geräte / hohes Volumen ausgelegt
Liquid AI & LFM: Liquid Foundation Models (LFM) basieren laut Liquid AI auf einer proprietären, aus Dynamical-Systems-/Signal-Processing-Prinzipien abgeleiteten Architektur ("Liquid Neural Networks") statt einem reinen Transformer. Die GGUF-Architektur-Kennung lautet lfm2 (dense) bzw. lfm2moe (MoE). Aus lokal gecachten GGUF-Headern lässt sich ablesen, dass die Attention-Blöcke mit n_heads = n_kv_heads = 32 volle Attention ohne Grouped-Query-Attention nutzen – kombiniert mit Convolution-Blöcken laut Hersteller-Doku ("Hybrid").

Lizenz: Alle LFM-Modelle stehen unter der Liquid-Lizenz zum kostenlosen Download, Ausführen und Fine-Tuning – auch kommerziell – solange das einsetzende Unternehmen die Schwelle von 10 Mio. USD Jahresumsatz nicht überschreitet. Für größere Unternehmen ist eine kommerzielle Lizenz erforderlich.

Kontextfenster-Diskrepanz (Hinweis): Die lokal gecachten GGUF-Header der 1.2B-Modelle melden n_ctx_orig = 128.000, die offizielle Liquid-AI-Dokumentation nennt für LFM2.5-1.2B-Instruct/-Thinking jedoch nur 32k Token als unterstütztes Kontextfenster. Der Header-Wert entspricht vermutlich der RoPE-Trainingsbasis, nicht dem freigegebenen Nutzkontext – oberhalb von 32k ist bei diesen Modellen mit Qualitätsverlust zu rechnen. Für LFM2-24B-A2B liegen keine offiziellen Angaben vor (*), der GGUF-Header nennt ebenfalls 128k.

MoE-Effizienz: Sowohl LFM2.5-8B-A1B (4 von 32 Experten aktiv, ~1,5 B aktive Parameter) als auch LFM2-24B-A2B (4 von 64 Experten aktiv, ~2 B aktive Parameter) laden zwar das volle Gewicht in den VRAM/RAM, benötigen aber wegen der geringen aktiven Parameterzahl pro Token deutlich weniger Rechenleistung als ein dichtes Modell gleicher Gesamtgröße – dadurch bleiben auch CPU-Only-Setups nutzbar.

Quellen: Architektur- und Quant-Größen (LFM2 1.2B, LFM2.5-1.2B-Instruct, LFM2.5-8B-A1B, LFM2-24B-A2B) stammen aus lokal gecachten GGUF-Headern (models_cache.json); Kontextfenster, Lizenzbedingungen, Nanos-Spezialmodelle und Architekturbeschreibung aus der offiziellen Liquid-AI-Dokumentation (liquid.ai/models, docs.liquid.ai/lfm).