Liquid AI · Liquid-Lizenz (frei bis 10 Mio. USD Jahresumsatz) · Hybrid-Architektur (Conv + Attention) · 32k–128k Kontext · Edge/On-Device-Fokus
| Modell | Typ | Größe (Quant) | 6 GB VRAMz. B. NVIDIA A2000 | 12 GB VRAMz. B. RTX 3060 Ti | 16 GB VRAMz. B. RTX 4060 Ti | 24 GB VRAMz. B. RTX 3090 / 4090 | CPU · 16 GB RAMz. B. Ryzen 7 (AM4) |
|---|---|---|---|---|---|---|---|
| LFM2.5-1.2B-Instruct | Dense | ~1,16 GB (Q8_0) | Ultra-LeichtVerschwindend kleiner Fußabdruck; massig Puffer | Ultra-LeichtPraktisch kostenlos in VRAM | Ultra-LeichtDutzende parallele Instanzen möglich | Ultra-LeichtKein sinnvoller Engpass mehr | Sehr gutZielplattform: Wearables/Phones – auch ohne GPU flott |
| LFM2.5-1.2B-Thinking | Dense | ~1,16 GB (Q8_0) | Ultra-LeichtPasst mehrfach parallel in 6 GB | Ultra-LeichtKaum messbarer VRAM-Verbrauch | Ultra-LeichtViel Reserve für langen Kontext | Ultra-LeichtKein sinnvoller Engpass mehr | Sehr gutReasoning läuft auch CPU-only ausreichend schnell |
| LFM2.5-8B-A1B | MoE 4/32 | ~3,67–4,51 GB (Q3_K_M / Q4_0) | KomfortabelBeide Quants passen; Reserve für KV-Cache | Sehr komfortabelViel Platz für 128k Kontext | Sehr komfortabelAuch höhere Quants möglich | Ultra-LeichtMassig Platz für Parallel-Sessions | Gut nutzbarNur ~1,5 B aktive Parameter → schnell auch auf CPU |
| LFM2-24B-A2B | MoE 4/64 | ~13,4 GB (Q4_K_M) | Nicht möglichVRAM viel zu klein | Nicht möglich13,4 GB > 12 GB, kein Puffer | Knapp möglichPasst (~13,4 GB), aber nur ~2,6 GB für KV-Cache/Kontext übrig | Komfortabel~10 GB Reserve für langen Kontext | Knapp nutzbarPasst knapp in 16 GB RAM; nur ~2 B aktive Parameter halten Speed dennoch brauchbar |
| Modell | Text | Thinking | Function Calling | MCP | Formate | Kontext (offiziell) |
|---|---|---|---|---|---|---|
| LFM2.5-1.2B-Instruct | ✓ | ✗ | ✓ | ✓ | HF · GGUF · MLX · ONNX | 32k |
| LFM2.5-1.2B-Thinking | ✓ | ✓ | ✗ | ✗ | HF · GGUF · MLX · ONNX | 32k |
| LFM2.5-8B-A1B | ✓ | ✓ | ✓ | ✓ | HF · GGUF · MLX · ONNX | 128k |
| LFM2-24B-A2B | ✓ | ✗ | ✗ | ✗ | HF · GGUF · MLX | 128k* |
| Modell | Parameter | Aufgabe | Kontext | Details |
|---|---|---|---|---|
| LFM2.5-Embedding-350M | ~354 M | Dense-Vektor-Embeddings (Bi-Encoder) | 512 Tok. (Doc) | 1024-dim. Vektor pro Query/Dokument, Cosine-Similarity, 11 Sprachen, kleinster/schnellster Vektor-Index |
| LFM2.5-ColBERT-350M | ~353 M | Late-Interaction-Retrieval / Reranking | 512 / 32 Tok. (Doc/Query) |
128-dim. Vektor pro Token, MaxSim-Scoring, höhere Retrieval-Qualität als Dense-Embedding, benötigt PyLate |
| LFM2.5-VL-1.6B-Extract | ~1,6 B (1,2B LM + ~400M Vision) |
Vision → strukturiertes JSON | 128k | Einzelbild, dynamische Auflösung, YAML-Feld-Definition im System-Prompt, Greedy Decoding empfohlen |
| LFM2.5-VL-450M-Extract | ~450 M (350M LM + ~100M Vision) |
Vision → strukturiertes JSON (Edge) | 128k | Kompakteste VL-Extract-Variante, für Edge-Geräte / hohes Volumen ausgelegt |
lfm2 (dense) bzw. lfm2moe (MoE). Aus lokal gecachten GGUF-Headern lässt sich ablesen, dass die Attention-Blöcke mit n_heads = n_kv_heads = 32 volle Attention ohne Grouped-Query-Attention nutzen – kombiniert mit Convolution-Blöcken laut Hersteller-Doku ("Hybrid").n_ctx_orig = 128.000, die offizielle Liquid-AI-Dokumentation nennt für LFM2.5-1.2B-Instruct/-Thinking jedoch nur 32k Token als unterstütztes Kontextfenster. Der Header-Wert entspricht vermutlich der RoPE-Trainingsbasis, nicht dem freigegebenen Nutzkontext – oberhalb von 32k ist bei diesen Modellen mit Qualitätsverlust zu rechnen. Für LFM2-24B-A2B liegen keine offiziellen Angaben vor (*), der GGUF-Header nennt ebenfalls 128k.