PrismML · Apache 2.0 · 1-Bit & Ternär-Quantisierung · Dense (Qwen3-Basis) · Edge/On-Device-Fokus
| Modell | Typ | Größe 1-bit / Ternär | 6 GB VRAMz. B. NVIDIA A2000 | 12 GB VRAMz. B. RTX 3060 Ti | 16 GB VRAMz. B. RTX 4060 Ti | 24 GB VRAMz. B. RTX 3090 / 4090 | CPU · 16 GB RAMz. B. Ryzen 7 (AM4) |
|---|---|---|---|---|---|---|---|
| Bonsai 1.7B | Dense | ~0,25 / ~0,43 GB | Ultra-LeichtVerschwindend kleiner Fußabdruck; massig Puffer | Ultra-LeichtPraktisch kostenlos in VRAM | Ultra-LeichtDutzende parallele Instanzen möglich | Ultra-LeichtKein sinnvoller Engpass mehr | Sehr gutZielplattform: Wearables/Smart Glasses – auch ohne GPU flott |
| Bonsai 4B | Dense | ~0,57 / ~1,0 GB | Ultra-LeichtPasst mehrfach parallel in 6 GB | Ultra-LeichtKaum messbarer VRAM-Verbrauch | Ultra-LeichtViel Reserve für langen Kontext | Ultra-LeichtKein sinnvoller Engpass mehr | Sehr gutFür Edge-Geräte mit wenig RAM ausgelegt |
| Bonsai 8B | Dense | ~1,1 / ~2,0–2,3 GB | KomfortabelAuch Ternär-Variante passt locker | Sehr komfortabelReserve für 65k Kontext | Sehr komfortabelVolle YaRN-Kontextlänge nutzbar | Ultra-LeichtMassig Platz für Parallel-Sessions | Gut nutzbarBis zu ~368 Tok/Sek lt. PrismML (Referenzsystem) |
| Bonsai 27B | Dense Vision | ~4,4 / ~8,0 GB (inkl. ~0,9 GiB Vision-Tower) |
Nur 1-bit knapp1-bit passt (~4,4 GB); Ternär (~8 GB) läuft über | KomfortabelBeide Varianten passen; Reserve für KV-Cache | Sehr komfortabelViel Platz für Bild-Input + langen Kontext | Sehr komfortabelVergleichsweise winzig für ein 27B-Modell | Gut nutzbarSelbst Ternär passt komplett in 16 GB RAM |
| Modell | Basis (nativ) | KV @ nativ | Max (YaRN 4×) | KV @ Max | Hinweis |
|---|---|---|---|---|---|
| Bonsai 1.7B | 8k | ~0,9 GB | 32k | ~3,5 GB | Standard-Attention – KV-Cache wächst linear und übersteigt bei 32k das Modellgewicht deutlich |
| Bonsai 4B | 8k | ~0,7 GB | 32k | ~2,9 GB | Kleinerer Head-Dim (80) bremst das Wachstum leicht gegenüber 1.7B/8B |
| Bonsai 8B | 16k | ~2,3 GB | 65k | ~9,0 GB | Bei voller YaRN-Kontextlänge übersteigt der KV-Cache das (1-bit-)Gewicht um ein Vielfaches |
| Bonsai 27B | 262k | k. A.* | — | — | *Kein YaRN nötig, aber keine eigenen GGUF-Header-Metadaten im Modell-Cache vorhanden – analog Qwen 3.6 27B ist bei 262k Token mit mehreren zusätzlichen GB KV-Cache zu rechnen |
| Modell | Text | Bild | Thinking | Function Calling | Formate | Kontext (nativ → YaRN) |
|---|---|---|---|---|---|---|
| Bonsai 1.7B | ✓ | ✗ | ✓ | ✓ | GGUF · MLX | 8k → 32k |
| Bonsai 4B | ✓ | ✗ | ✓ | ✓ | GGUF · MLX | 8k → 32k |
| Bonsai 8B | ✓ | ✗ | ✓ | ✓ | GGUF · MLX | 16k → 65k |
| Bonsai 27B | ✓ | ✓ | ✓ | ✓ | GGUF · MLX | 262k (fix) |
qwen3; das 27B-Flaggschiff basiert laut Doku konkret auf Qwen 3.6 27B und erbt dessen Bild-Input-Fähigkeit). Zielgruppe sind Edge- und On-Device-Szenarien (Laptops, Smartphones, Wearables, Smart Glasses) mit vollständig lokaler Inferenz ohne Datenübertragung.Q1_0 ist offiziell in llama.cpp gemerged (native Kernel für CPU, Metal, CUDA, Vulkan; MLX-Support steht noch aus). Q2_0 (Ternär) benötigt im GGUF-Format aktuell den PrismML-eigenen llama.cpp-Fork, ist aber in Stock-MLX auf Apple Silicon nativ unterstützt. Läuft eine Datei auf einer Runtime ohne passenden Kernel, wird sie entweder abgelehnt oder still auf höhere Präzision entpackt – die VRAM-Ersparnis geht dann verloren, ohne dass eine Fehlermeldung erscheint.