← VRAM Calculator

Bonsai

PrismML · Apache 2.0 · 1-Bit & Ternär-Quantisierung · Dense (Qwen3-Basis) · Edge/On-Device-Fokus

qwen3 1-bit (Q1_0) Ternär (Q2_0) Thinking Mode Function Calling Vision (27B) YaRN 4×

Architektur & Parameter

Dense Bonsai 1.7B
Parameter gesamt1.7 B
ArchitekturDense
Layer28
Kontextfenster8.192 → 32.768 (YaRN 4×)
AttentionStandard (GQA, 8 KV-Heads)
ModalitätenText
LizenzApache 2.0
Dense Bonsai 4B
Parameter gesamt~4 B
ArchitekturDense
Layer36
Kontextfenster8.192 → 32.768 (YaRN 4×)
AttentionStandard (GQA, 8 KV-Heads)
ModalitätenText
LizenzApache 2.0
Dense Bonsai 8B
Parameter gesamt8.2 B
ArchitekturDense
Layer36
Kontextfenster16.384 → 65.536 (YaRN 4×)
AttentionStandard (GQA, 8 KV-Heads)
ModalitätenText
LizenzApache 2.0
Dense Vision Bonsai 27B Flagship
Parameter gesamt27 B
ArchitekturDense (Basis: Qwen 3.6 27B)
Kontextfenster262.144 Token
AttentionStandard (kein YaRN nötig)
Vision-Tower~0,9 GiB · 4-bit
ModalitätenText · Bild → Text
LizenzApache 2.0

VRAM-Kompatibilität (native 1-bit- / Ternär-Gewichte, Basiskontext)

Modell Typ Größe 1-bit / Ternär 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. RTX 3090 / 4090 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
Bonsai 1.7B Dense ~0,25 / ~0,43 GB Ultra-LeichtVerschwindend kleiner Fußabdruck; massig Puffer Ultra-LeichtPraktisch kostenlos in VRAM Ultra-LeichtDutzende parallele Instanzen möglich Ultra-LeichtKein sinnvoller Engpass mehr Sehr gutZielplattform: Wearables/Smart Glasses – auch ohne GPU flott
Bonsai 4B Dense ~0,57 / ~1,0 GB Ultra-LeichtPasst mehrfach parallel in 6 GB Ultra-LeichtKaum messbarer VRAM-Verbrauch Ultra-LeichtViel Reserve für langen Kontext Ultra-LeichtKein sinnvoller Engpass mehr Sehr gutFür Edge-Geräte mit wenig RAM ausgelegt
Bonsai 8B Dense ~1,1 / ~2,0–2,3 GB KomfortabelAuch Ternär-Variante passt locker Sehr komfortabelReserve für 65k Kontext Sehr komfortabelVolle YaRN-Kontextlänge nutzbar Ultra-LeichtMassig Platz für Parallel-Sessions Gut nutzbarBis zu ~368 Tok/Sek lt. PrismML (Referenzsystem)
Bonsai 27B Dense Vision ~4,4 / ~8,0 GB
(inkl. ~0,9 GiB Vision-Tower)
Nur 1-bit knapp1-bit passt (~4,4 GB); Ternär (~8 GB) läuft über KomfortabelBeide Varianten passen; Reserve für KV-Cache Sehr komfortabelViel Platz für Bild-Input + langen Kontext Sehr komfortabelVergleichsweise winzig für ein 27B-Modell Gut nutzbarSelbst Ternär passt komplett in 16 GB RAM

KV-Cache-Wachstum (fp16-Cache, aus GGUF-Metadaten berechnet)

Modell Basis (nativ) KV @ nativ Max (YaRN 4×) KV @ Max Hinweis
Bonsai 1.7B 8k ~0,9 GB 32k ~3,5 GB Standard-Attention – KV-Cache wächst linear und übersteigt bei 32k das Modellgewicht deutlich
Bonsai 4B 8k ~0,7 GB 32k ~2,9 GB Kleinerer Head-Dim (80) bremst das Wachstum leicht gegenüber 1.7B/8B
Bonsai 8B 16k ~2,3 GB 65k ~9,0 GB Bei voller YaRN-Kontextlänge übersteigt der KV-Cache das (1-bit-)Gewicht um ein Vielfaches
Bonsai 27B 262k k. A.* *Kein YaRN nötig, aber keine eigenen GGUF-Header-Metadaten im Modell-Cache vorhanden – analog Qwen 3.6 27B ist bei 262k Token mit mehreren zusätzlichen GB KV-Cache zu rechnen

Fähigkeiten & Features

Modell Text Bild Thinking Function Calling Formate Kontext (nativ → YaRN)
Bonsai 1.7B GGUF · MLX 8k → 32k
Bonsai 4B GGUF · MLX 8k → 32k
Bonsai 8B GGUF · MLX 16k → 65k
Bonsai 27B GGUF · MLX 262k (fix)
PrismML & Bonsai: Bonsai ist eine Familie extrem quantisierter Modelle von PrismML auf Basis der Qwen3-Architektur (GGUF-Kennung qwen3; das 27B-Flaggschiff basiert laut Doku konkret auf Qwen 3.6 27B und erbt dessen Bild-Input-Fähigkeit). Zielgruppe sind Edge- und On-Device-Szenarien (Laptops, Smartphones, Wearables, Smart Glasses) mit vollständig lokaler Inferenz ohne Datenübertragung.

1-bit vs. Ternär: 1-bit (Q1_0) begrenzt alle Gewichte (Embeddings, Attention, MLPs, LM-Head) auf {−1, +1} – maximale Kompression, kleinster Fußabdruck (z. B. 27B nur ~3,5 GiB statt ~54 GB in Full-Precision). Ternär (Q2_0) erlaubt zusätzlich 0 als Gewichtswert und ist dadurch ca. 50 % größer, liefert laut PrismML aber messbar höhere Ausgabequalität. Der Vision-Tower von Bonsai 27B läuft unabhängig davon immer mit 4-bit-Präzision.

Wichtig – Runtime-Unterstützung prüfen: Q1_0 ist offiziell in llama.cpp gemerged (native Kernel für CPU, Metal, CUDA, Vulkan; MLX-Support steht noch aus). Q2_0 (Ternär) benötigt im GGUF-Format aktuell den PrismML-eigenen llama.cpp-Fork, ist aber in Stock-MLX auf Apple Silicon nativ unterstützt. Läuft eine Datei auf einer Runtime ohne passenden Kernel, wird sie entweder abgelehnt oder still auf höhere Präzision entpackt – die VRAM-Ersparnis geht dann verloren, ohne dass eine Fehlermeldung erscheint.

KV-Cache bleibt teuer: Trotz winziger Modellgewichte nutzt Bonsai reine Standard-Attention (kein Hybrid/Linear-Attention wie GatedDeltaNet bei Qwen 3.6). Bei voller YaRN-Kontextlänge übersteigt der fp16-KV-Cache besonders bei 8B/27B das eigentliche Gewicht um ein Vielfaches – die Formate glänzen primär bei kurzem bis mittlerem Kontext.

Quellen: Werte für 1.7B/4B/8B stammen aus lokal gecachten GGUF-Headern (models_cache.json); Werte für 27B sowie alle Formatangaben stammen aus der PrismML-Dokumentation (docs.prismml.com), da noch keine vollständigen 27B-LLM-Metadaten im lokalen Cache vorliegen.