← VRAM Calculator

Mistral & Mixtral

Mistral AI · Dense, MoE, Vision & Reasoning · seit September 2023 · 100+ Sprachen

mistral Mixtral MoE Function Calling Code-Spezialist Sliding Window Attention Vision Thinking / Reasoning

Architektur & Parameter

Dense Ministral 3 3B
Parameter3 B
Layer26
Attention Heads32 (GQA: 8 KV-Heads)
Kontextfenster256k Token
TokenizerTekken (131k Vokabular)
ModalitätenText + Vision
VeröffentlichtDezember 2025
LizenzMistral Research License
Dense Ministral 3 14B Reasoning
Parameter14 B
Layer40
Attention Heads32 (GQA: 8 KV-Heads)
Kontextfenster256k Token
TokenizerTekken (131k Vokabular)
BesonderheitThinking-Modus + Vision-Encoder
VeröffentlichtDezember 2025
LizenzMistral Research License
Dense Mistral 7B
Parameter7 B
Layer32
Attention Heads32 (GQA: 8 KV-Heads)
Kontextfenster8k Token
Sliding Window4.096 Token
Vokabular32.000
VeröffentlichtSeptember 2023
LizenzApache 2.0
Dense Vision Pixtral 12B
Parameter12 B
Vision-Encoder~400 M (eigenständig trainiert)
Kontextfenster128k Token
Bildauflösungvariabel, native Seitenverhältnisse
BasisMistral Nemo 12B
VeröffentlichtSeptember 2024
LizenzApache 2.0
Dense Mistral Nemo 12B
Parameter12 B
Layer40
Kontextfenster128k Token
TokenizerTekken (131k Vokabular)
BesonderheitFP8-optimiert (QAT)
Sprachen100+
VeröffentlichtJuli 2024
LizenzApache 2.0
Dense Vision Mistral Small 3.2 24B
Parameter24 B
Layer40
Attention Heads32 (GQA: 8 KV-Heads)
Kontextfenster128k Token
BesonderheitNachfolger von 3.0/3.1, verbesserte Instruction-Following
VeröffentlichtJuni 2025
LizenzApache 2.0
Dense Codestral 22B
Parameter22 B
Kontextfenster32k Token
Programmiersprachen80+
Fill-in-Middle (FIM)Ja
BesonderheitCode-Spezialist
LizenzNon-Commercial (MNPL)
Dense Vision Devstral Small 2 24B
Parameter24 B
Layer40
Attention Heads32 (GQA: 8 KV-Heads)
Kontextfenster128k Token
BesonderheitAgentic Coding · Tool-Use, entwickelt mit All Hands AI
VeröffentlichtDezember 2025 (Nachfolger von 2507)
LizenzApache 2.0
Dense Thinking Vision Magistral Small 24B
Parameter24 B
Layer40
Attention Heads32 (GQA: 8 KV-Heads)
Kontextfenster128k Token
BesonderheitErstes Mistral-Reasoning-Modell, Chain-of-Thought
VeröffentlichtSeptember 2025 (2509)
LizenzApache 2.0
MoE 2/8 Mixtral 8x7B
Aktive Parameter12,9 B
Parameter gesamt46,7 B
Experten2 aktiv / 8 gesamt
Layer32
Kontextfenster32k Token
Vokabular32.000
BesonderheitAlle 8 Experten im VRAM
LizenzApache 2.0
MoE 2/8 Mixtral 8x22B
Aktive Parameter39 B
Parameter gesamt141 B
Experten2 aktiv / 8 gesamt
Kontextfenster64k Token
Function CallingJa
BesonderheitMulti-GPU erforderlich
LizenzApache 2.0
Dense Mistral Large 2 123B
Parameter123 B
Kontextfenster128k Token
FokusCode, Mathematik, Multilingual, Function Calling
BesonderheitFlaggschiff, nur Datacenter-tauglich
VeröffentlichtJuli 2024
LizenzMistral Research License

VRAM-Kompatibilität (Q4-Quantisierung)

Modell Typ VRAM Q4 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. Intel Arc Pro B60 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
Ministral 3 3B Dense ~2 GB PerfektLäuft voll im VRAM, riesiger Puffer für Kontext Ultra-komfortabelMassig Platz, viele parallele Anfragen Ultra-komfortabelViel Reserve für lange 256k-Kontexte Ultra-LeichtIdeal für Edge/Batch-Betrieb Gut nutzbar~18–22 Tok/Sek · passt locker in RAM
Ministral 3 14B Reasoning Dense ~8 GB Nicht möglichVRAM zu klein; Modell überschreitet Limit GrenzbereichPasst knapp; lange Thinking-Ketten brauchen KV-Cache-Puffer KomfortabelAusreichend Puffer für Reasoning-Ketten Sehr komfortabelViel Puffer für lange Chain-of-Thought Akzeptabel~7–9 Tok/Sek · Thinking-Ketten verlängern Antwortzeit spürbar
Mistral 7B Dense ~4 GB PerfektLäuft voll im VRAM, ~2 GB Puffer für Kontext Sehr komfortabelMassig Platz für langen Kontext Ultra-komfortabelViel Reserven für parallele Anfragen Ultra-LeichtIdeal für produktive Nutzung, viele parallele Slots Gut nutzbar~12–15 Tok/Sek · Modell passt komplett in RAM
Pixtral 12B Dense Vision ~8 GB
(inkl. Vision-Encoder)
Nicht möglichVRAM zu klein für LM + Vision-Encoder GrenzbereichPasst knapp; wenig Puffer für Bild-Tokens KomfortabelGuter Puffer für Multi-Bild-Prompts Sehr komfortabelViel Reserve für hochauflösende Bilder Akzeptabel~7–9 Tok/Sek · Bildverarbeitung zusätzlich CPU-lastig
Mistral Nemo 12B Dense ~8 GB Nicht möglichVRAM zu klein; Modell überschreitet Limit GrenzbereichPasst knapp; kaum Puffer für langen 128k-Kontext KomfortabelAusreichend Puffer für normalen Kontext Sehr komfortabelRiesiger KV-Cache-Puffer verfügbar Akzeptabel~8–10 Tok/Sek · Belegt halben RAM; bei 128k-Kontext träge
Mistral Small 3.2 24B Dense Vision ~14 GB Nicht möglichVRAM viel zu klein Nicht möglichVRAM zu klein GrenzbereichPasst knapp; kaum Puffer für Kontext oder Bilder KomfortabelGuter Puffer für Text + Vision-Prompts Grenzbereich~5–7 Tok/Sek · Modell + Kontext nahe an 16-GB-RAM-Limit
Codestral 22B Dense ~12 GB Nicht möglichVRAM viel zu klein GrenzbereichPasst gerade so; kaum Puffer für langen Code-Kontext Knapp (Limit)Modell passt, aber bei großen Dateien droht Überlauf KomfortabelGuter Puffer für Code-Completion und FIM Nicht möglichÜberschreitet verfügbaren RAM
Devstral Small 2 24B Dense Vision ~13,4 GB Nicht möglichVRAM viel zu klein Nicht möglichVRAM zu klein GrenzbereichPasst knapp; agentische Tool-Loops brauchen Kontext-Puffer KomfortabelGuter Puffer für lange Agenten-Sessions Grenzbereich~5–7 Tok/Sek · nahe an 16-GB-RAM-Limit
Magistral Small 24B Dense Thinking ~13,3 GB Nicht möglichVRAM viel zu klein Nicht möglichVRAM zu klein GrenzbereichPasst knapp; lange Denk-Ketten benötigen KV-Cache-Puffer KomfortabelGuter Puffer für ausgedehnte Reasoning-Ketten Nicht möglichReasoning-Ketten verlangsamen CPU-Betrieb zusätzlich stark
Mixtral 8x7B (46,7 B) MoE 2/8 ~29 GB Nicht möglichVRAM viel zu klein Nicht möglichAlle 8 Experten brauchen gemeinsam ~29 GB Nur Q2_K (~18 GB)Starker Qualitätsverlust; kaum praxistauglich Q3_K_M (~23 GB)Passt knapp; minimaler Kontext-Puffer Nicht möglichSprengt 16 GB RAM; System swappt massiv
Mixtral 8x22B (141 B) MoE 2/8 ~90 GB Nicht möglichVRAM viel zu klein Nicht möglichVRAM viel zu klein Nicht möglichVRAM viel zu klein Nicht möglichBenötigt mind. 4× 24 GB GPU Nicht möglichSprengt jeden Consumer-RAM
Mistral Large 2 (123 B) Dense ~74 GB Nicht möglichVRAM viel zu klein Nicht möglichVRAM viel zu klein Nicht möglichVRAM viel zu klein Nicht möglichBenötigt mind. 4× 24 GB GPU Nicht möglichSprengt jeden Consumer-RAM

Fähigkeiten & Modalitäten

Modell Text Code Vision Thinking Function Calling Multilingual Kontext Lizenz
Ministral 3 3B ✓ ~ ✓ ✗ ✓ ✓ 256k Research License
Ministral 3 14B Reasoning ✓ ✓ ✓ ✓ ✓ ✓ 256k Research License
Mistral 7B ✓ ~ ✗ ✗ ~ ~ 8k Apache 2.0
Pixtral 12B ✓ ~ ✓ ✗ ✓ ✓ 128k Apache 2.0
Mistral Nemo 12B ✓ ✓ ✗ ✗ ✓ ✓ 128k Apache 2.0
Mistral Small 3.2 24B ✓ ✓ ✓ ✗ ✓ ✓ 128k Apache 2.0
Codestral 22B ~ ✓ ✗ ✗ ✗ ~ 32k Non-Commercial
Devstral Small 2 24B ✓ ✓ ✓ ✗ ✓ ~ 128k Apache 2.0
Magistral Small 24B ✓ ✓ ✓ ✓ ✓ ✓ 128k Apache 2.0
Mixtral 8x7B ✓ ✓ ✗ ✗ ✓ ✓ 32k Apache 2.0
Mixtral 8x22B ✓ ✓ ✗ ✗ ✓ ✓ 64k Apache 2.0
Mistral Large 2 ✓ ✓ ✗ ✗ ✓ ✓ 128k Research License

Quantisierungen

Modell Format Variante VRAM Hinweis
Ministral 3 3B GGUF Q4_K_M ~2 GB Läuft auch auf Edge-Geräten
Ministral 3 3B FP16 — ~6 GB Volles Gewicht
Ministral 3 14B Reasoning GGUF Q4_K_M ~7,7 GB Empfohlen für 12–16-GB-GPUs
Ministral 3 14B Reasoning FP16 — ~28 GB Volles Gewicht
Mistral 7B GGUF Q4_K_M ~4 GB Empfohlen für 6-GB-GPUs
Mistral 7B GGUF Q8_0 ~7 GB
Mistral 7B FP16 — ~14 GB Volles Gewicht
Pixtral 12B GGUF Q4_K_M ~7 GB + ~1 GB mmproj (Vision-Encoder)
Pixtral 12B FP16 — ~24 GB Volles Gewicht
Nemo 12B GGUF Q4_K_M ~8 GB Empfohlen für 12-GB-GPUs
Nemo 12B FP8 (offiziell, QAT) — ~12 GB Optimierte Qualität für NVIDIA Hopper (H100/H200)
Nemo 12B FP16 — ~24 GB Volles Gewicht
Mistral Small 3.2 24B GGUF Q4_K_M ~14 GB Empfohlen für 16–24-GB-GPUs
Mistral Small 3.2 24B FP16 — ~48 GB Volles Gewicht
Devstral Small 2 24B GGUF Q4_K_M ~13,4 GB Empfohlen für 16–24-GB-GPUs
Devstral Small 2 24B FP16 — ~48 GB Volles Gewicht
Magistral Small 24B GGUF Q4_K_M ~13,3 GB Empfohlen für 16–24-GB-GPUs
Magistral Small 24B FP16 — ~48 GB Volles Gewicht
Mixtral 8x7B GGUF Q2_K ~18 GB Kleinstes nutzbares GGUF; starker Qualitätsverlust
Mixtral 8x7B GGUF Q3_K_M ~23 GB Empfohlen für 24-GB-GPU
Mixtral 8x7B GGUF Q4_K_M ~29 GB Standard-Qualitätsstufe; braucht 32-GB-GPU
Mixtral 8x7B GGUF Q5_K_M ~35 GB
Mixtral 8x7B GGUF Q6_K ~41 GB
Mixtral 8x7B GGUF Q8_0 ~52 GB
Mixtral 8x7B FP16 — ~95 GB Nur Multi-GPU
Mixtral 8x22B GGUF Q3_K_M ~72 GB 3× 24 GB GPU oder 64 GB Mac
Mixtral 8x22B GGUF Q4_K_M ~90 GB 96 GB Mac oder 4× 24 GB GPU
Mixtral 8x22B GGUF Q5_K_M ~105 GB
Mixtral 8x22B GGUF Q6_K ~120 GB
Mixtral 8x22B GGUF Q8_0 ~155 GB 4× 48 GB oder 2× 80 GB GPU
Mistral Large 2 123B GGUF Q4_K_M ~74 GB 2× 48 GB oder 4× 24 GB GPU
Mistral Large 2 123B FP16 — ~246 GB Nur Multi-GPU-Datacenter

Kontextabhängiger VRAM-Bedarf (Mixtral 8x7B, Q4_K_M)

Kontextlänge Modell-VRAM KV-Cache zusätzlich Gesamt VRAM ca.
4 K Token ~29 GB ~1–2 GB ~30–31 GB
8 K Token ~29 GB ~2–3 GB ~31–32 GB
32 K Token ~29 GB ~6–8 GB ~35–37 GB

Deployment

Ollama Einfachste Option
Ministralollama run ministral
Mistral 7Bollama run mistral:7b
Pixtralollama run pixtral
Nemo 12Bollama run mistral-nemo
Mistral Smallollama run mistral-small3.2
Codestralollama run codestral
Devstralollama run devstral
Magistralollama run magistral
Mixtral 8x7Bollama run mixtral:8x7b
Mixtral 8x22Bollama run mixtral:8x22b
Mistral Largeollama run mistral-large
LM Studio GUI mit GGUF-Auswahl
Alle ModelleGGUF direkt wählbar
Vision-Modellemmproj-Datei zusätzlich laden
Mixtral 8x7B TippQ3_K_M für 24-GB-GPUs wählen
llama.cpp KV-Optimierung
KV-Quantisierung--cache-type-k q4_0 --cache-type-v q4_0
GPU-Offload-ngl 999
Vision-Modelle--mmproj mmproj-F16.gguf
GGUF-QuelleTheBloke / bartowski auf HuggingFace
vLLM Single-GPU (bis 24B)
7Bvllm serve mistralai/Mistral-7B-Instruct-v0.3
Nemo 12Bvllm serve mistralai/Mistral-Nemo-Instruct-2407
Small 3.2vllm serve mistralai/Mistral-Small-3.2-24B-Instruct
vLLM Multi-GPU (Mixtral / Large)
8x7B (2× GPU)--tensor-parallel-size 2
8x22B (4× GPU)--tensor-parallel-size 4
Large 2 (4× GPU)--tensor-parallel-size 4
GPU-Auslastung--gpu-memory-utilization 0.90
Codestral API FIM via Mistral AI
Endpointcodestral.mistral.ai/ v1/fim/completions
LokalNon-Commercial-Lizenz beachten
IDE-IntegrationContinue.dev, Cursor, VS Code
Hinweise:
· VRAM-Werte gelten für Q4_K_M-Quantisierung ohne KV-Cache. Bei vollem Kontextfenster steigt der Bedarf deutlich.
· Mixtral MoE: Trotz nur 2 aktiver Experten pro Token müssen alle 8 Experten vollständig im VRAM liegen. Der VRAM-Bedarf richtet sich nach der Gesamtparameterzahl (46,7 B bzw. 141 B), nicht nach den aktiven Parametern.
· Mistral 7B war bei Veröffentlichung (September 2023) das erste Open-Source-Modell, das GPT-3.5 auf mehreren Benchmarks übertroffen hat, mit nur 7 B Parametern durch Sliding Window Attention und GQA.
· Mistral Nemo 12B nutzt den Tekken-Tokenizer mit 131.072 Vokabular-Tokens, deutlich besser für Nicht-Latein-Sprachen als das 32k-Vokabular älterer Mistral-Modelle.
· Mistral Nemo 12B ist für FP8-Quantisierung optimiert (Quantization-Aware Training), passend zur NVIDIA-Hopper-Architektur (H100, H200).
· Codestral 22B ist unter der Mistral AI Non-Production License (MNPL) veröffentlicht. Kommerzielle Nutzung erfordert eine separate Lizenz, lokale Nutzung für Entwickler ist erlaubt.
· Codestral Fill-in-Middle (FIM) ermöglicht Code-Completion mitten im Dokument, nützlich für IDE-Integration (Continue.dev, Cursor).
· Mixtral 8x7B mit Q2_K (~18 GB) läuft technisch auf einer 16-GB-GPU, aber der Qualitätsverlust ist erheblich. Neuere Modelle wie Qwen3-14B (Q4, ~9 GB) liefern vergleichbare oder bessere Ergebnisse bei deutlich weniger VRAM.
· Mixtral 8x22B ist auf Consumer-Hardware nicht praxistauglich, eine Cloud-API (Mistral AI Platform, Together.ai, Anyscale) ist die realistische Option.
· Pixtral 12B war Mistrals erstes multimodales Modell (September 2024) und verarbeitet Bilder in beliebiger Auflösung und beliebigem Seitenverhältnis ohne festes Tiling.
· Mistral Small entwickelte sich von 3.0 (Januar 2025, reiner Text) über 3.1 (März 2025, erstmals multimodal) zu 3.2 (Juni 2025, robusteres Instruction-Following). Alle Versionen bleiben unter Apache 2.0.
· Devstral Small wurde zusammen mit All Hands AI für agentisches Programmieren entwickelt (SWE-bench-Fokus) und ist trotz starker Coding-Fähigkeiten vollständig unter Apache 2.0 lizenziert; Version 2 (Dezember 2025) ergänzt einen Vision-Encoder.
· Magistral Small war im Juni 2025 Mistrals erstes dediziertes Reasoning-Modell mit sichtbarer Denkkette (Chain-of-Thought). Das größere Magistral Medium bleibt proprietär und ist nur über die API verfügbar.
· Mistral Large 2 (123 B, Juli 2024) steht unter der Mistral Research License: kostenlos für Forschung und nicht-kommerzielle Nutzung, für den kommerziellen Einsatz ist eine separate Lizenz von Mistral AI nötig.
· Ministral 3B/8B (heute Ministral 3) zielen auf Edge- und On-Device-Einsatz: sehr kleiner Speicherbedarf bei gleichzeitig großem 256k-Kontextfenster.
· Alle Apache-2.0-lizenzierten Mistral- und Mixtral-Modelle haben keine proprietären Nutzungsbeschränkungen für kommerzielle Projekte; Codestral, Mistral Large und die Ministral-Reihe unterliegen dagegen eingeschränkteren Lizenzen.