| Ministral 3 3B |
Dense |
~2 GB |
PerfektLäuft voll im VRAM, riesiger Puffer für Kontext |
Ultra-komfortabelMassig Platz, viele parallele Anfragen |
Ultra-komfortabelViel Reserve für lange 256k-Kontexte |
Ultra-LeichtIdeal für Edge/Batch-Betrieb |
Gut nutzbar~18–22 Tok/Sek · passt locker in RAM |
| Ministral 3 14B Reasoning |
Dense |
~8 GB |
Nicht möglichVRAM zu klein; Modell überschreitet Limit |
GrenzbereichPasst knapp; lange Thinking-Ketten brauchen KV-Cache-Puffer |
KomfortabelAusreichend Puffer für Reasoning-Ketten |
Sehr komfortabelViel Puffer für lange Chain-of-Thought |
Akzeptabel~7–9 Tok/Sek · Thinking-Ketten verlängern Antwortzeit spürbar |
| Mistral 7B |
Dense |
~4 GB |
PerfektLäuft voll im VRAM, ~2 GB Puffer für Kontext |
Sehr komfortabelMassig Platz für langen Kontext |
Ultra-komfortabelViel Reserven für parallele Anfragen |
Ultra-LeichtIdeal für produktive Nutzung, viele parallele Slots |
Gut nutzbar~12–15 Tok/Sek · Modell passt komplett in RAM |
| Pixtral 12B |
Dense Vision |
~8 GB (inkl. Vision-Encoder) |
Nicht möglichVRAM zu klein für LM + Vision-Encoder |
GrenzbereichPasst knapp; wenig Puffer für Bild-Tokens |
KomfortabelGuter Puffer für Multi-Bild-Prompts |
Sehr komfortabelViel Reserve für hochauflösende Bilder |
Akzeptabel~7–9 Tok/Sek · Bildverarbeitung zusätzlich CPU-lastig |
| Mistral Nemo 12B |
Dense |
~8 GB |
Nicht möglichVRAM zu klein; Modell überschreitet Limit |
GrenzbereichPasst knapp; kaum Puffer für langen 128k-Kontext |
KomfortabelAusreichend Puffer für normalen Kontext |
Sehr komfortabelRiesiger KV-Cache-Puffer verfügbar |
Akzeptabel~8–10 Tok/Sek · Belegt halben RAM; bei 128k-Kontext träge |
| Mistral Small 3.2 24B |
Dense Vision |
~14 GB |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM zu klein |
GrenzbereichPasst knapp; kaum Puffer für Kontext oder Bilder |
KomfortabelGuter Puffer für Text + Vision-Prompts |
Grenzbereich~5–7 Tok/Sek · Modell + Kontext nahe an 16-GB-RAM-Limit |
| Codestral 22B |
Dense |
~12 GB |
Nicht möglichVRAM viel zu klein |
GrenzbereichPasst gerade so; kaum Puffer für langen Code-Kontext |
Knapp (Limit)Modell passt, aber bei großen Dateien droht Überlauf |
KomfortabelGuter Puffer für Code-Completion und FIM |
Nicht möglichÜberschreitet verfügbaren RAM |
| Devstral Small 2 24B |
Dense Vision |
~13,4 GB |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM zu klein |
GrenzbereichPasst knapp; agentische Tool-Loops brauchen Kontext-Puffer |
KomfortabelGuter Puffer für lange Agenten-Sessions |
Grenzbereich~5–7 Tok/Sek · nahe an 16-GB-RAM-Limit |
| Magistral Small 24B |
Dense Thinking |
~13,3 GB |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM zu klein |
GrenzbereichPasst knapp; lange Denk-Ketten benötigen KV-Cache-Puffer |
KomfortabelGuter Puffer für ausgedehnte Reasoning-Ketten |
Nicht möglichReasoning-Ketten verlangsamen CPU-Betrieb zusätzlich stark |
| Mixtral 8x7B (46,7 B) |
MoE 2/8 |
~29 GB |
Nicht möglichVRAM viel zu klein |
Nicht möglichAlle 8 Experten brauchen gemeinsam ~29 GB |
Nur Q2_K (~18 GB)Starker Qualitätsverlust; kaum praxistauglich |
Q3_K_M (~23 GB)Passt knapp; minimaler Kontext-Puffer |
Nicht möglichSprengt 16 GB RAM; System swappt massiv |
| Mixtral 8x22B (141 B) |
MoE 2/8 |
~90 GB |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM viel zu klein |
Nicht möglichBenötigt mind. 4× 24 GB GPU |
Nicht möglichSprengt jeden Consumer-RAM |
| Mistral Large 2 (123 B) |
Dense |
~74 GB |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM viel zu klein |
Nicht möglichVRAM viel zu klein |
Nicht möglichBenötigt mind. 4× 24 GB GPU |
Nicht möglichSprengt jeden Consumer-RAM |