← VRAM Calculator

OLMo 3 & Tülu 3

Allen Institute for AI (Ai2) · Apache 2.0 · 65k Kontextfenster · Vollständig offen (Gewichte, Daten, Code, Checkpoints)

olmo3 Sliding-Window Attention Thinking Mode (RLVR) Tool Calling Tülu 3 (Post-Training)

Architektur & Parameter

Dense OLMo 3 7B Base
Parameter gesamt7 B
ArchitekturDense Decoder-Transformer
Layer32
Hidden Size4096
Attention32 Query- / 32 KV-Heads (volle MHA, kein GQA)
Kontextfenster65.536 Token
Training5,5 Bio. Token (Dolma 3)
LizenzApache 2.0
Dense OLMo 3 7B Instruct
Parameter gesamt7 B
BasisOLMo 3 7B Base + Tülu-Post-Training
Post-TrainingSFT · DPO · RLVR
Kontextfenster65.536 Token
FokusChat, Tool-/Function-Calling
ModalitätenText
LizenzApache 2.0
Dense Thinking OLMo 3 7B Think
Parameter gesamt7 B
PipelineThink-SFT → Think-DPO → RLVR
Kontextfenster65.536 Token
FokusChain-of-Thought, Mathematik, Code
Benchmark≈ Qwen 3 8B auf MATH
LizenzApache 2.0
Dense OLMo 3 32B Base
Parameter gesamt32 B
ArchitekturDense Decoder-Transformer
Layer64
Hidden Size5120
Attention40 Query- / 8 KV-Heads (GQA)
Kontextfenster65.536 Token
Training5,5 Bio. Token (Dolma 3)
LizenzApache 2.0
Dense OLMo 3 32B Instruct
Parameter gesamt32 B
BasisOLMo 3 32B Base + Tülu-Post-Training
Post-TrainingSFT · DPO · RLVR
Kontextfenster65.536 Token
FokusChat, Tool-/Function-Calling
ModalitätenText
LizenzApache 2.0
Dense Thinking OLMo 3 32B Think Flagship
Parameter gesamt32 B
PipelineThink-SFT → Think-DPO → RLVR
Kontextfenster65.536 Token
FokusStärkstes vollständig offenes Reasoning-Modell
BenchmarkNähert sich Qwen 3 32B bei ~6× weniger Trainingsdaten
LizenzApache 2.0

VRAM-Kompatibilität (Q4_K_M-Quantisierung, GGUF)

Modell Typ VRAM Q4_K_M 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. RTX 3090 / 4090 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
OLMo 3 7B (Base/Instruct/Think) Dense ~4,5 GB Knapp möglichPasst, aber kaum Puffer für langen Kontext KomfortabelViel Reserve für 65k Kontext Sehr komfortabelAuch Q6/Q8 möglich Ultra-LeichtMassig Platz für parallele Agenten Gut nutzbar~8–12 Tok/Sek · Passt komplett in RAM
OLMo 3 32B (Base/Instruct/Think) Dense ~19,5 GB Nicht möglichVRAM viel zu klein Nicht möglichAuch Q3 (~15,6 GB) hat kaum Puffer Q3 möglichQ3_K_M (~15,6 GB) passt; Q4 (~19,5 GB) läuft über Knapp möglich (Q4)~19,5 GB + wenig Puffer für KV-Cache bei langem Kontext Nicht möglichModell sprengt 16 GB RAM → starker Swap
Tülu 3 8B (Llama 3.1) Dense ~4,9 GB Knapp möglichPasst, wenig Puffer für langen Kontext KomfortabelViel Platz für 128k Kontext (Llama-3.1-Basis) Sehr komfortabelAuch höhere Quants möglich Ultra-LeichtMassig Reserven Gut nutzbar~8–12 Tok/Sek · Passt komplett in RAM
Tülu 3 70B (Llama 3.1) Dense ~42,5 GB Nicht möglich Nicht möglich Nicht möglich Nicht möglichBraucht Multi-GPU (2× 24 GB) oder Q2/Q3-Offload Nicht möglichSprengt 16 GB RAM vollständig
Tülu 3 405B (Llama 3.1) Dense ~230 GB Nicht möglich Nicht möglich Nicht möglich Nicht möglichNur Multi-GPU-Cluster (z. B. 4–8× A100/H100) Nicht möglich

Fähigkeiten & Features

Modell Text Thinking Tool Calling GQA Kontext Basis / Post-Training
OLMo 3 7B Base 65k Dolma 3 (5,5 Bio. Token)
OLMo 3 7B Instruct 65k SFT · DPO · RLVR
OLMo 3 7B Think 65k Think-SFT · Think-DPO · RLVR
OLMo 3 32B Base 65k Dolma 3 (5,5 Bio. Token)
OLMo 3 32B Instruct 65k SFT · DPO · RLVR
OLMo 3 32B Think 65k Think-SFT · Think-DPO · RLVR
Tülu 3 8B / 70B / 405B 128k* Llama 3.1 + SFT · DPO · RLVR
OLMo 3 (Ai2): OLMo 3 ist Allen AI's dritte Generation vollständig offener "glass-box"-Sprachmodelle: nicht nur die Gewichte, sondern auch Trainingsdaten (Dolma 3), Zwischen-Checkpoints, Trainingscode (OlmoCore) und die Post-Training-Pipeline (Dolci/Tülu 3) sind offen einsehbar. Die Familie erscheint in 7B und 32B, jeweils als Base, Instruct und Think (Reasoning) sowie zusätzlich als RL Zero (7B, reines RL-Bootstrapping ohne SFT-Start). Die GGUF-Architektur-Kennung lautet olmo3.

Architektur-Unterschied 7B vs. 32B: Das 7B-Modell nutzt volle Multi-Head-Attention (32 Query- = 32 KV-Heads), das 32B-Modell dagegen Grouped-Query-Attention (40 Query- / 8 KV-Heads) zur Reduktion des KV-Cache. Beide Größen kombinieren Sliding-Window-Attention (3 von 4 Layern, Fenster 4096 Token) mit vollständiger Attention im jeweils letzten Layer eines Blocks sowie QK-Norm (RMSNorm auf Query/Key) und YaRN-Skalierung (Faktor 8) für ein natives Kontextfenster von 65.536 Token.

Think-Modelle: OLMo 3 32B Think gilt laut Ai2 als das stärkste vollständig offene Reasoning-Modell und nähert sich Qwen 3 32B an – bei rund 6× weniger Trainingsdaten. OLMo 3 7B Think erreicht auf MATH etwa das Niveau von Qwen 3 8B.

Tülu 3 – Post-Training-Rezept: Tülu 3 ist keine eigene Basisarchitektur, sondern Ai2's offene Post-Training-Pipeline (SFT → DPO → RLVR/RL mit verifizierbaren Belohnungen für Mathe/Code). Sie wurde ursprünglich auf Llama 3.1 (8B/70B/405B, Meta-Lizenz) angewendet und bildet zugleich die Grundlage der OLMo-3-Instruct-/Think-Varianten. Tülu-3-Modelle auf Llama-3.1-Basis unterliegen der Llama-3.1-Community-Lizenz, nicht Apache 2.0.

Quantisierung: Q4_K_M gilt für beide Größen als guter Kompromiss aus Qualität und Größe; für 32 GB Consumer-GPUs (RTX 5090) ist bei OLMo 3 32B auch Q6_K (~26,5 GB) praktikabel. Unter Q3 nimmt die Reasoning-Qualität der Think-Varianten spürbar ab.

VRAM-Werte stammen aus GGUF-Quantisierungen von bartowski (Basis: reale Dateigrößen, ohne KV-Cache). Architekturdetails aus Hugging-Face-Modellkarten (allenai/Olmo-3-1125-32B, allenai/Olmo-3-1125-7B) und dem OLMo-3-Technical-Report; Tülu-3-Angaben aus dem Tülu-3-Paper (arXiv:2411.15124) und den offiziellen Ai2-Dokumentationsseiten (allenai.org/olmo, docs.allenai.org/models/olmo, docs.allenai.org/models/tulu). *Tülu-3-Kontextfenster entspricht dem der jeweiligen Llama-3.1-Basis; für 405B nicht offiziell separat dokumentiert.