Parameter gesamt7 B
ArchitekturDense Decoder-Transformer
Layer32
Hidden Size4096
Attention32 Query- / 32 KV-Heads (volle MHA, kein GQA)
Kontextfenster65.536 Token
Training5,5 Bio. Token (Dolma 3)
LizenzApache 2.0
Parameter gesamt7 B
BasisOLMo 3 7B Base + Tülu-Post-Training
Post-TrainingSFT · DPO · RLVR
Kontextfenster65.536 Token
FokusChat, Tool-/Function-Calling
ModalitätenText
LizenzApache 2.0
Parameter gesamt7 B
PipelineThink-SFT → Think-DPO → RLVR
Kontextfenster65.536 Token
FokusChain-of-Thought, Mathematik, Code
Benchmark≈ Qwen 3 8B auf MATH
LizenzApache 2.0
Parameter gesamt32 B
ArchitekturDense Decoder-Transformer
Layer64
Hidden Size5120
Attention40 Query- / 8 KV-Heads (GQA)
Kontextfenster65.536 Token
Training5,5 Bio. Token (Dolma 3)
LizenzApache 2.0
Parameter gesamt32 B
BasisOLMo 3 32B Base + Tülu-Post-Training
Post-TrainingSFT · DPO · RLVR
Kontextfenster65.536 Token
FokusChat, Tool-/Function-Calling
ModalitätenText
LizenzApache 2.0
Parameter gesamt32 B
PipelineThink-SFT → Think-DPO → RLVR
Kontextfenster65.536 Token
FokusStärkstes vollständig offenes Reasoning-Modell
BenchmarkNähert sich Qwen 3 32B bei ~6× weniger Trainingsdaten
LizenzApache 2.0
OLMo 3 (Ai2): OLMo 3 ist Allen AI's dritte Generation vollständig offener "glass-box"-Sprachmodelle: nicht nur die Gewichte, sondern auch Trainingsdaten (Dolma 3), Zwischen-Checkpoints, Trainingscode (OlmoCore) und die Post-Training-Pipeline (Dolci/Tülu 3) sind offen einsehbar. Die Familie erscheint in
7B und
32B, jeweils als
Base,
Instruct und
Think (Reasoning) sowie zusätzlich als
RL Zero (7B, reines RL-Bootstrapping ohne SFT-Start). Die GGUF-Architektur-Kennung lautet
olmo3.
Architektur-Unterschied 7B vs. 32B: Das 7B-Modell nutzt volle Multi-Head-Attention (32 Query- = 32 KV-Heads), das 32B-Modell dagegen Grouped-Query-Attention (40 Query- / 8 KV-Heads) zur Reduktion des KV-Cache. Beide Größen kombinieren Sliding-Window-Attention (3 von 4 Layern, Fenster 4096 Token) mit vollständiger Attention im jeweils letzten Layer eines Blocks sowie QK-Norm (RMSNorm auf Query/Key) und YaRN-Skalierung (Faktor 8) für ein natives Kontextfenster von 65.536 Token.
Think-Modelle: OLMo 3 32B Think gilt laut Ai2 als das stärkste vollständig offene Reasoning-Modell und nähert sich Qwen 3 32B an – bei rund 6× weniger Trainingsdaten. OLMo 3 7B Think erreicht auf MATH etwa das Niveau von Qwen 3 8B.
Tülu 3 – Post-Training-Rezept: Tülu 3 ist keine eigene Basisarchitektur, sondern Ai2's offene Post-Training-Pipeline (SFT → DPO → RLVR/RL mit verifizierbaren Belohnungen für Mathe/Code). Sie wurde ursprünglich auf Llama 3.1 (8B/70B/405B, Meta-Lizenz) angewendet und bildet zugleich die Grundlage der OLMo-3-Instruct-/Think-Varianten. Tülu-3-Modelle auf Llama-3.1-Basis unterliegen der Llama-3.1-Community-Lizenz, nicht Apache 2.0.
Quantisierung: Q4_K_M gilt für beide Größen als guter Kompromiss aus Qualität und Größe; für 32 GB Consumer-GPUs (RTX 5090) ist bei OLMo 3 32B auch Q6_K (~26,5 GB) praktikabel. Unter Q3 nimmt die Reasoning-Qualität der Think-Varianten spürbar ab.
VRAM-Werte stammen aus GGUF-Quantisierungen von bartowski (Basis: reale Dateigrößen, ohne KV-Cache). Architekturdetails aus Hugging-Face-Modellkarten (allenai/Olmo-3-1125-32B, allenai/Olmo-3-1125-7B) und dem OLMo-3-Technical-Report; Tülu-3-Angaben aus dem Tülu-3-Paper (arXiv:2411.15124) und den offiziellen Ai2-Dokumentationsseiten (
allenai.org/olmo,
docs.allenai.org/models/olmo,
docs.allenai.org/models/tulu). *Tülu-3-Kontextfenster entspricht dem der jeweiligen Llama-3.1-Basis; für 405B nicht offiziell separat dokumentiert.