← VRAM Calculator

Baidu ERNIE 4.5

Baidu · Apache 2.0 · 131.072 Token Kontextfenster · Heterogene Multimodal-MoE-Architektur · PaddlePaddle

ernie4_5 / ernie4_5-moe MoE (Mixture-of-Experts) Vision (VL-Varianten) Thinking Tool Calling

Architektur & Parameter

Dense ERNIE 4.5 0.3B (Base / PT)
Parameter gesamt0,36 B
ArchitekturDense Decoder-Transformer
Layer18
Kontextfenster131.072 Token
EinsatzzweckEdge / On-Device, Distillations-Ziel für größere Varianten
LizenzApache 2.0
MoE ERNIE 4.5 21B-A3B (Base / PT)
Parameter gesamt21 B (≈ 3 B aktiv)
Layer28
Hidden Size2560
Attention20 Query- / 4 KV-Heads (GQA)
Experten64 gesamt · 6 aktiv · 2 shared
Kontextfenster131.072 Token
Vocab103.424 Token
LizenzApache 2.0
MoE Thinking ERNIE 4.5 21B-A3B-Thinking
Parameter gesamt21 B (≈ 3 B aktiv)
BasisERNIE 4.5 21B-A3B + Reasoning-Post-Training
FokusChain-of-Thought, Mathematik, Code, Logik
Kontextfenster131.072 Token
Tool CallingJa (auch im Thinking-Modus)
LizenzApache 2.0
MoE Vision ERNIE 4.5 VL 28B-A3B
Parameter gesamt28 B (≈ 3 B aktiv)
Layer28
Attention20 Query- / 4 KV-Heads (GQA)
Experten64 Text- + 64 Vision-Experten (je 6 aktiv) · 2 shared
ModalitätenText + Vision (Bild/Video-Verständnis)
VariantenBase · PT · Thinking
Kontextfenster131.072 Token
LizenzApache 2.0
MoE ERNIE 4.5 300B-A47B (Base / PT) Flagship
Parameter gesamt300 B (≈ 47 B aktiv)
Layer54
Hidden Size8192
Attention64 Query- / 8 KV-Heads (GQA)
Experten64 gesamt · 8 aktiv
Kontextfenster131.072 Token
BenchmarkÜbertrifft DeepSeek-V3-671B-A37B-Base auf 22/28 Benchmarks
LizenzApache 2.0
MoE Vision ERNIE 4.5 VL 424B-A47B Flagship
Parameter gesamt424 B (≈ 47 B aktiv)
Layer54
Hidden Size8192
Attention64 Query- / 8 KV-Heads (GQA)
Experten128 gesamt (Text+Vision) · 16 aktiv
ModalitätenText + Vision (Bild/Video-Verständnis)
Kontextfenster131.072 Token
LizenzApache 2.0

VRAM-Kompatibilität (Q4_K_M-Quantisierung, GGUF)

Modell Typ VRAM Q4_K_M 6 GB VRAMz. B. NVIDIA A2000 12 GB VRAMz. B. RTX 3060 Ti 16 GB VRAMz. B. RTX 4060 Ti 24 GB VRAMz. B. RTX 3090 / 4090 CPU · 16 GB RAMz. B. Ryzen 7 (AM4)
ERNIE 4.5 0.3B (Base/PT) Dense ~0,24 GB Ultra-LeichtMassig Puffer, auch F16 problemlos Ultra-LeichtPraktisch beliebig viel Kontext Ultra-Leicht— Ultra-LeichtFür Edge/On-Device gedacht, läuft überall Sehr gut nutzbar>20 Tok/Sek · vernachlässigbarer RAM-Bedarf
ERNIE 4.5 21B-A3B (Base/PT/Thinking) MoE ~13,5 GB Nicht möglichVRAM viel zu klein Nicht möglichAuch Q3_K_M (~10,3 GB) hat kaum Puffer für 131k Kontext Knapp möglichPasst, wenig Puffer bei langem Kontext KomfortabelNur ~3 B aktive Parameter → schnelle Inferenz trotz 21 B Gesamtgröße Gut nutzbarMoE-Routing hält CPU-Inferenz erträglich schnell
ERNIE 4.5 VL 28B-A3B (Base/PT/Thinking) MoE Vision ~15–17 GB
(Schätzung, kein etabliertes Standard-GGUF)
Nicht möglich— Nicht möglichText- + Vision-Experten sprengen 12 GB Nicht möglichKaum Puffer für Vision-Encoder (mmproj) übrig Knapp möglichText- + Vision-Gewichte + mmproj passen mit wenig Reserve GrenzbereichLäuft, aber spürbar langsamer als reine Text-Variante
ERNIE 4.5 300B-A47B (Base/PT) MoE ~180 GB Nicht möglich— Nicht möglich— Nicht möglich— Nicht möglichBraucht Multi-GPU-Server (z. B. 4–8× A100/H100) oder aggressives Offloading Nicht möglichSprengt 16 GB RAM vollständig
ERNIE 4.5 VL 424B-A47B MoE Vision ~230+ GB
(Schätzung, kein GGUF verfügbar)
Nicht möglich— Nicht möglich— Nicht möglich— Nicht möglichNur Multi-GPU-Cluster (Datacenter-Klasse) Nicht möglich—

Fähigkeiten & Features

Modell Text Vision Thinking Tool Calling MoE Kontext Aktive Parameter
ERNIE 4.5 0.3B ✓ ✗ ✗ ✗ ✗ 131k 0,36 B (dense)
ERNIE 4.5 21B-A3B ✓ ✗ ✗ ✓ ✓ 131k ≈ 3 B
ERNIE 4.5 21B-A3B-Thinking ✓ ✗ ✓ ✓ ✓ 131k ≈ 3 B
ERNIE 4.5 VL 28B-A3B (Base/PT) ✓ ✓ ✗ ✓ ✓ 131k ≈ 3 B
ERNIE 4.5 VL 28B-A3B-Thinking ✓ ✓ ✓ ✓ ✓ 131k ≈ 3 B
ERNIE 4.5 300B-A47B ✓ ✗ ✗ ✓ ✓ 131k ≈ 47 B
ERNIE 4.5 VL 424B-A47B ✓ ✓ ✗ ✓ ✓ 131k ≈ 47 B
ERNIE 4.5 (Baidu): Im Juni 2025 hat Baidu die ERNIE-4.5-Familie erstmals unter Apache 2.0 vollständig als Open Weights veröffentlicht – zuvor waren ERNIE-Modelle nur über Baidus API (Wenxiaoyan/Yiyan) verfügbar. Die Familie umfasst 10 Varianten: von einem 0,3B Dense-Modell über 21B-A3B (MoE, ≈3B aktiv) bis zum Flaggschiff 300B-A47B (MoE, ≈47B aktiv), jeweils zusätzlich als multimodale VL-Varianten (28B-A3B bzw. 424B-A47B) mit Bild-/Video-Verständnis. In llama.cpp/gguf-py werden die reinen Text-Modelle als eigene Architekturen ernie4_5 (dense, 0.3B) bzw. ernie4_5-moe (21B-A3B, 300B-A47B) geführt.

Heterogene Multimodal-MoE: Kernidee der Architektur ist ein gemeinsames Backbone mit modality-isoliertem Routing: Text- und Vision-Token teilen sich Attention-Parameter, werden aber über getrennte Experten-Pools geleitet (bei den VL-Modellen z. B. je 64 Text- und 64 Vision-Experten). Dadurch bleiben die reinen Text-Varianten und die VL-Varianten eines Größensegments architektonisch eng verwandt (gleiche Layer-/Head-Konfiguration bei 21B-A3B vs. VL-28B-A3B), was Distillation und gemeinsames Training über Modalitäten hinweg erleichtert. Trainiert wurde mit PaddlePaddle inkl. FP8-Mixed-Precision, intra-node Expert-Parallelism und der "FlashMask"-Dynamic-Attention-Masking-Technik.

Thinking-Varianten: ERNIE-4.5-21B-A3B-Thinking (und die multimodale VL-28B-A3B-Thinking) wurden nach dem initialen Open-Source-Release im Herbst 2025 nachgereicht und fügen ein Reasoning-Post-Training für Chain-of-Thought bei Mathematik, Code und Logik-Aufgaben hinzu – Tool-Calling bleibt dabei auch im Thinking-Modus aktiv.

VL-Modelle & GGUF-Lücke: Für die reinen Text-MoE-Modelle (0.3B, 21B-A3B, 300B-A47B) existieren etablierte GGUF-Quantisierungen (u. a. von bartowski, unsloth, lmstudio-community). Für die multimodalen VL-Varianten fehlt bei gängigen Quantisierern bislang ein GGUF inkl. Vision-Encoder (mmproj) – die in der Tabelle angegebenen VRAM-Werte für VL-28B-A3B und VL-424B-A47B sind daher Schätzungen basierend auf der Parameterzahl, keine gemessenen Dateigrößen.

ERNIE 5.0: Im November 2025 kündigte Baidu ERNIE 5.0 als natively multimodales "Omni"-Modell an, das Text, Bild, Video und Audio in einer einzigen Architektur versteht und generiert. ERNIE 5.0 ist bislang nicht als Open-Weight-Modell verfügbar (nur über Wenxiaoyan-App/API), weshalb hier keine VRAM-Angaben möglich sind.

VRAM-Werte stammen aus GGUF-Quantisierungen von bartowski und unsloth (Basis: reale Dateigrößen, ohne KV-Cache; 300B-A47B aus unsloth/ERNIE-4.5-300B-A47B-PT-GGUF). Architekturdetails aus den offiziellen Hugging-Face-Modellkarten (baidu/ERNIE-4.5-21B-A3B-PT, baidu/ERNIE-4.5-300B-A47B-PT, baidu/ERNIE-4.5-VL-424B-A47B-PT) und dem ERNIE-4.5-Technical-Report (ernie.baidu.com/blog/posts/ernie4.5).