local.ailocal.aiEarly access
HardwareModelsEnergyWallReferralsContact
HardwareModelsEnergyWallReferralsContactClaim your nameAccount

Search

Jump to a page, hardware, or model

Account
Model

Gemma 4 E4B It

Intelligence rank
#96/216
28
Speed rank
#6/216
14s
Fastest hardware: NVIDIA GeForce RTX 5090 32GB.

Quick Start

Variations

Intelligence / Disk Size

Variations

Verified model-weight disk size. Higher intelligence and lower disk size are better.

best24262813.3GB9.1GB5.0GBDisk Size (lower →)Intelligence (higher →)Q4_K_M · 28% intelligence · 5.0GB disk sizeQ4_K_Mfp8 · prithivMLmods/gemma-4-E4B-it-FP8 · 26% intelligence · 13.3GB disk sizefp8 · prithivMLmods/gemma-4-E4B-it-FP8fp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic · 24% intelligence · 13.3GB disk sizefp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic
Intelligence Density

Intelligence ÷ Disk Size (GB).

  1. 5.70
    Q4_K_M
  2. 1.94
    fp8 · prithivMLmods/gemma-4-E4B-it-FP8
  3. 1.83
    fp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic
Hardware

Cost / task speed

Hardware cost / task speed
3 of 3 variations

Model variations

·
2428
Any intelligence
best14s36s1m 33s$13.0k$5.9k$2.7kHardware cost (lower →)Task time (faster →)Q4_K_M (28) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 58sSparkQ4_K_M (28) · NVIDIA GeForce RTX 4090 24GB · llama_cpp · $3.5k · 21sRTX 4090Q4_K_M (28) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 14sRTX 5090Q4_K_M (28) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 20sRTX6k AdaQ4_K_M (28) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 43sM3 Ultra (60C)Q4_K_M (28) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 44sM4 Max (40C)Q4_K_M (28) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 53sM4 Max (32C)Q4_K_M (28) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 1m 16sM4 Pro (20C)Q4_K_M (28) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 42sM3 Ultra (80C)Q4_K_M (28) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 34sM5 Max (40C)Q4_K_M (28) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 56sM5 Pro (20C)Q4_K_M (28) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 15sRTXPro6kQ4_K_M (28)fp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic (24) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 1m 32sSparkfp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic (24) · NVIDIA GeForce RTX 5090 32GB · vllm · $3.7k · 18sRTX 5090fp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic (24) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 31sRTX6k Adafp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic (24) · NVIDIA GeForce RTX 4090 24GB · vllm · $3.5k · 30sRTX 4090fp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic (24) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $13.0k · 18sRTXPro6kfp8 · leon-se/gemma-4-E4B-it-FP8-Dynamic (24)fp8 · prithivMLmods/gemma-4-E4B-it-FP8 (26) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 1m 33sSparkfp8 · prithivMLmods/gemma-4-E4B-it-FP8 (26) · NVIDIA GeForce RTX 5090 32GB · vllm · $3.7k · 32sRTX 5090fp8 · prithivMLmods/gemma-4-E4B-it-FP8 (26) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 32sRTX6k Adafp8 · prithivMLmods/gemma-4-E4B-it-FP8 (26) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $13.0k · 19sRTXPro6kfp8 · prithivMLmods/gemma-4-E4B-it-FP8 (26)

Each coloured line is that variation’s cost / task-speed Pareto frontier. Global is the frontier across every qualifying variation; every point is still one original measured configuration.

Frontier →the ranked leaderboardAll models →every measured modelHardware →every measured device
local.aiIndependent local-AI benchmarks
AboutReferralsAccountContact
Live benchmark data