local.ailocal.aiEarly access
HardwareModelsEnergyWallReferralsContact
HardwareModelsEnergyWallReferralsContactClaim your nameAccount

Search

Find people, models, hardware, or pages

Account
Model

Gemma 4 26B A4B

Intelligence rank
#74/238
54
Speed rank
#20/238
48s
Fastest hardware: NVIDIA GeForce RTX 5090 32GB.

Quick Start

Variations

Intelligence / Disk Size

Variations

Verified model-weight disk size. Higher intelligence and lower disk size are better.

best47515428.6GB22.0GB15.3GBDisk Size (lower →)Intelligence (higher →)4bit · 47% intelligence · 15.3GB disk size4bitawq-4bit · 53% intelligence · 17.2GB disk sizeawq-4bitawq-4bit · Draft Model · k=4 · 53% intelligence · 17.2GB disk sizeawq-4bit · Draft Model · k=4nvfp4 · 52% intelligence · 18.8GB disk sizenvfp4nvfp4 · Draft Model · k=4 · 52% intelligence · 18.8GB disk sizenvfp4 · Draft Model · k=4fp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic · 54% intelligence · 28.6GB disk sizefp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic
Intelligence Density

Intelligence ÷ Disk Size (GB).

  1. 3.11
    awq-4bit
  2. 3.11
    awq-4bit · Draft Model · k=4
  3. 3.09
    4bit
  4. 2.78
    nvfp4
  5. 2.77
    nvfp4 · Draft Model · k=4
  6. 1.87
    fp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic
Hardware

Cost / task speed

Hardware cost / task speed
6 of 6 variations

Model variations

·
4753
Any intelligence
best48s2m 10s5m 54s$15.5k$6.5k$2.7kHardware cost (lower →)Task time (faster →)nvfp4 · Draft Model · k=4 (52) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 3m 18sSparknvfp4 · Draft Model · k=4 (52) · NVIDIA GeForce RTX 4090 24GB · vllm · $3.4k · 1m 29sRTX 4090nvfp4 · Draft Model · k=4 (52) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 48sRTX 5090nvfp4 · Draft Model · k=4 (52) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1mRTX6k Adanvfp4 · Draft Model · k=4 (52) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 48sRTXPro6knvfp4 · Draft Model · k=4 (52)awq-4bit · Draft Model · k=4 (53) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 2m 46sSparkawq-4bit · Draft Model · k=4 (53) · NVIDIA GeForce RTX 4090 24GB · vllm · $3.4k · 1m 27sRTX 4090awq-4bit · Draft Model · k=4 (53) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 54sRTX 5090awq-4bit · Draft Model · k=4 (53) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1m 06sRTX6k Adaawq-4bit · Draft Model · k=4 (53) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 53sRTXPro6kawq-4bit · Draft Model · k=4 (53)awq-4bit (53) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 4m 25sSparkawq-4bit (53) · NVIDIA GeForce RTX 4090 24GB · vllm · $3.4k · 1m 25sRTX 4090awq-4bit (53) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 58sRTX 5090awq-4bit (53) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1m 16sRTX6k Adaawq-4bit (53) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 55sRTXPro6kawq-4bit (53)fp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic (54) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 4m 26sSparkfp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic (54) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1m 21sRTX6k Adafp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic (54) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 59sRTXPro6kfp8 · RedHatAI/gemma-4-26B-A4B-it-FP8-Dynamic (54)nvfp4 (52) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 5m 54sSparknvfp4 (52) · NVIDIA GeForce RTX 4090 24GB · vllm · $3.4k · 1m 27sRTX 4090nvfp4 (52) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 1m 07sRTX 5090nvfp4 (52) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1m 25sRTX6k Adanvfp4 (52) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 1m 11sRTXPro6knvfp4 (52)4bit (47) · Mac Studio M3 Ultra 96GB · 80-core GPU · vllm · $6.8k · 2m 43sM3 Ultra (80C)4bit (47) · Mac Studio M3 Ultra 96GB · 60-core GPU · vllm · $5.3k · 2m 50sM3 Ultra (60C)4bit (47) · MacBook Pro M4 Max 36GB · 32-core GPU · vllm · $3.2k · 3m 03sM4 Max (32C)4bit (47) · Mac mini M4 Pro 48GB · 20-core GPU · vllm · $2.7k · 4m 10sM4 Pro (20C)4bit (47) · MacBook Pro M5 Max 128GB · 40-core GPU · vllm · $6.7k · 2m 14sM5 Max (40C)4bit (47) · MacBook Pro M5 Pro 64GB · 20-core GPU · vllm · $3.7k · 3m 27sM5 Pro (20C)4bit (47)

Each coloured line is that variation’s cost / task-speed Pareto frontier. Global is the frontier across every qualifying variation; every point is still one original measured configuration.

Frontier →the ranked leaderboardAll models →every measured modelHardware →every measured device
local.aiIndependent local-AI benchmarks
AboutReferralsAccountContact
Live benchmark data