local.ailocal.aiEarly access
HardwareModelsEnergyWallReferralsContact
HardwareModelsEnergyWallReferralsContactClaim your nameAccount

Search

Find people, models, hardware, or pages

Account
Model

Gemma 4 31B It

Intelligence rank
#58/238
60
Speed rank
#21/238
51s
Fastest hardware: NVIDIA GeForce RTX 5090 32GB.

Quick Start

Variations

Intelligence / Disk Size

Variations

Verified model-weight disk size. Higher intelligence and lower disk size are better.

best54576062.5GB40.4GB18.3GBDisk Size (lower →)Intelligence (higher →)Q4_K_M · unsloth/gemma-4-31B-it-GGUF · 60% intelligence · 18.3GB disk sizeQ4_K_M · unsloth/gemma-4-31B-it-GGUF4bit · Draft Model · k=4 · 55% intelligence · 18.4GB disk size4bit · Draft Model · k=4awq-4bit · Draft Model · k=4 · 54% intelligence · 20.9GB disk sizeawq-4bit · Draft Model · k=4awq-4bit · 54% intelligence · 20.9GB disk sizeawq-4bitfp8 · 57% intelligence · 33.3GB disk sizefp8Default · Draft Model · k=4 · 57% intelligence · 62.5GB disk sizeDefault · Draft Model · k=4Default · google/gemma-4-31B-it · 57% intelligence · 62.5GB disk sizeDefault · google/gemma-4-31B-it
Intelligence Density

Intelligence ÷ Disk Size (GB).

  1. 3.25
    Q4_K_M · unsloth/gemma-4-31B-it-GGUF
  2. 2.99
    4bit · Draft Model · k=4
  3. 2.60
    awq-4bit · Draft Model · k=4
  4. 2.60
    awq-4bit
  5. 1.71
    fp8
  6. 0.91
    Default · Draft Model · k=4
  7. 0.91
    Default · google/gemma-4-31B-it
Hardware

Cost / task speed

Hardware cost / task speed
7 of 7 variations

Model variations

·
5459
Any intelligence
best51s4m 49s27m 13s$15.5k$6.5k$2.7kHardware cost (lower →)Task time (faster →)awq-4bit · Draft Model · k=4 (54) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 4m 18sSparkawq-4bit · Draft Model · k=4 (54) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 51sRTX 5090awq-4bit · Draft Model · k=4 (54) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1m 17sRTX6k Adaawq-4bit · Draft Model · k=4 (54) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 52sRTXPro6kawq-4bit · Draft Model · k=4 (54)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 10m 09sSparkQ4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 4m 33sM3 Ultra (80C)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 48sM3 Ultra (60C)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.2k · 7m 35sM4 Max (32C)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 4m 32sM5 Max (40C)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 8m 47sM5 Pro (20C)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $8.2k · 2m 39sRTX6k AdaQ4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $15.5k · 1m 36sRTXPro6kQ4_K_M · unsloth/gemma-4-31B-it-GGUF (60) · Mac mini M4 Pro 48GB · 20-core GPU · llamacpp · $2.7k · 11m 23sM4 Pro (20C)Q4_K_M · unsloth/gemma-4-31B-it-GGUF (60)awq-4bit (54) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 11m 11sSparkawq-4bit (54) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 1m 46sRTX 5090awq-4bit (54) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 2m 45sRTX6k Adaawq-4bit (54) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 1m 48sRTXPro6kawq-4bit (54)Default · Draft Model · k=4 (57) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 9m 15sSparkDefault · Draft Model · k=4 (57) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 1m 53sRTXPro6kDefault · Draft Model · k=4 (57)fp8 (57) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 15m 24sSparkfp8 (57) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 5m 59sRTX6k Adafp8 (57) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 2m 55sRTXPro6kfp8 (57)4bit · Draft Model · k=4 (55) · Mac Studio M3 Ultra 96GB · 80-core GPU · vllm · $6.8k · 5m 04sM3 Ultra (80C)4bit · Draft Model · k=4 (55) · Mac Studio M3 Ultra 96GB · 60-core GPU · vllm · $5.3k · 5m 16sM3 Ultra (60C)4bit · Draft Model · k=4 (55) · Mac mini M4 Pro 48GB · 20-core GPU · vllm · $2.7k · 12m 12sM4 Pro (20C)4bit · Draft Model · k=4 (55) · MacBook Pro M5 Max 128GB · 40-core GPU · vllm · $6.7k · 5m 19sM5 Max (40C)4bit · Draft Model · k=4 (55) · MacBook Pro M5 Pro 64GB · 20-core GPU · vllm · $3.7k · 9m 47sM5 Pro (20C)4bit · Draft Model · k=4 (55)Default · google/gemma-4-31B-it (57) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 27m 13sSparkDefault · google/gemma-4-31B-it (57)

Each coloured line is that variation’s cost / task-speed Pareto frontier. Global is the frontier across every qualifying variation; every point is still one original measured configuration.

Frontier →the ranked leaderboardAll models →every measured modelHardware →every measured device
local.aiIndependent local-AI benchmarks
AboutReferralsAccountContact
Live benchmark data