local.ailocal.aiEarly access
HardwareModelsEnergyWallReferralsContact
HardwareModelsEnergyWallReferralsContactClaim your nameAccount

Search

Find people, models, hardware, or pages

Account
Model

Qwen3.5 9B Base

Intelligence rank
#84/238
51
Speed rank
#11/238
34s
Fastest hardware: NVIDIA RTX PRO 6000 Blackwell 96GB.

Quick Start

Variations

Intelligence / Disk Size

Variations

Verified model-weight disk size. Higher intelligence and lower disk size are better.

best27395119.3GB12.5GB5.7GBDisk Size (lower →)Intelligence (higher →)Q4_K_M · unsloth/Qwen3.5-9B-GGUF · 51% intelligence · 5.7GB disk sizeQ4_K_M · unsloth/Qwen3.5-9B-GGUF4bit · mlx-community/Qwen3.5-9B-MLX-4bit · 41% intelligence · 6.0GB disk size4bit · mlx-community/Qwen3.5-9B-MLX-4bitawq-4bit · MTP · k=3 · 27% intelligence · 9.1GB disk sizeawq-4bit · MTP · k=3Default · MTP · k=1 · 30% intelligence · 19.3GB disk sizeDefault · MTP · k=1
Intelligence Density

Intelligence ÷ Disk Size (GB).

  1. 8.99
    Q4_K_M · unsloth/Qwen3.5-9B-GGUF
  2. 6.94
    4bit · mlx-community/Qwen3.5-9B-MLX-4bit
  3. 2.93
    awq-4bit · MTP · k=3
  4. 1.58
    Default · MTP · k=1
Hardware

Cost / task speed

Hardware cost / task speed
4 of 4 variations

Model variations

·
2651
Any intelligence
best34s2m 28s10m 43s$15.5k$6.5k$2.7kHardware cost (lower →)Task time (faster →)awq-4bit · MTP · k=3 (27) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 2m 52sSparkawq-4bit · MTP · k=3 (27) · NVIDIA GeForce RTX 4090 24GB · vllm · $3.4k · 55sRTX 4090awq-4bit · MTP · k=3 (27) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 39sRTX 5090awq-4bit · MTP · k=3 (27) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 51sRTX6k Adaawq-4bit · MTP · k=3 (27) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 34sRTXPro6kawq-4bit · MTP · k=3 (27)Default · MTP · k=1 (30) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 5m 47sSparkDefault · MTP · k=1 (30) · NVIDIA RTX 6000 Ada 48GB · vllm · $8.2k · 1m 44sRTX6k AdaDefault · MTP · k=1 (30) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $15.5k · 1m 05sRTXPro6kDefault · MTP · k=1 (30) · NVIDIA GeForce RTX 5090 32GB · vllm · $4.8k · 3m 29sRTX 5090Default · MTP · k=1 (30)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 6m 32sSparkQ4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 35sM3 Ultra (80C)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 3m 59sM3 Ultra (60C)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.2k · 6m 10sM4 Max (32C)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 9m 23sM4 Pro (20C)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 44sM5 Max (40C)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 46sM5 Pro (20C)Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · NVIDIA GeForce RTX 4090 24GB · llama_cpp · $3.4k · 1m 25sRTX 4090Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $4.8k · 1m 07sRTX 5090Q4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $8.2k · 1m 58sRTX6k AdaQ4_K_M · unsloth/Qwen3.5-9B-GGUF (51) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $15.5k · 1m 12sRTXPro6kQ4_K_M · unsloth/Qwen3.5-9B-GGUF (51)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41) · Mac Studio M3 Ultra 96GB · 80-core GPU · vllm · $6.8k · 4m 30sM3 Ultra (80C)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41) · Mac Studio M3 Ultra 96GB · 60-core GPU · vllm · $5.3k · 5m 04sM3 Ultra (60C)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41) · MacBook Pro M4 Max 36GB · 32-core GPU · vllm · $3.2k · 7m 13sM4 Max (32C)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41) · Mac mini M4 Pro 48GB · 20-core GPU · vllm · $2.7k · 10m 43sM4 Pro (20C)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41) · MacBook Pro M5 Max 128GB · 40-core GPU · vllm · $6.7k · 4m 29sM5 Max (40C)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41) · MacBook Pro M5 Pro 64GB · 20-core GPU · vllm · $3.7k · 7m 38sM5 Pro (20C)4bit · mlx-community/Qwen3.5-9B-MLX-4bit (41)

Each coloured line is that variation’s cost / task-speed Pareto frontier. Global is the frontier across every qualifying variation; every point is still one original measured configuration.

Frontier →the ranked leaderboardAll models →every measured modelHardware →every measured device
local.aiIndependent local-AI benchmarks
AboutReferralsAccountContact
Live benchmark data