local.ailocal.aiEarly access
HardwareModelsEnergyWallReferralsContact
HardwareModelsEnergyWallReferralsContactClaim your nameAccount

Search

Jump to a page, hardware, or model

Account
Model

Qwen3.6 35B A3B

Intelligence rank
#17/216
75
Speed rank
#18/216
59s
Fastest hardware: NVIDIA GeForce RTX 5090 32GB.

Quick Start

Variations

Intelligence / Disk Size

Variations

Verified model-weight disk size. Higher intelligence and lower disk size are better.

best58677571.9GB41.0GB10.0GBDisk Size (lower →)Intelligence (higher →)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF · 68% intelligence · 10.0GB disk sizeiq1m · unsloth/Qwen3.6-35B-A3B-GGUFiq2xxs · 66% intelligence · 10.8GB disk sizeiq2xxsUD-IQ2_M · 70% intelligence · 11.5GB disk sizeUD-IQ2_MUD-Q2_K_XL · 72% intelligence · 12.3GB disk sizeUD-Q2_K_XLiq3xxs · 71% intelligence · 13.2GB disk sizeiq3xxsUD-IQ3_S · 71% intelligence · 13.7GB disk sizeUD-IQ3_SUD-Q3_K_S · 74% intelligence · 15.4GB disk sizeUD-Q3_K_Sq3km · 74% intelligence · 16.6GB disk sizeq3kmUD-Q3_K_XL · 74% intelligence · 16.8GB disk sizeUD-Q3_K_XLiq4xs · 72% intelligence · 17.7GB disk sizeiq4xsUD-Q4_K_S · 75% intelligence · 20.9GB disk sizeUD-Q4_K_SMXFP4_MOE · 73% intelligence · 21.7GB disk sizeMXFP4_MOEUD-Q4_K_M · 74% intelligence · 22.1GB disk sizeUD-Q4_K_Mq4kxl · 73% intelligence · 22.4GB disk sizeq4kxlnvfp4 · MTP · k=3 · nvidia/Qwen3.6-35B-A3B-NVFP4 · 74% intelligence · 23.4GB disk sizenvfp4 · MTP · k=3 · nvidia/Qwen3.6-35B-A3B-NVFP4nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast · 74% intelligence · 23.6GB disk sizenvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fastnvfp4 · MTP · k=2 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast · 58% intelligence · 23.6GB disk sizenvfp4 · MTP · k=2 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fastawq-4bit · Qwen3 Next Mtp · k=4 · 74% intelligence · 25.0GB disk sizeawq-4bit · Qwen3 Next Mtp · k=4nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4 · 75% intelligence · 26.5GB disk sizenvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4nvfp4 · MTP · k=3 · unsloth/Qwen3.6-35B-A3B-NVFP4 · 60% intelligence · 26.5GB disk sizenvfp4 · MTP · k=3 · unsloth/Qwen3.6-35B-A3B-NVFP4Default · MTP · k=1 · 75% intelligence · 71.9GB disk sizeDefault · MTP · k=1Default · Qwen/Qwen3.6-35B-A3B · 75% intelligence · 71.9GB disk sizeDefault · Qwen/Qwen3.6-35B-A3B
Intelligence Density

Intelligence ÷ Disk Size (GB).

  1. 6.75
    iq1m · unsloth/Qwen3.6-35B-A3B-GGUF
  2. 6.15
    iq2xxs
  3. 6.04
    UD-IQ2_M
  4. 5.87
    UD-Q2_K_XL
  5. 5.40
    iq3xxs
  6. 5.23
    UD-IQ3_S
  7. 4.82
    UD-Q3_K_S
  8. 4.45
    q3km
  9. 4.40
    UD-Q3_K_XL
  10. 4.08
    iq4xs
  11. 3.58
    UD-Q4_K_S
  12. 3.36
    UD-Q4_K_M
  13. 3.36
    MXFP4_MOE
  14. 3.27
    q4kxl
  15. 3.17
    nvfp4 · MTP · k=3 · nvidia/Qwen3.6-35B-A3B-NVFP4
  16. 3.13
    nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast
  17. 2.95
    awq-4bit · Qwen3 Next Mtp · k=4
  18. 2.83
    nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4
  19. 2.47
    nvfp4 · MTP · k=2 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast
  20. 2.25
    nvfp4 · MTP · k=3 · unsloth/Qwen3.6-35B-A3B-NVFP4
  21. 1.04
    Default · MTP · k=1
  22. 1.04
    Default · Qwen/Qwen3.6-35B-A3B
Hardware

Cost / task speed

Hardware cost / task speed
22 of 22 variations

Model variations

·
5874
Any intelligence
best59s2m 55s8m 40s$13.0k$5.9k$2.7kHardware cost (lower →)Task time (faster →)UD-Q3_K_S (74) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 41sRTX6k AdaUD-Q3_K_S (74) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 09sRTXPro6kUD-Q3_K_S (74) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 26sM5 Max (40C)UD-Q3_K_S (74) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 41sSparkUD-Q3_K_S (74) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 32sM3 Ultra (80C)UD-Q3_K_S (74) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 01sM3 Ultra (60C)UD-Q3_K_S (74) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 4m 54sM4 Max (32C)UD-Q3_K_S (74) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 7m 09sM4 Pro (20C)UD-Q3_K_S (74) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 40sM5 Pro (20C)UD-Q3_K_S (74) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4m 19sM4 Max (40C)UD-Q3_K_S (74) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 59sRTX 5090UD-Q3_K_S (74)UD-Q4_K_M (74) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 28sSparkUD-Q4_K_M (74) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 27sM3 Ultra (80C)UD-Q4_K_M (74) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 3m 45sM3 Ultra (60C)UD-Q4_K_M (74) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 6m 57sM4 Pro (20C)UD-Q4_K_M (74) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 31sM5 Pro (20C)UD-Q4_K_M (74) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4m 21sM4 Max (40C)UD-Q4_K_M (74) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 18sM5 Max (40C)UD-Q4_K_M (74) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 35sRTX6k AdaUD-Q4_K_M (74) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 03sRTXPro6kUD-Q4_K_M (74)UD-Q3_K_XL (74) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 03sRTXPro6kUD-Q3_K_XL (74) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 16sM5 Max (40C)UD-Q3_K_XL (74) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 21sSparkUD-Q3_K_XL (74) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 13sM3 Ultra (80C)UD-Q3_K_XL (74) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 3m 42sM3 Ultra (60C)UD-Q3_K_XL (74) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 6m 45sM4 Pro (20C)UD-Q3_K_XL (74) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 21sM5 Pro (20C)UD-Q3_K_XL (74) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 31sRTX6k AdaUD-Q3_K_XL (74) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 3m 59sM4 Max (40C)UD-Q3_K_XL (74) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 4m 30sM4 Max (32C)UD-Q3_K_XL (74)q3km (74) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 33sRTX6k Adaq3km (74) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 03sRTXPro6kq3km (74) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 16sM5 Max (40C)q3km (74) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 08sSparkq3km (74) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 15sM3 Ultra (80C)q3km (74) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 3m 45sM3 Ultra (60C)q3km (74) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 4m 31sM4 Max (32C)q3km (74) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 6m 40sM4 Pro (20C)q3km (74) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 23sM5 Pro (20C)q3km (74) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4mM4 Max (40C)q3km (74)UD-Q4_K_S (75) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 38sRTX6k AdaUD-Q4_K_S (75) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 05sRTXPro6kUD-Q4_K_S (75) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 13sM5 Max (40C)UD-Q4_K_S (75) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 26sSparkUD-Q4_K_S (75) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 17sM3 Ultra (80C)UD-Q4_K_S (75) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 3m 44sM3 Ultra (60C)UD-Q4_K_S (75) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 6m 59sM4 Pro (20C)UD-Q4_K_S (75) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 19sM5 Pro (20C)UD-Q4_K_S (75)nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4 (75) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 4m 13sSparknvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4 (75) · NVIDIA GeForce RTX 5090 32GB · vllm · $3.7k · 1m 07sRTX 5090nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4 (75) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 1m 30sRTX6k Adanvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4 (75) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $13.0k · 1m 05sRTXPro6knvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4 (75)nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (74) · NVIDIA GeForce RTX 5090 32GB · vllm · $3.7k · 1m 06sRTX 5090nvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (74) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 1m 33sRTX6k Adanvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (74) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 4m 08sSparknvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (74) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $13.0k · 1m 09sRTXPro6knvfp4 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (74)nvfp4 · MTP · k=2 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (58) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 2m 55sSparknvfp4 · MTP · k=2 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (58) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 1m 09sRTX6k Adanvfp4 · MTP · k=2 · unsloth/Qwen3.6-35B-A3B-NVFP4-Fast (58)UD-IQ2_M (70) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 50sRTX6k AdaUD-IQ2_M (70) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 20sRTXPro6kUD-IQ2_M (70) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 43sM5 Max (40C)UD-IQ2_M (70) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 50sSparkUD-IQ2_M (70) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 50sM3 Ultra (80C)UD-IQ2_M (70) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 33sM3 Ultra (60C)UD-IQ2_M (70) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 34sM4 Max (32C)UD-IQ2_M (70) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 7m 56sM4 Pro (20C)UD-IQ2_M (70) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 03sM5 Pro (20C)UD-IQ2_M (70) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 1m 10sRTX 5090UD-IQ2_M (70) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4m 45sM4 Max (40C)UD-IQ2_M (70)iq2xxs (66) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 36sSparkiq2xxs (66) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 58sM3 Ultra (80C)iq2xxs (66) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 30sM3 Ultra (60C)iq2xxs (66) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 35sM4 Max (32C)iq2xxs (66) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 8m 15sM4 Pro (20C)iq2xxs (66) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 38sM5 Max (40C)iq2xxs (66) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 45sRTX6k Adaiq2xxs (66) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 1m 11sRTX 5090iq2xxs (66) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 58sM5 Pro (20C)iq2xxs (66) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4m 59sM4 Max (40C)iq2xxs (66) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 20sRTXPro6kiq2xxs (66)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 47sRTX6k Adaiq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 22sRTXPro6kiq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 48sM5 Max (40C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 45sSparkiq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 52sM3 Ultra (80C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 38sM3 Ultra (60C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 41sM4 Max (32C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 8m 17sM4 Pro (20C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 11sM5 Pro (20C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 1m 11sRTX 5090iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4m 52sM4 Max (40C)iq1m · unsloth/Qwen3.6-35B-A3B-GGUF (68)UD-IQ3_S (71) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 23sRTXPro6kUD-IQ3_S (71) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 42sM5 Max (40C)UD-IQ3_S (71) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 5m 02sSparkUD-IQ3_S (71) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 44sM3 Ultra (80C)UD-IQ3_S (71) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 20sM3 Ultra (60C)UD-IQ3_S (71) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 4m 51sM4 Max (40C)UD-IQ3_S (71) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 21sM4 Max (32C)UD-IQ3_S (71) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 7m 55sM4 Pro (20C)UD-IQ3_S (71) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 06sM5 Pro (20C)UD-IQ3_S (71) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 1m 11sRTX 5090UD-IQ3_S (71) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 48sRTX6k AdaUD-IQ3_S (71)nvfp4 · MTP · k=3 · unsloth/Qwen3.6-35B-A3B-NVFP4 (60) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 3m 06sSparknvfp4 · MTP · k=3 · unsloth/Qwen3.6-35B-A3B-NVFP4 (60) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 1m 12sRTX6k Adanvfp4 · MTP · k=3 · unsloth/Qwen3.6-35B-A3B-NVFP4 (60)UD-Q2_K_XL (72) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 47sRTX6k AdaUD-Q2_K_XL (72) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 17sRTXPro6kUD-Q2_K_XL (72) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 54sM5 Max (40C)UD-Q2_K_XL (72) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 49sSparkUD-Q2_K_XL (72) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 4m 01sM3 Ultra (80C)UD-Q2_K_XL (72) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 45sM3 Ultra (60C)UD-Q2_K_XL (72) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 5m 06sM4 Max (40C)UD-Q2_K_XL (72) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 50sM4 Max (32C)UD-Q2_K_XL (72) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 8m 36sM4 Pro (20C)UD-Q2_K_XL (72) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 25sM5 Pro (20C)UD-Q2_K_XL (72) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 1m 12sRTX 5090UD-Q2_K_XL (72)MXFP4_MOE (73) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 34sM5 Max (40C)MXFP4_MOE (73) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 48sRTX6k AdaMXFP4_MOE (73) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 14sRTXPro6kMXFP4_MOE (73) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 29sSparkMXFP4_MOE (73) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 32sM3 Ultra (80C)MXFP4_MOE (73) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4mM3 Ultra (60C)MXFP4_MOE (73) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 7m 13sM4 Pro (20C)MXFP4_MOE (73) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 03sM5 Pro (20C)MXFP4_MOE (73)iq3xxs (71) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 5m 39sSparkiq3xxs (71) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 4m 24sM3 Ultra (80C)iq3xxs (71) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 59sM4 Max (32C)iq3xxs (71) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 55sM3 Ultra (60C)iq3xxs (71) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 8m 40sM4 Pro (20C)iq3xxs (71) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 5m 18sM5 Max (40C)iq3xxs (71) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 2m 05sRTX6k Adaiq3xxs (71) · NVIDIA GeForce RTX 5090 32GB · llama_cpp · $3.7k · 1m 17sRTX 5090iq3xxs (71) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 49sM5 Pro (20C)iq3xxs (71)iq4xs (72) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 4m 02sM3 Ultra (80C)iq4xs (72) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 5m 17sSparkiq4xs (72) · MacBook Pro M4 Max 36GB · 32-core GPU · llama_cpp · $3.0k · 5m 14sM4 Max (32C)iq4xs (72) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 4m 27sM3 Ultra (60C)iq4xs (72) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 8m 18sM4 Pro (20C)iq4xs (72) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 54sM5 Max (40C)iq4xs (72) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 55sRTX6k Adaiq4xs (72) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 6m 31sM5 Pro (20C)iq4xs (72) · MacBook Pro M4 Max 128GB · 40-core GPU · llama_cpp · $5.2k · 5m 09sM4 Max (40C)iq4xs (72) · NVIDIA RTX PRO 6000 Blackwell 96GB · llama_cpp · $13.0k · 1m 20sRTXPro6kiq4xs (72)Default · Qwen/Qwen3.6-35B-A3B (75) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 8m 11sSparkDefault · Qwen/Qwen3.6-35B-A3B (75) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $13.0k · 1m 27sRTXPro6kDefault · Qwen/Qwen3.6-35B-A3B (75)Default · MTP · k=1 (75) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 6m 33sSparkDefault · MTP · k=1 (75) · NVIDIA RTX PRO 6000 Blackwell 96GB · vllm · $13.0k · 1m 37sRTXPro6kDefault · MTP · k=1 (75)q4kxl (73) · MacBook Pro M5 Pro 64GB · 20-core GPU · llama_cpp · $3.7k · 5m 18sM5 Pro (20C)q4kxl (73) · NVIDIA RTX 6000 Ada 48GB · llama_cpp · $9.0k · 1m 40sRTX6k Adaq4kxl (73) · MacBook Pro M5 Max 128GB · 40-core GPU · llama_cpp · $6.7k · 3m 13sM5 Max (40C)q4kxl (73) · NVIDIA DGX Spark 128GB · llama_cpp · $4.7k · 4m 25sSparkq4kxl (73) · Mac Studio M3 Ultra 96GB · 80-core GPU · llama_cpp · $6.8k · 3m 12sM3 Ultra (80C)q4kxl (73) · Mac Studio M3 Ultra 96GB · 60-core GPU · llama_cpp · $5.3k · 3m 38sM3 Ultra (60C)q4kxl (73) · Mac mini M4 Pro 48GB · 20-core GPU · llama_cpp · $2.7k · 6m 42sM4 Pro (20C)q4kxl (73)awq-4bit · Qwen3 Next Mtp · k=4 (74) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 4m 36sSparkawq-4bit · Qwen3 Next Mtp · k=4 (74) · NVIDIA RTX 6000 Ada 48GB · vllm · $9.0k · 1m 45sRTX6k Adaawq-4bit · Qwen3 Next Mtp · k=4 (74)nvfp4 · MTP · k=3 · nvidia/Qwen3.6-35B-A3B-NVFP4 (74) · NVIDIA DGX Spark 128GB · vllm · $4.7k · 2m 38sSparknvfp4 · MTP · k=3 · nvidia/Qwen3.6-35B-A3B-NVFP4 (74)

Each coloured line is that variation’s cost / task-speed Pareto frontier. Global is the frontier across every qualifying variation; every point is still one original measured configuration.

Frontier →the ranked leaderboardAll models →every measured modelHardware →every measured device
local.aiIndependent local-AI benchmarks
AboutReferralsAccountContact
Live benchmark data