Hacker News
Run Qwen3.8 27B locally: real numbers from my Mac Studio
Qwen3.8-27B runs at ~14 tokens/s on a Mac Studio M3 Ultra using Ollama, generating 955-token answers in 67 seconds, while its predecessor Qwen3.6-27B achieves ~28.6 tokens/s with 2,058-token answers in 72 seconds. The 1-bit quant version (6.7 GB) reaches 27 tokens/s in llama.cpp but cannot produce a final answer. Running Q4_K_M on 32 GB RAM comfortably supports the 17 GB model; 16 GB RAM supports Q2.