Review bench

tok/s reviews

Decode speed from sessions that actually ran on the desk. Cards link out to the full Builds write-ups on llmlanes.com.

~70 tok/sGemma 4 12B · 5080 · 4/4 coding · ~10.4GB
~28 tok/sQwen 27B IQ4_XS · same 4 tasks · ~15.6GB
~43 / ~18 / ~7Same 27B · IQ4_XS vs library Q4 vs 46-layer spill
~60–90 wallFreeToken 35B-A3B MoE · engine ~130–150 decode
~12–15 → <15080 27B IQ4 when fit vs after VRAM spill
~55–70B70-class ballpark · tuned ~35B MoE Q4 ≤32GB

Write-ups (on LLM Lanes Builds)