Contributors › emihiggins's local-LLM benchmark configs
emihiggins's local-LLM benchmark configs
Every tracked benchmark config measured by emihiggins: model, quant, backend, tokens per second, source-linked and trust-tiered.
Snapshot 2026-09-30 · 254 configs · 116 models. Every number is generated from the tracker snapshot and linked to where it was measured; nothing here is typed by hand.
20 configs · 10 models · 527.7 tok/s best single-stream · emihiggins on github.
Configs measured by emihiggins
| Model | Quant | Backend | Decode | Context | Trust | Source |
|---|---|---|---|---|---|---|
| llama-3.2-1b | MLX-4BIT | mlx | 527.7 tok/s (prefill 17477) | 512 | Extracted, source-linked | source |
| llama-3.2-1b | Q4_K_M | llama.cpp | 439.6 tok/s (prefill 16968) | 512 | Extracted, source-linked | source |
| qwen3-4b | MLX-4BIT | mlx | 186 tok/s (prefill 5506) | 512 | Extracted, source-linked | source |
| qwen3-4b | Q4_K_M | llama.cpp | 159.7 tok/s (prefill 4973) | 512 | Extracted, source-linked | source |
| qwen3.6-35b-a3b | MLX-4BIT | mlx | 151.1 tok/s (prefill 3333) | 512 | Extracted, source-linked | source |
| qwen3-30b-a3b | Q4_K_M | llama.cpp | 148.5 tok/s (prefill 3497) | 512 | Extracted, source-linked | source |
| qwen3-30b-a3b | MLX-4BIT | mlx | 147.2 tok/s (prefill 3458) | 512 | Extracted, source-linked | source |
| qwen3.6-35b-a3b | Q4_K_M | llama.cpp | 124.3 tok/s (prefill 3343) | 512 | Extracted, source-linked | source |
| qwen3-8b | MLX-4BIT | mlx | 110.5 tok/s (prefill 3151) | 512 | Extracted, source-linked | source |
| qwen3-8b | Q4_K_M | llama.cpp | 97.7 tok/s (prefill 2745) | 512 | Extracted, source-linked | source |
| gemma-3-12b | MLX-4BIT | mlx | 66.9 tok/s (prefill 1835) | 512 | Extracted, source-linked | source |
| qwen3-14b | MLX-4BIT | mlx | 62.5 tok/s (prefill 1739) | 512 | Extracted, source-linked | source |
| gemma-3-12b | Q4_K_M | llama.cpp | 61.5 tok/s (prefill 1721) | 512 | Extracted, source-linked | source |
| qwen3-14b | Q4_K_M | llama.cpp | 57.4 tok/s (prefill 1584) | 512 | Extracted, source-linked | source |
| mistral-small-3.1-24b | MLX-4BIT | mlx | 41.1 tok/s (prefill 1051) | 512 | Extracted, source-linked | source |
| mistral-small-3.1-24b | Q4_K_M | llama.cpp | 37.2 tok/s (prefill 977) | 512 | Extracted, source-linked | source |
| gemma-3-27b | MLX-4BIT | mlx | 31.8 tok/s (prefill 854) | 512 | Extracted, source-linked | source |
| gemma-3-27b | Q4_K_M | llama.cpp | 29.9 tok/s (prefill 751) | 512 | Extracted, source-linked | source |
| qwen3-32b | MLX-4BIT | mlx | 28.4 tok/s (prefill 731) | 512 | Extracted, source-linked | source |
| qwen3-32b | Q4_K_M | llama.cpp | 26.4 tok/s (prefill 667) | 512 | Extracted, source-linked | source |
More: all configs · hardware · methodology · llms.txt · llms-full.txt · API (OpenAPI) · JSON snapshot. Built by Altronis, private on-prem AI, Singapore.