Contributors › emihiggins's local-LLM benchmark configs

emihiggins's local-LLM benchmark configs

Every tracked benchmark config measured by emihiggins: model, quant, backend, tokens per second, source-linked and trust-tiered.

Snapshot 2026-09-30 · 254 configs · 116 models. Every number is generated from the tracker snapshot and linked to where it was measured; nothing here is typed by hand.

20 configs · 10 models · 527.7 tok/s best single-stream · emihiggins on github.

Configs measured by emihiggins

ModelQuantBackendDecodeContextTrustSource
llama-3.2-1bMLX-4BITmlx527.7 tok/s (prefill 17477)512Extracted, source-linkedsource
llama-3.2-1bQ4_K_Mllama.cpp439.6 tok/s (prefill 16968)512Extracted, source-linkedsource
qwen3-4bMLX-4BITmlx186 tok/s (prefill 5506)512Extracted, source-linkedsource
qwen3-4bQ4_K_Mllama.cpp159.7 tok/s (prefill 4973)512Extracted, source-linkedsource
qwen3.6-35b-a3bMLX-4BITmlx151.1 tok/s (prefill 3333)512Extracted, source-linkedsource
qwen3-30b-a3bQ4_K_Mllama.cpp148.5 tok/s (prefill 3497)512Extracted, source-linkedsource
qwen3-30b-a3bMLX-4BITmlx147.2 tok/s (prefill 3458)512Extracted, source-linkedsource
qwen3.6-35b-a3bQ4_K_Mllama.cpp124.3 tok/s (prefill 3343)512Extracted, source-linkedsource
qwen3-8bMLX-4BITmlx110.5 tok/s (prefill 3151)512Extracted, source-linkedsource
qwen3-8bQ4_K_Mllama.cpp97.7 tok/s (prefill 2745)512Extracted, source-linkedsource
gemma-3-12bMLX-4BITmlx66.9 tok/s (prefill 1835)512Extracted, source-linkedsource
qwen3-14bMLX-4BITmlx62.5 tok/s (prefill 1739)512Extracted, source-linkedsource
gemma-3-12bQ4_K_Mllama.cpp61.5 tok/s (prefill 1721)512Extracted, source-linkedsource
qwen3-14bQ4_K_Mllama.cpp57.4 tok/s (prefill 1584)512Extracted, source-linkedsource
mistral-small-3.1-24bMLX-4BITmlx41.1 tok/s (prefill 1051)512Extracted, source-linkedsource
mistral-small-3.1-24bQ4_K_Mllama.cpp37.2 tok/s (prefill 977)512Extracted, source-linkedsource
gemma-3-27bMLX-4BITmlx31.8 tok/s (prefill 854)512Extracted, source-linkedsource
gemma-3-27bQ4_K_Mllama.cpp29.9 tok/s (prefill 751)512Extracted, source-linkedsource
qwen3-32bMLX-4BITmlx28.4 tok/s (prefill 731)512Extracted, source-linkedsource
qwen3-32bQ4_K_Mllama.cpp26.4 tok/s (prefill 667)512Extracted, source-linkedsource

More: all configs · hardware · methodology · llms.txt · llms-full.txt · API (OpenAPI) · JSON snapshot. Built by Altronis, private on-prem AI, Singapore.