Contributors › kyuz0's local-LLM benchmark configs
kyuz0's local-LLM benchmark configs
Every tracked benchmark config measured by kyuz0: model, quant, backend, tokens per second, source-linked and trust-tiered.
Snapshot 2026-09-10 · 148 configs · 69 models. Every number is generated from the tracker snapshot and linked to where it was measured; nothing here is typed by hand.
40 configs · 5 models · 1915 stars · 74.6 tok/s best single-stream · kyuz0 on github.
Configs measured by kyuz0
| Model | Quant | Backend | Decode | Context | Trust | Source |
|---|---|---|---|---|---|---|
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/vulkan | 74.6 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/vulkan | 72.8 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/rocm | 68.3 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/rocm | 64.5 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/vulkan-radv | 62.8 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/vulkan-radv-performance | 62.2 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/vulkan | 58.7 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/rocm-7.14 | 53.5 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/rocm-7.14-pr26592 | 53 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/rocm-7.2.4 | 51.7 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q8_K_XL | llama.cpp/vulkan-radv | 49.2 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q8_K_XL | llama.cpp/vulkan-radv-performance | 48.9 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q4_K_XL | llama.cpp/rocm | 48.7 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q8_K_XL | llama.cpp/rocm-7.14 | 48.1 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q8_K_XL | llama.cpp/rocm-7.14-pr26592 | 47.9 tok/s | Structured table | source | |
| Qwen3.6-35B-A3B | UD-Q8_K_XL | llama.cpp/rocm-7.2.4 | 46.5 tok/s | Structured table | source | |
| gemma-4-26B-A4B-it | UD-Q8_K_XL | llama.cpp/rocm-7.2.4 | 41.8 tok/s | Structured table | source | |
| Qwen3.5-122B-A10B | UD-Q4_K_XL | llama.cpp/rocm-7.2.4 | 21.6 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ3_XXS | llama.cpp/vulkan-radv-performance | 19.8 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ2_XXS | llama.cpp/rocm-7.14 | 16.2 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ2_XXS | llama.cpp/rocm-7.2.4 | 16.1 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ3_XXS | llama.cpp/rocm-7.14 | 16 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ3_XXS | llama.cpp/rocm-7.2.4 | 15.8 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ2_XXS | llama.cpp/rocm-7.14-pr26592 | 14.8 tok/s | Structured table | source | |
| DeepSeek-V4-Flash-0731 | UD-IQ3_XXS | llama.cpp/rocm-7.14-pr26592 | 14.5 tok/s | Structured table | source |
More: all configs · hardware · methodology · llms.txt · llms-full.txt · API (OpenAPI) · JSON snapshot. Built by Altronis, private on-prem AI, Singapore.