Results

Filters1× NVIDIA GeForce RTX 5090 · 1024 → 256 · TTFT ≤ 1000 ms
Model Hugging Face IDHardware GPU and quantityWorkload tokens in → tokens outCapacity workload throughputResponsiveness p95 TTFTStream speed p95 floorConcurrency test load
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4NVFP4Speculative · NVFP41× NVIDIA GeForce RTX 50901024 → 25610.64 req/s517.1 ms72.8 tok/s16
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4NVFP41× NVIDIA GeForce RTX 50901024 → 2569.62 req/s531.8 ms155.2 tok/s16
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4NVFP4DFlash · NVFP41× NVIDIA GeForce RTX 50901024 → 2569.49 req/s523.7 ms59.3 tok/s16
nvidia/Gemma-4-26B-A4B-NVFP4NVFP41× NVIDIA GeForce RTX 50901024 → 2568.82 req/s786.1 ms77.1 tok/s32
nvidia/Gemma-4-26B-A4B-NVFP4NVFP4Speculative1× NVIDIA GeForce RTX 50901024 → 2568.05 req/s440.7 ms79.2 tok/s16
nvidia/Qwen3.6-35B-A3B-NVFP4NVFP41× NVIDIA GeForce RTX 50901024 → 2567.92 req/s968 ms65.4 tok/s32
gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090NVFP4DFlash2 · NVFP41× NVIDIA GeForce RTX 50901024 → 2566.17 req/s541.1 ms210.6 tok/s8
gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090NVFP4DFlash2 · BF161× NVIDIA GeForce RTX 50901024 → 2564.4 req/s225.2 ms285.5 tok/s4
google/gemma-4-12B-itFP8 per tensor1× NVIDIA GeForce RTX 50901024 → 2563.87 req/s931 ms65.6 tok/s16
RedHatAI/gemma-4-31B-it-NVFP4NVFP4Speculative1× NVIDIA GeForce RTX 50901024 → 2562.29 req/s232.3 ms48.9 tok/s8
gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090NVFP41× NVIDIA GeForce RTX 50901024 → 2562.22 req/s500.7 ms73.5 tok/s8
unsloth/Qwen3.8-27B-NVFP4NVFP41× NVIDIA GeForce RTX 50901024 → 2561.68 req/s702.4 ms58.4 tok/s8
meta-models/Muse-Glimmer-30B-GGUFQ4_K_MSpeculative · Q4_K_M1× NVIDIA GeForce RTX 50901024 → 2561.59 req/s284 ms725.2 tok/s1
meta-models/Muse-Glimmer-30B-GGUFQ4_K_XLSpeculative · Q4_K_M1× NVIDIA GeForce RTX 50901024 → 2561.47 req/s309.6 ms651.1 tok/s1
google/gemma-4-12B-itBF161× NVIDIA GeForce RTX 50901024 → 2561.41 req/s878.3 ms48.7 tok/s8
RedHatAI/gemma-4-31B-it-NVFP4NVFP41× NVIDIA GeForce RTX 50901024 → 2561.34 req/s561.6 ms43.3 tok/s8
meta-models/Muse-Glimmer-30B-GGUFkquant 17gb Q4 k m1× NVIDIA GeForce RTX 50901024 → 2560.3 req/s226.7 ms82.5 tok/s1
meta-models/Muse-Glimmer-30B-GGUFkquant dynamic Q4 k xl1× NVIDIA GeForce RTX 50901024 → 2560.27 req/s236.9 ms72 tok/s1
meta-models/Muse-Glimmer-30B-GGUFdynamic Q4 k xl1× NVIDIA GeForce RTX 50901024 → 2560.25 req/s501.9 ms71 tok/s1
malaiwah/Qwen3.8-27B-EXL3-K5K6-hydratedexl3 mixed k5 k6 hydrated1× NVIDIA GeForce RTX 50901024 → 2560.11 req/s473.8 ms29.7 tok/s1