- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 1,838.5 | 176.1 ms | 11.59 ms | 3,043.9 ms | 0 | run_KPlG6ospa82y9K0I | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 1,221.5 | 96.3 ms | 8.76 ms | 2,294.6 ms | 0 | run_G_VhMGaPBYxOstc_ | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 504.6 | 48.2 ms | 5.53 ms | 1,455.1 ms | 0 | run_KUwRa7hzWEZqwMkg | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,429.3 | 523.7 ms | 16.87 ms | 4,416.4 ms | 0 | run_dhCcdGR7Ab_02vHG | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,381.9 | 522.7 ms | 16.46 ms | 4,338.2 ms | 0 | run_sooclCxdf5Rwfmlt | |
vllm 0.28.0DFlash · NVFP4 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 2,366.9 | 529.3 ms | 17.09 ms | 4,439.8 ms | 0 | run_rtUGFh2HoRtyVSzF |
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 1,838.5
- p95 TTFT / TPOT
- 176.1 ms / 11.59 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 1,221.5
- p95 TTFT / TPOT
- 96.3 ms / 8.76 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 504.6
- p95 TTFT / TPOT
- 48.2 ms / 5.53 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,429.3
- p95 TTFT / TPOT
- 523.7 ms / 16.87 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,381.9
- p95 TTFT / TPOT
- 522.7 ms / 16.46 ms
- Runtime
- vllm 0.28.0DFlash · NVFP4 draft
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 2,366.9
- p95 TTFT / TPOT
- 529.3 ms / 17.09 ms