- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 9 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8 | c=8 | 569.4 | 500.7 ms | 13.6 ms | — | 0 | run_Rhgr51rIpq9Jzp6l | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8 | c=8 | 567.5 | 500.7 ms | 13.6 ms | — | 0 | run_Z6WOxGffTnaDOo_i | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8 | c=8 | 567.6 | 501.4 ms | 13.6 ms | — | 0 | run_3yAiq2C-hBCAw8Xo | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8 | c=4 | 297.3 | 255.8 ms | 13.01 ms | — | 0 | run_6YNsQIR1e2J7DaLI | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8 | c=2 | 158.2 | 133.7 ms | 12.19 ms | — | 0 | run_wJicBVkg42sBm-Go | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8 | c=1 | 87.3 | 72.9 ms | 11.22 ms | — | 0 | run_SysUk70j-HqYOBbo | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1 | c=1 | 87.7 | 72.9 ms | 11.18 ms | — | 0 | run_Vud0kxXwRLFdF-bd | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1 | c=1 | 87.8 | 72.9 ms | 11.18 ms | — | 0 | run_DTV6eM8cWgnnQS9C | |
| sglang 0.0.0.dev1+g5f55db35e | dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1 | c=1 | 87.4 | 73 ms | 11.22 ms | — | 0 | run_j9dHG1N-lX_-hBZA |
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8- Test load
- c=8
- Req/s
- Output tok/s
- 569.4
- p95 TTFT / TPOT
- 500.7 ms / 13.6 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8- Test load
- c=8
- Req/s
- Output tok/s
- 567.5
- p95 TTFT / TPOT
- 500.7 ms / 13.6 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8- Test load
- c=8
- Req/s
- Output tok/s
- 567.6
- p95 TTFT / TPOT
- 501.4 ms / 13.6 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8- Test load
- c=4
- Req/s
- Output tok/s
- 297.3
- p95 TTFT / TPOT
- 255.8 ms / 13.01 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8- Test load
- c=2
- Req/s
- Output tok/s
- 158.2
- p95 TTFT / TPOT
- 133.7 ms / 12.19 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=8 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=8- Test load
- c=1
- Req/s
- Output tok/s
- 87.3
- p95 TTFT / TPOT
- 72.9 ms / 11.22 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1- Test load
- c=1
- Req/s
- Output tok/s
- 87.7
- p95 TTFT / TPOT
- 72.9 ms / 11.18 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1- Test load
- c=1
- Req/s
- Output tok/s
- 87.8
- p95 TTFT / TPOT
- 72.9 ms / 11.18 ms
- Runtime
- sglang 0.0.0.dev1+g5f55db35e
- Material parameters
dtype=bfloat16 context_length=9216 kv_cache_dtype=fp8_e4m3 attention_backend=flashinfer cuda_graph_max_bs=1 mem_fraction_static=0.9 chunked_prefill_size=1024 max_running_requests=1- Test load
- c=1
- Req/s
- Output tok/s
- 87.4
- p95 TTFT / TPOT
- 73 ms / 11.22 ms