- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 29 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=8 | 964.9 | 205.1 ms | 8.14 ms | 2,148.7 ms | 0 | run_0HUfv_uWk5lwg0Sf | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=4 | 521.8 | 111.3 ms | 7.6 ms | 2,000.4 ms | 0 | run_ftYKQ0ifof0ywoQK | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=1 | 181.3 | 37.1 ms | 5.4 ms | 1,413.7 ms | 0 | run_NOfq_eOE4LS2eviE | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 1,547.3 | 407.4 ms | 10.1 ms | 2,719.1 ms | 0 | run_wTG22EngDCsTeJnL | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 1,504.1 | 416.2 ms | 10.35 ms | 2,805.6 ms | 0 | run_ckJR2ADVhxPmDuSb | |
| vllm 0.28.0 | dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384 | c=16 | 1,534.1 | 402 ms | 10.29 ms | 2,765.8 ms | 0 | run_a1sHSnxByBc5ptLf | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,866.1 | 1,064.4 ms | 16.68 ms | 4,487.2 ms | 0 | run_rT8CVflR0Kd8APoq | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,973.6 | 1,033.5 ms | 15.38 ms | 4,240.9 ms | 0 | run_Uvao52W66Efh1ZHX | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,980.1 | 996.1 ms | 14.67 ms | 4,266.8 ms | 0 | run_2jvsd98TgETbZEsH | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,974.1 | 1,034.2 ms | 15.38 ms | 4,241.9 ms | 0 | run_V83TA8wr3_OaEaX9 | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,931.1 | 1,826.8 ms | 14.69 ms | 4,892.4 ms | 0 | run_qsvZrwESjm5uzv3C | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,450.7 | 1,960.4 ms | 19.57 ms | 6,421.9 ms | 0 | run_SoAp9OP_2rmsyrwT | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=8 | 820.4 | 271.7 ms | 9.62 ms | 2,566.5 ms | 0 | run_b2vivTgE3a5FuG1M | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=64 | 2,691 | 2,054.9 ms | 22.14 ms | 6,501 ms | 0 | run_Z8f07104ef2SG7dS | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=64 | 2,695.4 | 1,939.5 ms | 22.86 ms | 6,600.1 ms | 0 | run_7Em55k5Y9sAXC3z9 | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=4 | 454.5 | 148.4 ms | 8.64 ms | 2,298.1 ms | 0 | run_a2Z0OVHnBcxgGkdK | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 2,020.3 | 1,056.6 ms | 15.35 ms | 4,108.2 ms | 0 | run_QKC9Ar5WoFHGl0tW | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,977.3 | 1,032.7 ms | 15.45 ms | 4,205.6 ms | 0 | run_YtkxDSzawuJmnnyo | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=32 | 1,978 | 925 ms | 15.73 ms | 4,226.7 ms | 0 | run_Yz14XIGl1C_Mhdtb | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=1 | 149.8 | 43.6 ms | 6.54 ms | 1,710.5 ms | 0 | run_XZjhEjD_Jrh4MfBc | |
| vllm 0.23.0+cu129 | dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384 | c=16 | 1,324.8 | 546.2 ms | 11.85 ms | 3,156.4 ms | 0 | run_jLFwtr_PCHrbfGrp | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=64 | 3,120 | 1,527.5 ms | 19.96 ms | 5,446.9 ms | 0 | run_kNWGNT6KdEkKGM0R | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=16 | 1,544.8 | 411.4 ms | 9.89 ms | 2,653.1 ms | 0 | run_78yDkL5Nwiksfkny | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=4 | 540.9 | 115.6 ms | 7.32 ms | 1,934.6 ms | 0 | run_qq_m6ocYRPHq-MwX | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=2 | 304.5 | 70.4 ms | 6.49 ms | 1,701.1 ms | 0 | run_FfmlMvD9VPPI2Crh | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=128 | 3,163.1 | 7,030.5 ms | 21.86 ms | 12,159.7 ms | 0 | run_uX4ej3GSleJuun4i | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=32 | 2,258.2 | 786.1 ms | 12.97 ms | 3,472.3 ms | 0 | run_R05DohvT71HmzPHY | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=8 | 983.2 | 214 ms | 8.01 ms | 2,128.6 ms | 0 | run_sGelkB_gvuMWm1Us | |
| vllm 0.27.1 | dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384 | c=1 | 181.3 | 40.6 ms | 5.39 ms | 1,413.2 ms | 0 | run_feGAJd6Zcv58f_0c |
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 964.9
- p95 TTFT / TPOT
- 205.1 ms / 8.14 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 521.8
- p95 TTFT / TPOT
- 111.3 ms / 7.6 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 181.3
- p95 TTFT / TPOT
- 37.1 ms / 5.4 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 1,547.3
- p95 TTFT / TPOT
- 407.4 ms / 10.1 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 1,504.1
- p95 TTFT / TPOT
- 416.2 ms / 10.35 ms
- Runtime
- vllm 0.28.0
- Material parameters
dtype=bfloat16 max_num_seqs=32 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.88 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 1,534.1
- p95 TTFT / TPOT
- 402 ms / 10.29 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=false gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,866.1
- p95 TTFT / TPOT
- 1,064.4 ms / 16.68 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,973.6
- p95 TTFT / TPOT
- 1,033.5 ms / 15.38 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,980.1
- p95 TTFT / TPOT
- 996.1 ms / 14.67 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,974.1
- p95 TTFT / TPOT
- 1,034.2 ms / 15.38 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=auto prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,931.1
- p95 TTFT / TPOT
- 1,826.8 ms / 14.69 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=true max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,450.7
- p95 TTFT / TPOT
- 1,960.4 ms / 19.57 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 820.4
- p95 TTFT / TPOT
- 271.7 ms / 9.62 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 2,691
- p95 TTFT / TPOT
- 2,054.9 ms / 22.14 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 2,695.4
- p95 TTFT / TPOT
- 1,939.5 ms / 22.86 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 454.5
- p95 TTFT / TPOT
- 148.4 ms / 8.64 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 2,020.3
- p95 TTFT / TPOT
- 1,056.6 ms / 15.35 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,977.3
- p95 TTFT / TPOT
- 1,032.7 ms / 15.45 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 1,978
- p95 TTFT / TPOT
- 925 ms / 15.73 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 149.8
- p95 TTFT / TPOT
- 43.6 ms / 6.54 ms
- Runtime
- vllm 0.23.0+cu129
- Material parameters
dtype=bfloat16 max_num_seqs=64 enforce_eager=false max_model_len=9216 kv_cache_dtype=fp8 prefix_caching=false chunked_prefill=true expert_parallel=false async_scheduling=true gpu_memory_utilization=0.92 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 1,324.8
- p95 TTFT / TPOT
- 546.2 ms / 11.85 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=64
- Req/s
- Output tok/s
- 3,120
- p95 TTFT / TPOT
- 1,527.5 ms / 19.96 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=16
- Req/s
- Output tok/s
- 1,544.8
- p95 TTFT / TPOT
- 411.4 ms / 9.89 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=4
- Req/s
- Output tok/s
- 540.9
- p95 TTFT / TPOT
- 115.6 ms / 7.32 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=2
- Req/s
- Output tok/s
- 304.5
- p95 TTFT / TPOT
- 70.4 ms / 6.49 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=128
- Req/s
- Output tok/s
- 3,163.1
- p95 TTFT / TPOT
- 7,030.5 ms / 21.86 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=32
- Req/s
- Output tok/s
- 2,258.2
- p95 TTFT / TPOT
- 786.1 ms / 12.97 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 983.2
- p95 TTFT / TPOT
- 214 ms / 8.01 ms
- Runtime
- vllm 0.27.1
- Material parameters
dtype=bfloat16 max_num_seqs=128 max_model_len=16384 kv_cache_dtype=fp8 prefix_caching=false gpu_memory_utilization=0.90 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 181.3
- p95 TTFT / TPOT
- 40.6 ms / 5.39 ms