- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 1024 → 256
- Runs
- 6 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 77.2 | 227.7 ms | 12.14 ms | 3,322.7 ms | 0 | run_6JaGDduA6V6UUZAO | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 77.2 | 226.7 ms | 12.12 ms | 3,317.5 ms | 0 | run_rnFdIe1VGz_CdGHB | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 77.1 | 227.2 ms | 12.15 ms | 3,325.3 ms | 0 | run_hZrPPIaCESBXNmfi | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 77.1 | 221.5 ms | 12.17 ms | 3,324.9 ms | 0 | run_NP7Cgj167353GT8X | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 77.1 | 222 ms | 12.16 ms | 3,321.7 ms | 0 | run_vG1F0-GzWHpPsQuI | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 77 | 222 ms | 12.18 ms | 3,328.1 ms | 0 | run_R6cE0ka8-q28MGRv |
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 77.2
- p95 TTFT / TPOT
- 227.7 ms / 12.14 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 77.2
- p95 TTFT / TPOT
- 226.7 ms / 12.12 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 77.1
- p95 TTFT / TPOT
- 227.2 ms / 12.15 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 77.1
- p95 TTFT / TPOT
- 221.5 ms / 12.17 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 77.1
- p95 TTFT / TPOT
- 222 ms / 12.16 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 77
- p95 TTFT / TPOT
- 222 ms / 12.18 ms