- Hardware
- 1× NVIDIA GeForce RTX 5090
- Workload
- 256 → 1024
- Runs
- 7 eligible
Efficient frontierOther eligible run
Runs
All published runs with the same model build, accelerator setup, and request shape. Benchmark methodology remains attached to each run.
| Runtime | Material parameters | Test load | Req/s | Output tok/s | p95 TTFT | p95 TPOT | p95 E2E | Failures | Run |
|---|---|---|---|---|---|---|---|---|---|
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 82.4 | 69.7 ms | 12.09 ms | 12,439.2 ms | 0 | run_ABIAlnoJQOVFipdw | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 82.4 | 69.3 ms | 12.1 ms | 12,441.2 ms | 0 | run_D8JKmhP0oZ4b10Yt | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 82.3 | 69.5 ms | 12.13 ms | 12,468.6 ms | 0 | run_r2hT1Fvin_tihPGr | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=8 | 147.5 | 486.3 ms | 54.57 ms | 56,133.1 ms | 0 | run_SRteyZHstMez-NPA | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 82.2 | 67.5 ms | 12.13 ms | 12,470.7 ms | 0 | run_Rv92orXGyCS2R1nc | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 82.2 | 67.1 ms | 12.13 ms | 12,474.6 ms | 0 | run_TSbZl1OFV0-VveGL | |
| llama.cpp b10689 | ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384 | c=1 | 82.2 | 67.2 ms | 12.15 ms | 12,489.6 ms | 0 | run_3cKqnZbIlPZjdQvF |
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 82.4
- p95 TTFT / TPOT
- 69.7 ms / 12.09 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 82.4
- p95 TTFT / TPOT
- 69.3 ms / 12.1 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 82.3
- p95 TTFT / TPOT
- 69.5 ms / 12.13 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=8
- Req/s
- Output tok/s
- 147.5
- p95 TTFT / TPOT
- 486.3 ms / 54.57 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 82.2
- p95 TTFT / TPOT
- 67.5 ms / 12.13 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 82.2
- p95 TTFT / TPOT
- 67.1 ms / 12.13 ms
- Runtime
- llama.cpp b10689
- Material parameters
ubatch_size=512 context_size=147456 max_num_seqs=16 flash_attention=on weight_artifact=Muse-Glimmer-30B-KQuant-17GB-Q4_K_M.gguf max_model_len_per_slot=9216 max_num_batched_tokens=16384- Test load
- c=1
- Req/s
- Output tok/s
- 82.2
- p95 TTFT / TPOT
- 67.2 ms / 12.15 ms