⚠ 示意資料 — 第一版所有數字為合成測試值,正式可重現的量測即將上線。
GPU 基準排名
| Compare | # | 晶片 | 主力指標 |
|---|---|---|---|
| 1 | NVIDIA GB200 NVL72 ×72 · vLLM | 412,000 tokens/sec | |
| 2 | NVIDIA GB200 NVL72 ×36 · TensorRT-LLM | 268,000 tokens/sec | |
| 3 | NVIDIA B200 ×8 · TensorRT-LLM | 38,400 tokens/sec | |
| 4 | NVIDIA H100 80GB ×4 · TensorRT-LLM | 24,600 tokens/sec | |
| 5 | NVIDIA B200 ×4 · vLLM | 22,800 tokens/sec | |
| 6 | NVIDIA H200 141GB ×8 · SGLang | 21,200 tokens/sec | |
| 7 | NVIDIA H100 80GB ×8 · vLLM | 18,420 tokens/sec | |
| 8 | AMD MI300X 192GB ×8 · vLLM | 13,800 tokens/sec | |
| 9 | NVIDIA H200 141GB ×4 · vLLM | 11,800 tokens/sec | |
| 10 | NVIDIA RTX 5090 32GB ×1 · TensorRT-LLM | 11,200 tokens/sec | |
| 11 | NVIDIA H200 141GB ×1 · vLLM | 10,400 tokens/sec | |
| 12 | NVIDIA H100 80GB ×1 · vLLM | 9,800 tokens/sec | |
| 13 | NVIDIA H100 PCIe 80GB ×4 · vLLM | 8,800 tokens/sec | |
| 14 | NVIDIA A100 80GB ×8 · vLLM | 8,400 tokens/sec | |
| 15 | NVIDIA H100 PCIe 80GB ×1 · TensorRT-LLM | 8,400 tokens/sec | |
| 16 | NVIDIA RTX 5090 32GB ×1 · vLLM | 8,200 tokens/sec | |
| 17 | NVIDIA RTX 6000 Ada 48GB ×1 · TensorRT-LLM | 7,400 tokens/sec | |
| 18 | NVIDIA L40S 48GB ×1 · vLLM | 6,900 tokens/sec | |
| 19 | AMD MI250X 128GB ×8 · vLLM | 6,800 tokens/sec | |
| 20 | NVIDIA RTX 4090 24GB ×1 · TensorRT-LLM | 6,400 tokens/sec | |
| 21 | AMD MI250X 128GB ×4 · vLLM | 5,800 tokens/sec | |
| 22 | NVIDIA RTX 6000 Ada 48GB ×1 · vLLM | 5,600 tokens/sec | |
| 23 | NVIDIA L40S 48GB ×1 · TGI | 5,200 tokens/sec | |
| 24 | NVIDIA GB200 NVL72 ×72 · vLLM | 4,800 samples/hour | |
| 25 | NVIDIA L4 24GB ×1 · TensorRT-LLM | 4,800 tokens/sec | |
| 26 | NVIDIA RTX 4090 24GB ×1 · vLLM | 4,600 tokens/sec | |
| 27 | AMD RX 7900 XTX 24GB ×1 · vLLM | 4,400 tokens/sec | |
| 28 | NVIDIA A100 PCIe 40GB ×4 · vLLM | 4,200 tokens/sec | |
| 29 | NVIDIA A100 PCIe 40GB ×1 · TensorRT-LLM | 4,200 tokens/sec | |
| 30 | NVIDIA RTX 4080 SUPER 16GB ×1 · TensorRT-LLM | 3,800 tokens/sec | |
| 31 | NVIDIA RTX 5090 32GB ×1 · vLLM | 3,400 tokens/sec | |
| 32 | AMD RX 7900 XTX 24GB ×1 · vLLM | 3,400 tokens/sec | |
| 33 | NVIDIA L4 24GB ×1 · vLLM | 3,200 tokens/sec | |
| 34 | NVIDIA RTX 3090 24GB ×1 · vLLM | 3,100 tokens/sec | |
| 35 | NVIDIA RTX 4080 SUPER 16GB ×1 · vLLM | 2,800 tokens/sec | |
| 36 | NVIDIA RTX 3090 24GB ×1 · TensorRT-LLM | 2,200 tokens/sec | |
| 37 | NVIDIA GB200 NVL72 ×36 · TensorRT-LLM | 2,120 samples/hour | |
| 38 | NVIDIA RTX 4090 24GB ×1 · vLLM | 1,800 tokens/sec | |
| 39 | NVIDIA GB200 NVL72 ×72 · vLLM | 1,480 queries/sec | |
| 40 | NVIDIA GB200 NVL72 ×36 · SGLang | 920 queries/sec | |
| 41 | NVIDIA B200 ×8 · TensorRT-LLM | 740 samples/hour | |
| 42 | NVIDIA H200 141GB ×8 · vLLM | 468 samples/hour | |
| 43 | NVIDIA H100 80GB ×8 · vLLM | 412 samples/hour | |
| 44 | NVIDIA B200 ×4 · vLLM | 396 samples/hour | |
| 45 | AMD MI300X 192GB ×8 · vLLM | 312 samples/hour | |
| 46 | NVIDIA B200 ×8 · TensorRT-LLM | 248 queries/sec | |
| 47 | NVIDIA H200 141GB ×4 · SGLang | 246 samples/hour | |
| 48 | NVIDIA H100 80GB ×4 · vLLM | 218 samples/hour | |
| 49 | NVIDIA A100 80GB ×8 · vLLM | 184 samples/hour | |
| 50 | NVIDIA H200 141GB ×8 · vLLM | 158 queries/sec | |
| 51 | NVIDIA H100 80GB ×8 · vLLM | 142 queries/sec | |
| 52 | NVIDIA B200 ×4 · vLLM | 132 queries/sec | |
| 53 | NVIDIA H100 PCIe 80GB ×4 · vLLM | 132 samples/hour | |
| 54 | NVIDIA H200 141GB ×1 · vLLM | 108 samples/hour | |
| 55 | NVIDIA H100 80GB ×1 · vLLM | 96 samples/hour | |
| 56 | AMD MI300X 192GB ×8 · vLLM | 96 queries/sec | |
| 57 | NVIDIA H200 141GB ×4 · SGLang | 84 queries/sec | |
| 58 | NVIDIA H100 80GB ×4 · SGLang | 78 queries/sec | |
| 59 | NVIDIA H100 PCIe 80GB ×4 · vLLM | 78 queries/sec | |
| 60 | NVIDIA A100 80GB ×8 · vLLM | 64 queries/sec | |
| 61 | NVIDIA H100 PCIe 80GB ×2 · TensorRT-LLM | 62 queries/sec | |
| 62 | AMD MI250X 128GB ×4 · vLLM | 56 samples/hour | |
| 63 | AMD MI250X 128GB ×4 · vLLM | 48 queries/sec | |
| 64 | NVIDIA H100 PCIe 80GB ×1 · SGLang | 46 samples/hour | |
| 65 | NVIDIA RTX 5090 32GB ×1 · TensorRT-LLM | 42 samples/hour | |
| 66 | NVIDIA RTX 5090 32GB ×1 · vLLM | 42 queries/sec | |
| 67 | NVIDIA L40S 48GB ×1 · TGI | 38 samples/hour | |
| 68 | NVIDIA A100 PCIe 40GB ×4 · vLLM | 38 queries/sec | |
| 69 | NVIDIA H200 141GB ×1 · vLLM | 35 queries/sec | |
| 70 | NVIDIA RTX 6000 Ada 48GB ×1 · TensorRT-LLM | 34 queries/sec | |
| 71 | NVIDIA H100 80GB ×1 · vLLM | 32 queries/sec | |
| 72 | AMD MI250X 128GB ×2 · vLLM | 32 queries/sec | |
| 73 | NVIDIA A100 PCIe 40GB ×2 · vLLM | 28 samples/hour | |
| 74 | NVIDIA RTX 5090 32GB ×1 · vLLM | 28 samples/hour | |
| 75 | NVIDIA RTX 4090 24GB ×1 · SGLang | 26 samples/hour | |
| 76 | NVIDIA RTX 4090 24GB ×1 · vLLM | 26 queries/sec | |
| 77 | NVIDIA RTX 6000 Ada 48GB ×1 · vLLM | 24 queries/sec | |
| 78 | NVIDIA L4 24GB ×1 · TensorRT-LLM | 22 queries/sec | |
| 79 | NVIDIA A100 PCIe 40GB ×1 · TensorRT-LLM | 22 queries/sec | |
| 80 | NVIDIA RTX 6000 Ada 48GB ×1 · SGLang | 22 samples/hour | |
| 81 | AMD MI250X 128GB ×2 · SGLang | 22 samples/hour | |
| 82 | NVIDIA L40S 48GB ×1 · TGI | 18 queries/sec | |
| 83 | NVIDIA RTX 4090 24GB ×1 · vLLM | 18 samples/hour | |
| 84 | AMD RX 7900 XTX 24GB ×1 · vLLM | 18 queries/sec | |
| 85 | NVIDIA RTX 6000 Ada 48GB ×1 · vLLM | 16 samples/hour | |
| 86 | NVIDIA RTX 4080 SUPER 16GB ×1 · TensorRT-LLM | 16 queries/sec | |
| 87 | NVIDIA L4 24GB ×1 · SGLang | 14.2 samples/hour | |
| 88 | NVIDIA L4 24GB ×1 · vLLM | 14 queries/sec | |
| 89 | NVIDIA A100 PCIe 40GB ×1 · SGLang | 13 samples/hour | |
| 90 | AMD RX 7900 XTX 24GB ×1 · vLLM | 13 samples/hour | |
| 91 | NVIDIA RTX 4080 SUPER 16GB ×1 · vLLM | 12 samples/hour | |
| 92 | NVIDIA RTX 3090 24GB ×1 · TensorRT-LLM | 12 queries/sec | |
| 93 | NVIDIA L4 24GB ×1 · vLLM | 9.4 samples/hour | |
| 94 | NVIDIA RTX 3090 24GB ×1 · vLLM | 8.5 samples/hour |
沒有符合條件的測試結果。