Phi-3 Mini 3.8B (Q4)
Microsoft Phi-3 Mini 3.8B Instruct, Q4_K_M, batch 1, 4K context.
Primary metric: Tokens / sec (tok/s)
Reference prompts
Representative prompts for this workload. Exact prompts and harness settings still depend on the cited source for each record.
- Prompt 1
Explain the relationship between attention heads and KV cache memory usage for a 7B-parameter transformer at 4K context.
- Prompt 2
Write a 60-word product description for a mid-range AI workstation: 1× RTX 4090, 64GB DDR5, 2TB NVMe. Highlight one trade-off.
- Prompt 3
List five concrete differences between INT4 weight-only quantization (Q4_K_M) and INT8 quantization (Q8_0) for inference.
- Prompt 4
I have 12GB of VRAM and want to run a coding assistant locally. What model size and quantization fit, with what context length?
- Prompt 5
Summarize the difference between greedy decoding and nucleus sampling in 3 short bullet points.
Reference runtime command
A representative invocation for reproducing this workload class. Source-specific runs may use adjacent runtimes unless the record says otherwise.
llama-server -m phi-3-mini-instruct.Q4_K_M.gguf -c 4096 -ngl 999 --seed 42Single batch. Tiny 3.8B model — primarily a memory-bandwidth probe.
Full leaderboard
Every record for Phi-3 Mini.
Top 10 leaderboard
Phi-3 Mini 3.8B (Q4) · sorted by tokens / sec
Value frontier, MSRP vs tokens / sec
Each dot is a device. Top-left is best value (cheap + fast).
Full leaderboard
Click any row for detailed breakdown. Click column headers to sort.
| # | Device | Verif | Buy | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | NVIDIA H100 SXM5 80GBDatacenter GPU NVIDIA·Q4_K_M·4K ctx | 6 | 612tok/s | 80 GB | 700 W | $25k | 0.87 tok/s/W | $0.43/M | Amazon | |
| 2 | NVIDIA GeForce RTX 5090 32GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 348tok/s | 32 GB | 575 W | $2.0k | 0.60 tok/s/W | $0.06/M | Amazon | |
| 3 | NVIDIA GeForce RTX 5090 32GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 320tok/s | 32 GB | 575 W | $2.0k | 0.56 tok/s/W | $0.07/M | Amazon | |
| #4 | Google TPU v5eASIC Google·INT8·4K ctx | 6 | 320tok/s | 16 GB | 170 W | $0 | 1.88 tok/s/W | $0.00/M | Amazon | |
| #5 | NVIDIA GeForce RTX 4090 24GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 285tok/s | 24 GB | 450 W | $1.6k | 0.63 tok/s/W | $0.06/M | Amazon | |
| #6 | NVIDIA GeForce RTX 4090 24GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 245tok/s | 24 GB | 450 W | $1.6k | 0.54 tok/s/W | $0.07/M | Amazon | |
| #7 | NVIDIA GeForce RTX 4080 Super 16GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 215tok/s | 16 GB | 320 W | $999 | 0.67 tok/s/W | $0.05/M | Amazon | |
| #8 | AMD Radeon RX 7900 XTX 24GBConsumer GPU AMD·Q4_K_M·4K ctx | 6 | 195tok/s | 24 GB | 355 W | $999 | 0.55 tok/s/W | $0.05/M | Amazon | |
| #9 | AMD Instinct MI210 64GBDatacenter GPU AMD·Q4_K_M·4K ctx | 6 | 175tok/s | 64 GB | 300 W | $7.5k | 0.58 tok/s/W | $0.45/M | Amazon | |
| #10 | NVIDIA GeForce RTX 4070 Ti 12GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 165tok/s | 12 GB | 285 W | $799 | 0.58 tok/s/W | $0.05/M | Amazon | |
| #11 | NVIDIA GeForce RTX 5070 12GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 165tok/s | 12 GB | 250 W | $549 | 0.66 tok/s/W | $0.03/M | Amazon | |
| #12 | NVIDIA A40 48GBPro GPU NVIDIA·Q4_K_M·4K ctx | 6 | 162tok/s | 48 GB | 300 W | $5.5k | 0.54 tok/s/W | $0.36/M | Amazon | |
| #13 | NVIDIA GeForce RTX 5060 Ti 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 158tok/s | 8 GB | 180 W | $379 | 0.88 tok/s/W | $0.03/M | Amazon | |
| #14 | NVIDIA GeForce RTX 5060 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 145tok/s | 8 GB | 145 W | $299 | 1.00 tok/s/W | $0.02/M | Amazon | |
| #15 | NVIDIA GeForce RTX 4070 12GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 138tok/s | 12 GB | 200 W | $599 | 0.69 tok/s/W | $0.05/M | Amazon | |
| #16 | NVIDIA GeForce RTX 5060 Ti 16GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 132tok/s | 16 GB | 180 W | $449 | 0.73 tok/s/W | $0.04/M | Amazon | |
| #17 | AMD Radeon RX 7800 XT 16GBConsumer GPU AMD·Q4_K_M·4K ctx | 6 | 132tok/s | 16 GB | 263 W | $499 | 0.50 tok/s/W | $0.04/M | Amazon | |
| #18 | NVIDIA RTX A5000 24GBPro GPU NVIDIA·Q4_K_M·4K ctx | 6 | 122tok/s | 24 GB | 230 W | $2.5k | 0.53 tok/s/W | $0.22/M | Amazon | |
| #19 | NVIDIA GeForce RTX 5060 Ti 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 118tok/s | 8 GB | 165 W | $379 | 0.71 tok/s/W | $0.03/M | Amazon | |
| #20 | NVIDIA GeForce RTX 5060 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 98tok/s | 8 GB | 145 W | $299 | 0.68 tok/s/W | $0.03/M | Amazon | |
| #21 | NVIDIA GeForce RTX 4060 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 95tok/s | 8 GB | 115 W | $299 | 0.83 tok/s/W | $0.03/M | Amazon | |
| #22 | NVIDIA GeForce RTX 3060 12GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 92tok/s | 12 GB | 170 W | $329 | 0.54 tok/s/W | $0.04/M | Amazon | |
| #23 | NVIDIA RTX A4000 16GBPro GPU NVIDIA·Q4_K_M·4K ctx | 6 | 92tok/s | 16 GB | 140 W | $1.2k | 0.66 tok/s/W | $0.14/M | Amazon | |
| #24 | NVIDIA GeForce RTX 4060 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 88tok/s | 8 GB | 115 W | $299 | 0.77 tok/s/W | $0.04/M | Amazon | |
| #25 | AMD Radeon RX 7600 8GBConsumer GPU AMD·Q4_K_M·4K ctx | 6 | 88tok/s | 8 GB | 165 W | $269 | 0.53 tok/s/W | $0.03/M | Amazon | |
| #26 | Intel Arc B580 12GBConsumer GPU Intel·Q4_K_M·4K ctx | 6 | 86tok/s | 12 GB | 190 W | $249 | 0.45 tok/s/W | $0.03/M | Amazon | |
| #27 | NVIDIA GeForce RTX 4060 8GBConsumer GPU NVIDIA·Q4_K_M·4K ctx | 6 | 84tok/s | 8 GB | 115 W | $299 | 0.73 tok/s/W | $0.04/M | Amazon | |
| #28 | AMD Ryzen AI Max+ 395 (Strix Halo, 96GB)NPU AMD·Q4_K_M·4K ctx | 6 | 78tok/s | 96 GB | 120 W | $2.2k | 0.65 tok/s/W | $0.30/M | Amazon | |
| #29 | Apple M4 Pro (20c GPU, 48GB)Apple Silicon Apple·Q4_K_M·4K ctx | 6 | 78tok/s | 48 GB | 35 W | $2.0k | 2.23 tok/s/W | $0.27/M | Amazon | |
| #30 | Intel Arc B580 12GBConsumer GPU Intel·Q4_K_M·4K ctx | 6 | 76tok/s | 12 GB | 190 W | $249 | 0.40 tok/s/W | $0.03/M | Amazon | |
| #31 | Apple Mac mini M4 Pro 24GBApple Silicon Apple·Q4_K_M·4K ctx | 6 | 72tok/s | 24 GB | 35 W | $1.4k | 2.06 tok/s/W | $0.20/M | Amazon | |
| #32 | Intel Arc A770 16GBConsumer GPU Intel·Q4_K_M·4K ctx | 6 | 72tok/s | 16 GB | 225 W | $349 | 0.32 tok/s/W | $0.05/M | Amazon | |
| #33 | Apple M3 Pro (18c GPU, 36GB)Apple Silicon Apple·Q4_K_M·4K ctx | 6 | 62tok/s | 36 GB | 30 W | $2.5k | 2.07 tok/s/W | $0.43/M | Amazon | |
| #34 | AMD Radeon RX 7600 8GBConsumer GPU AMD·Q4_K_M·4K ctx | 6 | 58tok/s | 8 GB | 165 W | $269 | 0.35 tok/s/W | $0.05/M | Amazon | |
| #35 | Intel Arc A750 8GBConsumer GPU Intel·Q4_K_M·4K ctx | 6 | 58tok/s | 8 GB | 225 W | $249 | 0.26 tok/s/W | $0.05/M | Amazon | |
| #36 | NVIDIA Jetson AGX Orin 64GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 55tok/s | 64 GB | 60 W | $2.0k | 0.92 tok/s/W | $0.38/M | Amazon | |
| #37 | Apple M2 Pro (19c GPU, 32GB)Apple Silicon Apple·Q4_K_M·4K ctx | 6 | 54tok/s | 32 GB | 28 W | $2.0k | 1.93 tok/s/W | $0.39/M | Amazon | |
| #38 | Apple Mac mini M4 24GBApple Silicon Apple·Q4_K_M·4K ctx | 6 | 52tok/s | 24 GB | 22 W | $799 | 2.36 tok/s/W | $0.16/M | Amazon | |
| #39 | NVIDIA Jetson AGX Orin 64GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 48tok/s | 64 GB | 60 W | $2.0k | 0.80 tok/s/W | $0.44/M | Amazon | |
| #40 | Apple M4 (10c GPU, 24GB)Apple Silicon Apple·Q4_K_M·4K ctx | 6 | 48tok/s | 24 GB | 22 W | $999 | 2.18 tok/s/W | $0.22/M | Amazon | |
| #41 | Apple Mac mini M4 16GBApple Silicon Apple·Q4_K_M·4K ctx | 6 | 45tok/s | 16 GB | 22 W | $599 | 2.04 tok/s/W | $0.14/M | Amazon | |
| #42 | Apple Mac mini M4 16GBApple Silicon Apple·Q4_K_M·4K ctx | 6 | 42tok/s | 16 GB | 18 W | $599 | 2.33 tok/s/W | $0.15/M | Amazon | |
| #43 | Intel Xeon 6980P (128 cores)CPU-only Intel·Q4_K_M·4K ctx | 6 | 42tok/s | , | 500 W | $18k | 0.08 tok/s/W | $0.0045/k | Amazon | |
| #44 | NVIDIA Jetson Orin NX 16GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 38tok/s | 16 GB | 25 W | $599 | 1.52 tok/s/W | $0.17/M | Amazon | |
| #45 | Qualcomm Snapdragon X Elite X1E-84-100NPU Qualcomm·Q4_K_M·4K ctx | 6 | 38tok/s | , | 23 W | $1.2k | 1.65 tok/s/W | $0.33/M | Amazon | |
| #46 | AMD Threadripper Pro 7995WX (96 cores)CPU-only AMD·Q4_K_M·4K ctx | 6 | 36tok/s | , | 350 W | $10.0k | 0.10 tok/s/W | $0.0029/k | Amazon | |
| #47 | NVIDIA Jetson Orin Nano Super 8GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 32tok/s | 8 GB | 25 W | $249 | 1.28 tok/s/W | $0.08/M | Amazon | |
| #48 | Intel Xeon 6980P (128c Granite Rapids)CPU-only Intel·Q4_K_M·4K ctx | 6 | 32tok/s | , | 500 W | $18k | 0.06 tok/s/W | $0.0059/k | Amazon | |
| #49 | AMD Ryzen AI 9 HX 370 (Strix Point NPU 50 TOPS)NPU AMD·Q4_K_M·4K ctx | 6 | 32tok/s | , | 28 W | $1.5k | 1.14 tok/s/W | $0.49/M | Amazon | |
| #50 | Intel Core Ultra 9 288V (Lunar Lake)NPU Intel·Q4_K_M·4K ctx | 6 | 30tok/s | , | 17 W | $1.4k | 1.76 tok/s/W | $0.49/M | Amazon | |
| #51 | AMD Threadripper PRO 7995WX (96-core)CPU-only AMD·Q4_K_M·4K ctx | 6 | 28tok/s | , | 350 W | $10.0k | 0.08 tok/s/W | $0.0038/k | Amazon | |
| #52 | Qualcomm Snapdragon X Elite (X1E-84-100)NPU Qualcomm·INT4·4K ctx | 6 | 28tok/s | , | 23 W | $1.2k | 1.22 tok/s/W | $0.45/M | Amazon | |
| #53 | Intel Core Ultra 258V (Lunar Lake NPU 48 TOPS)NPU Intel·Q4_K_M·4K ctx | 6 | 28tok/s | , | 17 W | $1.3k | 1.65 tok/s/W | $0.49/M | Amazon | |
| #54 | AMD Ryzen AI 9 365 (Strix Point)NPU AMD·Q4_K_M·4K ctx | 6 | 28tok/s | , | 28 W | $1.3k | 1.00 tok/s/W | $0.49/M | Amazon | |
| #55 | Qualcomm Snapdragon X Elite (X1E-84-100)NPU Qualcomm·INT4·2K ctx | 6 | 25tok/s | , | 23 W | $1.2k | 1.09 tok/s/W | $0.51/M | Amazon | |
| #56 | Intel Core Ultra 9 285KCPU-only Intel·Q4_K_M·4K ctx | 6 | 24tok/s | , | 250 W | $589 | 0.10 tok/s/W | $0.26/M | Amazon | |
| #57 | Intel Core Ultra 9 288V (Lunar Lake) NPUNPU Intel·INT4·2K ctx | 6 | 22tok/s | , | 17 W | $549 | 1.29 tok/s/W | $0.26/M | Amazon | |
| #58 | Intel Core Ultra 7 258V (Lunar Lake)NPU Intel·INT4·2K ctx | 6 | 22tok/s | , | 17 W | $1.3k | 1.29 tok/s/W | $0.62/M | Amazon | |
| #59 | NVIDIA Jetson Orin NX 16GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 22tok/s | 16 GB | 25 W | $699 | 0.88 tok/s/W | $0.34/M | Amazon | |
| #60 | NVIDIA Jetson Orin Nano Super 8GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 21tok/s | 8 GB | 25 W | $249 | 0.84 tok/s/W | $0.13/M | Amazon | |
| #61 | AMD Ryzen AI 9 HX 370 NPUNPU AMD·INT4·2K ctx | 6 | 19tok/s | , | 28 W | $1.5k | 0.68 tok/s/W | $0.83/M | Amazon | |
| #62 | NVIDIA Jetson Orin Nano 8GBEdge NVIDIA·Q4_K_M·4K ctx | 6 | 18tok/s | 8 GB | 15 W | $499 | 1.20 tok/s/W | $0.29/M | Amazon | |
| #63 | AMD Ryzen AI 9 365 NPUNPU AMD·INT4·2K ctx | 6 | 16tok/s | , | 28 W | $1.2k | 0.57 tok/s/W | $0.79/M | Amazon | |
| #64 | Intel Core Ultra 9 285K NPUNPU Intel·INT4·2K ctx | 6 | 14tok/s | , | 15 W | $589 | 0.93 tok/s/W | $0.44/M | Amazon | |
| #65 | Raspberry Pi AI Hat+ (Hailo-8L 13 TOPS)Edge Raspberry Pi·INT8·4K ctx | 6 | 6tok/s | , | 8 W | $70 | 0.75 tok/s/W | $0.12/M | Amazon | |
| #66 | Raspberry Pi 5 + AI HAT+ (Hailo-8)Edge Raspberry Pi·INT8·2K ctx | 6 | 4tok/s | 8 GB | 12 W | $150 | 0.35 tok/s/W | $0.38/M | Amazon | |
| #67 | Raspberry Pi 5 8GBEdge Raspberry Pi·Q4_K_M·2K ctx | 6 | 4tok/s | , | 12 W | $80 | 0.35 tok/s/W | $0.20/M | Amazon | |
| #68 | Raspberry Pi 5 (8GB)Edge Raspberry Pi·Q4_K_M·4K ctx | 6 | 4tok/s | , | 12 W | $80 | 0.29 tok/s/W | $0.24/M | Amazon |
Cite this benchmark
Use this in your paper, blog post, or comparison table.
@misc{myaihardware_phi3-mini-q4_2026,
title = {MyAI Bench: Phi-3 Mini 3.8B (Q4)},
author = {{MyAIHardware Contributors}},
year = {2026},
url = {https://www.myaihardware.com/benchmarks/workload/phi3-mini-q4},
note = {Version 1.3, accessed 2026-08-27}
}MyAIHardware Contributors. (2026). MyAI Bench: Phi-3 Mini 3.8B (Q4). MyAIHardware. Retrieved 2026-08-27, from https://www.myaihardware.com/benchmarks/workload/phi3-mini-q4
MyAIHardware Contributors. "MyAI Bench: Phi-3 Mini 3.8B (Q4)." MyAIHardware, 2026, https://www.myaihardware.com/benchmarks/workload/phi3-mini-q4. Accessed 2026-08-27.
MyAI Bench, Phi-3 Mini 3.8B (Q4). MyAIHardware Contributors, 2026. Version 1.3. https://www.myaihardware.com/benchmarks/workload/phi3-mini-q4 (accessed 2026-08-27).