LLM Inference on Phi4 Mini Samsung Galaxy S25 Ultra 3.8B (test)
1,161.29Prefill Throughput (min, tokens/sec)ET QNN
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ET QNNHardware=NPU, GS=322026.05 | 1,161.29 | 1,229.27 | 18.12 | 19.63 | 3,584 | |
| ET VulkanHardware=GPU, GS=1282026.05 | 343.57 | 372.6 | 18.75 | 19.67 | 2,088 | |
| llama.cppHardware=GPU, GS=322026.05 | 339.1 | 341.5 | 11.6 | 13.1 | 2,216 | |
| ET XNNPACKHardware=CPU, GS=1282026.05 | 195.7 | 202.6 | 20.5 | 22 | 2,201 | |
| ET VulkanHardware=GPU, GS=322026.05 | 191.2 | 238.92 | 16.03 | 16.38 | 2,829 | |
| llama.cppHardware=CPU, GS=322026.05 | 151.2 | 153.3 | 22.1 | 22.9 | 2,216 | |
| ET XNNPACKHardware=CPU, GS=322026.05 | 143.6 | 159.7 | 18.5 | 19.9 | 2,428 | |
| llama.cppHardware=NPU, GS=322026.05 | 114.4 | 130 | 12.1 | 12.5 | 2,216 | |
| ONNXHardware=CPU, GS=1282026.05 | 92.08 | 106.54 | 18.81 | 20.02 | 1,994 | |
| ONNXHardware=CPU, GS=322026.05 | 60.02 | 65.72 | 17.37 | 18.29 | 2,337 |