Physical Reasoning on PROST
29.6AccuracyGPT-NeoX
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-NeoXModel Size=20B, Zero-shot=true2022.04 | 29.6 | |
| MaskProBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 29.57 | |
| GPT-3Model Variant=Curie, Zero-shot=true2022.04 | 28.8 | |
| SparsegptBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 28.22 | |
| DenseBase Model=DeepSeek-7B, Sparsity=Dense2025.06 | 28.19 | |
| Pruner-ZBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 27.62 | |
| FairSeqNumber of Parameters=6.7B, Zero-Shot=true2022.04 | 27.2 | |
| GPT-3Model Variant=Babbage, Zero-shot=true2022.04 | 27 | |
| GPT-JModel Size=6B, Zero-shot=true2022.04 | 26.7 | |
| GPT-3Model Variant=DaVinci, Zero-shot=true2022.04 | 26.7 | |
| FairSeqNumber of Parameters=355M, Zero-Shot=true2022.04 | 25.7 | |
| FairSeqNumber of Parameters=1.3B, Zero-Shot=true2022.04 | 25.7 | |
| GPT-3Model Variant=Ada, Zero-shot=true2022.04 | 25.4 | |
| FairSeqNumber of Parameters=13B, Zero-Shot=true2022.04 | 25.2 | |
| MaskProBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 24.41 | |
| SparsegptBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 24.26 | |
| Pruner-ZBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 24.03 | |
| DenseBase Model=LLaMA-2-7B, Sparsity=Dense2025.06 | 23.6 | |
| FairSeqNumber of Parameters=2.7B, Zero-Shot=true2022.04 | 23 | |
| FairSeqNumber of Parameters=125M, Zero-Shot=true2022.04 | 21.5 |