Question Answering on GPQA (Accuracy, Avg Tokens)
60AccuracyMARS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MARSBackbone=Llama3-70b2025.09 | 60 | 6,633 | |
| MADBackbone=Llama3-70b2025.09 | 59.67 | 19,255 | |
| Self-consistencyBackbone=Llama3-70b2025.09 | 56.67 | 3,470 | |
| Self-reflectionBackbone=Llama3-70b2025.09 | 56.33 | 2,079 | |
| DMADBackbone=Llama3-70b2025.09 | 56.33 | 18,082 | |
| MARSBackbone=GPT-4o-mini2025.09 | 48.33 | 7,903 | |
| CoTBackbone=Llama3-70b2025.09 | 47.67 | 963 | |
| MADBackbone=GPT-4o-mini2025.09 | 47.5 | 17,083 | |
| DMADBackbone=GPT-4o-mini2025.09 | 47.33 | 17,229 | |
| MADBackbone=Mixtral 8x22b2025.09 | 47 | 13,308 | |
| MARSBackbone=Mixtral 8x22b2025.09 | 44 | 5,418 | |
| CoTBackbone=GPT-4o-mini2025.09 | 43.33 | 677 | |
| DMADBackbone=Mixtral 8x22b2025.09 | 43.33 | 13,509 | |
| Self-consistencyBackbone=Mixtral 8x22b2025.09 | 41.67 | 2,840 | |
| CoTBackbone=Mixtral 8x22b2025.09 | 41.33 | 721 | |
| Self-consistencyBackbone=GPT-4o-mini2025.09 | 40.67 | 2,910 | |
| Self-reflectionBackbone=Mixtral 8x22b2025.09 | 38 | 1,579 | |
| Self-reflectionBackbone=GPT-4o-mini2025.09 | 37.67 | 1,597 | |
| MARSBackbone=Mixtral 8x7b2025.09 | 37.33 | 6,441 | |
| MARSBackbone=GPT-3.52025.09 | 36.33 | 3,741 | |
| Self-consistencyBackbone=Mixtral 8x7b2025.09 | 35.67 | 3,033 | |
| MADBackbone=Mixtral 8x7b2025.09 | 35.67 | 12,835 | |
| DMADBackbone=GPT-3.52025.09 | 35.67 | 5,609 | |
| Self-reflectionBackbone=Mixtral 8x7b2025.09 | 35 | 1,625 | |
| DMADBackbone=Mixtral 8x7b2025.09 | 34 | 14,139 | |
| CoTBackbone=Mixtral 8x7b2025.09 | 33.67 | 759 | |
| Self-consistencyBackbone=GPT-3.52025.09 | 33.67 | 1,686 | |
| CoTBackbone=GPT-3.52025.09 | 31 | 414 | |
| MADBackbone=GPT-3.52025.09 | 31 | 7,567 | |
| Self-reflectionBackbone=GPT-3.52025.09 | 29.67 | 890 |