Large Language Model Reasoning on CMMLU, GSM8K, and HumanEval (test)
40.4Average AccuracyFine-tuned
Evaluation Results
| Method | Links | |
|---|---|---|
| Fine-tunedBackbone=LLaMa22025.05 | 40.4 | |
| NPSBackbone=LLaMa22025.05 | 35.3 | |
| Consensus TIESBackbone=LLaMa22025.05 | 34.4 | |
| Ties-MergingBackbone=LLaMa22025.05 | 34.2 | |
| Consensus TABackbone=LLaMa22025.05 | 33.5 | |
| Task ArithmeticBackbone=LLaMa22025.05 | 30.4 | |
| AveragingBackbone=LLaMa22025.05 | 30.3 |