Mathematical Reasoning Critique and Refinement on Critique and Refinement Evaluation Dataset Math
76.2CU ScoreBase model
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Base modelBackbone=LLaMA-3-70B-Instruct2025.06 | 76.2 | 4.75 | |
| RCOBackbone=LLaMA-3-8B-Instruct2025.06 | 76.2 | 4.84 | |
| RCOBackbone=UltraCM-13B2025.06 | 72 | 4.5 | |
| RCOBackbone=LLaMA-2-13B-Chat2025.06 | 71 | 4.38 | |
| RCOBackbone=LLaMA-2-7B-Chat2025.06 | 70.7 | 4.45 | |
| Base modelBackbone=LLaMA-3-8B-Instruct2025.06 | 69.8 | 4.41 | |
| RCOBackbone=Auto-J-13B2025.06 | 68.5 | 4.38 | |
| Base modelBackbone=LLaMA-2-13B-Chat2025.06 | 66.3 | 4.21 | |
| Base modelBackbone=UltraCM-13B2025.06 | 65.2 | 4.27 | |
| Self-refinement2025.06 | 64.5 | 4.32 | |
| DPCOBackbone=Auto-J-13B2025.06 | 64.5 | 4.06 | |
| DPCOBackbone=LLaMA-3-8B-Instruct2025.06 | 63.8 | 4.26 | |
| Base modelBackbone=LLaMA-2-70B-Chat2025.06 | 62.7 | 4.19 | |
| DPCOBackbone=UltraCM-13B2025.06 | 62.4 | 3.98 | |
| Base modelBackbone=Auto-J-13B2025.06 | 60.4 | 3.85 | |
| Base modelBackbone=LLaMA-2-7B-Chat2025.06 | 60.1 | 4.03 | |
| DPCOBackbone=LLaMA-2-7B-Chat2025.06 | 58.7 | 3.94 | |
| DPCOBackbone=LLaMA-2-13B-Chat2025.06 | 56.1 | 3.68 | |
| Aligner2025.06 | 51.4 | 3.78 | |
| Initial Answer2025.06 | 3.73 | — |