Question Answering Critique and Refinement on Critique and Refinement Evaluation Dataset
96.2CU ScoreRCO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RCOBackbone=LLaMA-2-13B-Chat2025.06 | 96.2 | 7.22 | |
| RCOBackbone=LLaMA-2-7B-Chat2025.06 | 94.3 | 7.28 | |
| RCOBackbone=LLaMA-3-8B-Instruct2025.06 | 94.2 | 7.03 | |
| RCOBackbone=Auto-J-13B2025.06 | 91.9 | 7.17 | |
| DPCOBackbone=LLaMA-2-7B-Chat2025.06 | 91.2 | 6.85 | |
| Base modelBackbone=LLaMA-2-70B-Chat2025.06 | 88.8 | 6.75 | |
| RCOBackbone=UltraCM-13B2025.06 | 88.4 | 6.79 | |
| DPCOBackbone=Auto-J-13B2025.06 | 87.9 | 6.57 | |
| Base modelBackbone=LLaMA-2-7B-Chat2025.06 | 87.1 | 6.48 | |
| Base modelBackbone=LLaMA-2-13B-Chat2025.06 | 86.9 | 6.64 | |
| Base modelBackbone=LLaMA-3-70B-Instruct2025.06 | 86.3 | 6.47 | |
| DPCOBackbone=LLaMA-2-13B-Chat2025.06 | 86 | 6.51 | |
| DPCOBackbone=UltraCM-13B2025.06 | 84.8 | 6.47 | |
| DPCOBackbone=LLaMA-3-8B-Instruct2025.06 | 82.4 | 6.76 | |
| Base modelBackbone=LLaMA-3-8B-Instruct2025.06 | 82 | 6.55 | |
| Self-refinement2025.06 | 79.9 | 6.08 | |
| Base modelBackbone=Auto-J-13B2025.06 | 79.1 | 6.5 | |
| Base modelBackbone=UltraCM-13B2025.06 | 63.8 | 5.88 | |
| Aligner2025.06 | 47.6 | 5.79 | |
| Initial Answer2025.06 | 5.33 | — |