Dialog Critique and Refinement on Critique and Refinement Evaluation Dataset Dialog
90.4CU ScoreRCO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RCOBackbone=LLaMA-2-7B-Chat2025.06 | 90.4 | 7.28 | |
| RCOBackbone=LLaMA-3-8B-Instruct2025.06 | 87 | 7.17 | |
| RCOBackbone=LLaMA-2-13B-Chat2025.06 | 86.9 | 7.2 | |
| Base modelBackbone=LLaMA-2-7B-Chat2025.06 | 83.5 | 7.16 | |
| Base modelBackbone=LLaMA-2-70B-Chat2025.06 | 82.7 | 7.09 | |
| Base modelBackbone=LLaMA-3-70B-Instruct2025.06 | 82.6 | 7.08 | |
| DPCOBackbone=LLaMA-2-7B-Chat2025.06 | 79.2 | 7.13 | |
| Base modelBackbone=LLaMA-2-13B-Chat2025.06 | 78.4 | 7.06 | |
| RCOBackbone=Auto-J-13B2025.06 | 77.5 | 7.09 | |
| DPCOBackbone=LLaMA-2-13B-Chat2025.06 | 76.5 | 6.91 | |
| Base modelBackbone=LLaMA-3-8B-Instruct2025.06 | 75.8 | 7.02 | |
| Self-refinement2025.06 | 75.2 | 6.96 | |
| RCOBackbone=UltraCM-13B2025.06 | 74.7 | 7.05 | |
| DPCOBackbone=UltraCM-13B2025.06 | 69.8 | 6.92 | |
| DPCOBackbone=LLaMA-3-8B-Instruct2025.06 | 68.7 | 6.71 | |
| DPCOBackbone=Auto-J-13B2025.06 | 68.3 | 6.99 | |
| Base modelBackbone=Auto-J-13B2025.06 | 60 | 6.83 | |
| Base modelBackbone=UltraCM-13B2025.06 | 53.9 | 6.5 | |
| Aligner2025.06 | 47.3 | 6.3 | |
| Initial Answer2025.06 | 6.23 | — |