Scientific Paper Revision on ReviseQA Human Evaluation 1.0 (held-out QA benchmark)
3.83Judge 1 ScoreGPT-4o-Mini
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4o-MiniCriterion=Instruction Following2025.05 | 3.83 | 3.72 | 3.87 | 3.81 | |
| GPT-o1-miniCriterion=Instruction Following2025.05 | 3.82 | 3.95 | 3.74 | 3.84 | |
| GPT-o1-miniCriterion=Criteria Alignment2025.05 | 3.7 | 3.85 | 3.71 | 3.76 | |
| GPT-4o-MiniCriterion=Criteria Alignment2025.05 | 3.68 | 3.74 | 3.83 | 3.75 | |
| GPT-o1-miniCriterion=In-Context Reference2025.05 | 3.1 | 3.4 | 3.68 | 3.4 | |
| GPT-4o-MiniCriterion=In-Context Reference2025.05 | 2.97 | 3.32 | 3.64 | 3.31 | |
| GPT-o1-miniCriterion=Revision Acceptance2025.05 | 2.8 | 3.32 | 3.64 | 3.25 | |
| GPT-4o-MiniCriterion=Revision Acceptance2025.05 | 2.46 | 3.09 | 3.58 | 3.04 |