Reward Modeling on Tutoring Dialogue Human Preference (test)
90Accuracy (%)PEARL-RM
Evaluation Results
| Method | Links | |
|---|---|---|
| PEARL-RM2026.05 | 90 | |
| GPT-5.12026.05 | 88 | |
| Gemini-3-Flash2026.05 | 88 | |
| Qwen3-235B-A22B2026.05 | 86 | |
| Qwen3-32B2026.05 | 69 | |
| MathTutorBench RM2026.05 | 55 | |
| InnoSpark-HPC-RM-32B2026.05 | 54 |