Reward Prediction on Human preference annotation (test)
30EffortQwen2.5-7B-Instr.
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen2.5-7B-Instr.Checkpoint=Original2026.01 | 30 | 26 | 28 | 28 | |
| GPT-4.1Checkpoint=Zero Shot2026.01 | 44 | 22 | 30 | 32 | |
| gpt-oss-20bCheckpoint=SFT2026.01 | 44 | 32 | 35 | 37 | |
| GPT-4.1Checkpoint=SFT2026.01 | 52 | 25 | 31 | 36 | |
| GPT-5Checkpoint=Zero Shot2026.01 | 56 | 54 | 49 | 53 | |
| Gemini 2.5 FlashCheckpoint=Zero Shot2026.01 | 57 | 25 | 29 | 37 | |
| Gemini 2.5 FlashCheckpoint=SFT2026.01 | 61 | 53 | 45 | 53 | |
| IntelliReward2026.01 | 70 | 76 | 70 | 72 |