Reward Scoring on NB-curated (evaluation set)
33.64Mean Reward ScoreTOMPA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TOMPAReward Model=Llama-3.1-8B RM (RewardBench2 #1)2026.04 | 33.64 | 32.16 | 35.01 | 98 | |
| Gold Answer (GPT-5)Reward Model=Llama-3.1-8B RM (RewardBench2 #1)2026.04 | 17.48 | — | — | — | |
| TOMPAReward Model=Qwen3-8B RM (RewardBench2 #6)2026.04 | 16.86 | 15.86 | 17.78 | 98 | |
| Gold Answer (GPT-5)Reward Model=Qwen3-8B RM (RewardBench2 #6)2026.04 | 8.12 | — | — | — | |
| Random OODReward Model=Qwen3-8B RM (RewardBench2 #6)2026.04 | 7.94 | 9.05 | 6.87 | 1 | |
| Random OODReward Model=Llama-3.1-8B RM (RewardBench2 #1)2026.04 | 3.42 | 4.16 | 2.33 | 0 |