Question Answering on OBQA (out-of-domain)
95.59Acccalibration-aware reinforcement learning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| calibration-aware reinforcement learningBackbone=Qwen3-8B2026.01 | 95.59 | 1.83 | |
| GRPOBackbone=Qwen3-8B2026.01 | 94.39 | 4.88 | |
| calibration-aware reinforcement learningBackbone=Qwen3-4B2026.01 | 93.7 | 1.91 | |
| GRPOBackbone=Qwen3-4B2026.01 | 92.79 | 6.74 | |
| SFTBackbone=Qwen3-8B2026.01 | 91.8 | 4.29 | |
| BaseBackbone=Qwen3-8B2026.01 | 91.6 | 7.22 | |
| SFTBackbone=Qwen3-4B2026.01 | 89.8 | 4.76 | |
| BaseBackbone=Qwen3-4B2026.01 | 88.4 | 10.67 | |
| calibration-aware reinforcement learningBackbone=Qwen3-1.7B2026.01 | 88.33 | 5.27 | |
| GRPOBackbone=Qwen3-1.7B2026.01 | 86.17 | 11.52 | |
| SFTBackbone=Qwen3-1.7B2026.01 | 79.2 | 4.6 | |
| BaseBackbone=Qwen3-1.7B2026.01 | 78.8 | 18.97 |