Question Answering on OpenAI (in-domain)
0.8956Accuracycalibration-aware reinforcement learning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| calibration-aware reinforcement learningBackbone=Qwen3-4B2026.01 | 0.8956 | 0.0711 | |
| GRPOBackbone=Qwen3-4B2026.01 | 0.8898 | 0.11 | |
| GRPOBackbone=Qwen3-8B2026.01 | 0.8881 | 0.1068 | |
| calibration-aware reinforcement learningBackbone=Qwen3-1.7B2026.01 | 0.8855 | 0.0867 | |
| calibration-aware reinforcement learningBackbone=Qwen3-8B2026.01 | 0.8847 | 0.0711 | |
| SFTBackbone=Qwen3-8B2026.01 | 0.8808 | 0.0391 | |
| GRPOBackbone=Qwen3-1.7B2026.01 | 0.878 | 0.122 | |
| SFTBackbone=Qwen3-4B2026.01 | 0.8754 | 0.0526 | |
| SFTBackbone=Qwen3-1.7B2026.01 | 0.8373 | 0.0352 | |
| BaseBackbone=Qwen3-1.7B2026.01 | 0.822 | 0.1617 | |
| BaseBackbone=Qwen3-8B2026.01 | 0.8178 | 0.1733 | |
| BaseBackbone=Qwen3-4B2026.01 | 0.7407 | 0.2429 |