Question Answering on CSQA (in-domain)
86.8AccuracyFew-shot*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Few-shot*Model=Qwen3-32B2025.09 | 86.8 | — | |
| GRPOBackbone=Qwen3-8B2026.01 | 83.78 | 14.8 | |
| Few-shot*Model=Llama3.1-70B2025.09 | 83.2 | — | |
| ICRModel=Llama3.1-70B2025.09 | 82.4 | — | |
| calibration-aware reinforcement learningBackbone=Qwen3-8B2026.01 | 82.36 | 10.55 | |
| ICRModel=Qwen3-32B2025.09 | 82 | — | |
| GRPOBackbone=Qwen3-4B2026.01 | 81.84 | 16.98 | |
| SFTBackbone=Qwen3-8B2026.01 | 81.33 | 5.96 | |
| BaseBackbone=Qwen3-8B2026.01 | 80.51 | 16.78 | |
| Zero-shotModel=Llama3.1-70B2025.09 | 80.2 | — | |
| calibration-aware reinforcement learningBackbone=Qwen3-4B2026.01 | 79.16 | 12.91 | |
| SFTBackbone=Qwen3-4B2026.01 | 79.12 | 8.81 | |
| BaseBackbone=Qwen3-4B2026.01 | 76.97 | 20.96 | |
| Zero-shotModel=Qwen3-32B2025.09 | 76 | — | |
| FVModel=Llama3.1-70B2025.09 | 75.6 | — | |
| FVModel=Qwen3-32B2025.09 | 75.2 | — | |
| I2CLModel=Qwen3-32B2025.09 | 74.6 | — | |
| I2CLModel=Llama3.1-70B2025.09 | 73.8 | — | |
| calibration-aware reinforcement learningBackbone=Qwen3-1.7B2026.01 | 73.73 | 15.97 | |
| GRPOBackbone=Qwen3-1.7B2026.01 | 73.67 | 24.39 | |
| SFTBackbone=Qwen3-1.7B2026.01 | 68.55 | 7.36 | |
| BaseBackbone=Qwen3-1.7B2026.01 | 67.49 | 29.91 |