Reinforcement Learning from Verifiable Rewards on HEAD-QA
100ARAlways-Act
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Always-Actα=0.20, Model=Med42-8B2026.05 | 100 | 28.5 | 20 | |
| Always-Actα=0.25, Model=Med42-8B2026.05 | 100 | 28.5 | 20 | |
| Always-Actα=0.30, Model=Med42-8B2026.05 | 100 | 28.5 | 7 | |
| ACIα=0.30, Model=Med42-8B2026.05 | 99.9 | 28.4 | 0 | |
| Naive-Tuningα=0.30, Model=Med42-8B2026.05 | 99.9 | 28.4 | 9 | |
| SAOCPα=0.30, Model=Med42-8B2026.05 | 99.8 | 28.4 | 1 | |
| NEX-Confα=0.30, Model=Med42-8B2026.05 | 97 | 27.7 | 1 | |
| SAOCPα=0.25, Model=Med42-8B2026.05 | 93 | 26.1 | 20 | |
| ACIα=0.25, Model=Med42-8B2026.05 | 92.7 | 26 | 20 | |
| CSAα=0.30, Model=Med42-8B2026.05 | 90.9 | 27.2 | 0 | |
| NEX-Confα=0.25, Model=Med42-8B2026.05 | 88.9 | 25.4 | 20 | |
| Naive-Tuningα=0.25, Model=Med42-8B2026.05 | 86.6 | 24.5 | 20 | |
| Naive-Tuningα=0.20, Model=Med42-8B2026.05 | 84.8 | 24 | 20 | |
| SAOCPα=0.20, Model=Med42-8B2026.05 | 84.6 | 24 | 20 | |
| ACIα=0.20, Model=Med42-8B2026.05 | 84.5 | 24 | 20 | |
| NEX-Confα=0.20, Model=Med42-8B2026.05 | 83.9 | 24.1 | 20 | |
| Fixed-Thresholdα=0.20, Model=Med42-8B2026.05 | 82.3 | 24 | 20 | |
| Fixed-Thresholdα=0.25, Model=Med42-8B2026.05 | 82.3 | 24 | 15 | |
| Fixed-Thresholdα=0.30, Model=Med42-8B2026.05 | 82.3 | 24 | 0 | |
| ConfFactα=0.30, Model=Med42-8B2026.05 | 48.6 | 14.2 | 1 | |
| LTTα=0.30, Model=Med42-8B2026.05 | 37.8 | 11 | 0 | |
| CRCα=0.30, Model=Med42-8B2026.05 | 16.5 | 4.8 | 0 | |
| CSAα=0.20, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| CSAα=0.25, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| CRCα=0.20, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| CRCα=0.25, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| ConfFactα=0.20, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| ConfFactα=0.25, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| LTTα=0.20, Model=Med42-8B2026.05 | 0 | 0 | 0 | |
| LTTα=0.25, Model=Med42-8B2026.05 | 0 | 0 | 0 |