Question Answering on OpenBookQA (Metrics Q, Ealign)
95.48Accuracy (Q)CoRA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoRABackbone Model=Ministral 3 8B, Evaluator=GPT-OSS 20B2026.06 | 95.48 | 4.24 | |
| SFTBackbone Model=Ministral 3 8B, Evaluator=GPT-OSS 20B2026.06 | 95.08 | 4.97 | |
| GRPOBackbone Model=Ministral 3 8B, Evaluator=GPT-OSS 20B2026.06 | 94.81 | 5.51 | |
| CoRABackbone Model=Gemma 2 9B, Evaluator=GPT-OSS 20B2026.06 | 93.25 | 6.15 | |
| GRPOBackbone Model=Gemma 2 9B, Evaluator=GPT-OSS 20B2026.06 | 93.1 | 6.59 | |
| CoRABackbone Model=Qwen2.5 7B, Evaluator=GPT-OSS 20B2026.06 | 92.41 | 7.73 | |
| BaseBackbone Model=Gemma 2 9B, Evaluator=GPT-OSS 20B2026.06 | 92.02 | 7.25 | |
| SFTBackbone Model=Gemma 2 9B, Evaluator=GPT-OSS 20B2026.06 | 91.9 | 7.77 | |
| SFTBackbone Model=Qwen2.5 7B, Evaluator=GPT-OSS 20B2026.06 | 91.38 | 8.43 | |
| GRPOBackbone Model=Qwen2.5 7B, Evaluator=GPT-OSS 20B2026.06 | 90.95 | 9.43 | |
| BaseBackbone Model=Qwen2.5 7B, Evaluator=GPT-OSS 20B2026.06 | 90.89 | 9.97 | |
| BaseBackbone Model=Ministral 3 8B, Evaluator=GPT-OSS 20B2026.06 | 82.17 | 5.98 |