Reasoning on BIG-Bench Hard MIX-14K
69.9AccuracyDDRO
Evaluation Results
| Method | Links | |
|---|---|---|
| DDROModel=Llama-8B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 69.9 | |
| RDROModel=Llama-8B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 69.4 | |
| KTOModel=Llama-8B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 66.8 | |
| RDROModel=Llama-3B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 55.3 | |
| DDROModel=Llama-3B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 55.2 | |
| KTOModel=Llama-3B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 53.8 | |
| RDROModel=Qwen-1.5B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 28.4 | |
| DDROModel=Qwen-1.5B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 27.5 | |
| KTOModel=Qwen-1.5B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 24.3 | |
| KTOModel=Qwen-3B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 1.7 | |
| DDROModel=Qwen-3B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 1.5 | |
| RDROModel=Qwen-3B, Evaluation Protocol=3-shot, Training Dataset=MIX-14K2026.04 | 1.4 |