Question Answering on MMLU (ACC, LEN, Ratio evaluation)
83.7AccuracyLinUCB
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LinUCBAlgorithm Family=Contextual Linear2026.02 | 83.7 | — | — | |
| SFTBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 79.2 | 1,338.5 | 85.3 | |
| BaselineBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 78.97 | 1,365.8 | 85.2 | |
| DiPOBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 78.79 | 534.3 | 92.3 | |
| DPOBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 78.64 | 1,381 | 85.3 | |
| TALE-EPBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 77.7 | 744.1 | 90.9 | |
| CoDBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 75.54 | 777.6 | 92.9 | |
| No-RewriteAlgorithm Family=Base2026.02 | 74.4 | — | — | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 65.62 | 2,468 | — | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 65.27 | 1,858 | — | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 64.16 | 835 | — | |
| L1-MaxBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 64.02 | 983 | — | |
| L1-ExactBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 63.77 | 2,834 | — | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 63.72 | 822 | — | |
| TrEffBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 63.17 | 1,077 | — | |
| L1-MaxBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 49.29 | 2,219 | — | |
| L1-ExactBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 48.64 | 5,373 | — | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 46.78 | 760 | — | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 46.72 | 1,592 | — | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 46.43 | 2,549 | — | |
| TrEffBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 44.8 | 1,201 | — |