Cross-format Reasoning on Multi-format Evaluation Set MCQ, TF, FIB, OPEN
90.11Pass@4Full-Format
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Full-FormatModel Architecture=Llama-3.1-8B, SFT Strategy=Full-Format2026.06 | 90.11 | 13.44 | 14.92 | |
| Targeted 20%Model Architecture=Llama-3.1-8B, SFT Strategy=Targeted-FormatMix, Expansion Ratio=20%2026.06 | 89.9 | 12.68 | 14.1 | |
| Random 30%Model Architecture=Llama-3.1-8B, SFT Strategy=Random-FormatMix, Expansion Ratio=30%2026.06 | 88.97 | 13.02 | 14.63 | |
| Random 20%Model Architecture=Llama-3.1-8B, SFT Strategy=Random-FormatMix, Expansion Ratio=20%2026.06 | 87.83 | 12.21 | 13.91 | |
| Targeted 10%Model Architecture=Llama-3.1-8B, SFT Strategy=Targeted-FormatMix, Expansion Ratio=10%2026.06 | 87.24 | 12 | 13.76 | |
| Random 10%Model Architecture=Llama-3.1-8B, SFT Strategy=Random-FormatMix, Expansion Ratio=10%2026.06 | 85.88 | 11.62 | 13.53 | |
| Targeted 30%Model Architecture=Llama-3.1-8B, SFT Strategy=Targeted-FormatMix, Expansion Ratio=30%2026.06 | 85 | 11.92 | 14.02 | |
| MCQ-MatchedModel Architecture=Llama-3.1-8B, SFT Strategy=MCQ-Matched2026.06 | 75.02 | 6.8 | 9.07 | |
| Llama-3.1-70B (ref.)Model Architecture=Llama-3.1-70B2026.06 | 74.01 | 15.34 | 20.73 | |
| Baseline (Llama-3.1-8B)Model Architecture=Llama-3.1-8B, SFT Strategy=Baseline2026.06 | 67.13 | 6.69 | 9.96 |