Question Answering on HotpotQA (EM, F1, LLM)
2.41Exact Match (EM)MBT-S
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MBT-SModel=Qwen3 0.6B2026.02 | 2.41 | 1.71 | 0.97 | |
| MBT-RModel=Qwen3 0.6B2026.02 | 2.01 | 1.33 | 0.6 | |
| MBT-SModel=Qwen3 4B2026.02 | 1.28 | 0.96 | 0.24 | |
| MBT-SModel=Qwen3 1.7B2026.02 | 1.27 | 1.04 | 0.8 | |
| MBT-RModel=Qwen3 4B2026.02 | 0.92 | 0.62 | -0.09 | |
| MBT-RModel=Qwen3 1.7B2026.02 | 0.86 | 0.65 | 0.43 | |
| GRPOModel=Qwen3 4B2026.02 | 0.54 | 0.34 | -0.3 | |
| GRPOModel=Qwen3 1.7B2026.02 | 0.44 | 0.33 | 0.23 | |
| gpt-oss-distillModel=Qwen3 4B2026.02 | 0.21 | -0.04 | -0.71 | |
| GRPOModel=Qwen3 0.6B2026.02 | 0.14 | -0.35 | -0.92 | |
| RSModel=Qwen3 0.6B2026.02 | 0.03 | 0.01 | -0.02 | |
| RSModel=Qwen3 1.7B2026.02 | 0.02 | 0 | -0.01 | |
| BaseModel=Qwen3 0.6B2026.02 | 0 | 0 | 0 | |
| BaseModel=Qwen3 1.7B2026.02 | 0 | 0 | 0 | |
| BaseModel=Qwen3 4B2026.02 | 0 | 0 | 0 | |
| PromptModel=Qwen3 4B2026.02 | 0 | -0.03 | -0.03 | |
| PromptModel=Qwen3 0.6B2026.02 | -0.29 | -0.25 | -0.09 | |
| gpt-oss-distillModel=Qwen3 0.6B2026.02 | -0.34 | -0.99 | -1.67 | |
| LIMOProModel=Qwen3 0.6B2026.02 | -0.34 | -0.39 | -0.39 | |
| RSModel=Qwen3 4B2026.02 | -0.74 | -0.75 | -0.76 | |
| LIMOProModel=Qwen3 4B2026.02 | -0.74 | -0.56 | -0.64 | |
| TokenSkipModel=Qwen3 0.6B2026.02 | -0.82 | -0.92 | -1.02 | |
| PromptModel=Qwen3 1.7B2026.02 | -0.86 | -0.62 | 0.14 | |
| gpt-oss-distillModel=Qwen3 1.7B2026.02 | -1.09 | -1.26 | -1.44 | |
| LIMOProModel=Qwen3 1.7B2026.02 | -1.3 | -0.99 | -0.62 | |
| TokenSkipModel=Qwen3 4B2026.02 | -1.47 | -1.47 | -1.53 | |
| TokenSkipModel=Qwen3 1.7B2026.02 | -1.89 | -1.95 | -1.99 |