Question Answering Accuracy on 2WikiMultiHopQA
46.2AccuracyFE-SFT & FC-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| FE-SFT & FC-RLBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 46.2 | |
| IWM & RLBackbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 46 | |
| SFT & RLBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 46 | |
| SFT & RL*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 45 | |
| FE-SFT & RLBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 44.4 | |
| State-SFT & RL‡Backbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=RL stage2026.06 | 42.2 | |
| FE-SFT & RL*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 42 | |
| State-SFT & RL†Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=RL stage2026.06 | 40.8 | |
| FE-SFTBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=SFT stage2026.06 | 35.8 | |
| SFTBackbone=Youtu-LLM-2B-Base, Framework=WM-AMT, Optimization Stage=SFT stage2026.06 | 31.2 | |
| IWMBackbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=SFT stage2026.06 | 28.8 | |
| FE-SFT*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=SFT stage2026.06 | 27.2 | |
| SFT*Backbone=Youtu-LLM-2B-Base, Framework=Standard, Optimization Stage=SFT stage2026.06 | 26.4 |