Question Answering on LAST
72.17AccuracyDiPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DiPOBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 72.17 | 2,979.1 | 0.767 | |
| DPOBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 71.3 | 5,205.9 | 0.658 | |
| CoDBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 70 | 3,828.6 | 0.745 | |
| SFTBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 69.57 | 5,181.8 | 0.656 | |
| BaselineBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 67.83 | 5,250.8 | 0.617 | |
| TALE-EPBackbone Model=Qwen3-4B, Temperature=constant, Maximum context length=8K tokens2026.01 | 64.35 | 4,415.9 | 0.716 |