Travel-Oriented Multi-label Question Answering on KG-generated Travel Domain Overall n=888 (val)
0.8243EMReasoning SFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Reasoning SFTBackbone=Qwen3-4B, SFT Strategy=Reasoning-enhanced (with traces), Learning Rate=5e-52026.06 | 0.8243 | 0.9 | 0.89 | 0.92 | |
| Direct SFTBackbone=Qwen3-4B, SFT Strategy=Direct-answer (no reasoning traces), Learning Rate=5e-52026.06 | 0.6599 | 0.73 | 0.72 | 0.74 | |
| Pretrained Qwen3-4BBackbone=Qwen3-4B, SFT=None2026.06 | 0.2241 | 0.42 | 0.39 | 0.5 |