Travel-Oriented Multi-label Question Answering on KG-generated Travel Domain Dataset
93.31Exact MatchReasoning SFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Reasoning SFTBackbone=Qwen3-4B, SFT Strategy=Reasoning-enhanced (with traces), Learning Rate=5e-52026.06 | 93.31 | 93 | 93 | 93 | |
| Direct SFTBackbone=Qwen3-4B, SFT Strategy=Direct-answer (no reasoning traces), Learning Rate=5e-52026.06 | 76.6 | 77 | 77 | 77 | |
| Pretrained Qwen3-4BBackbone=Qwen3-4B, SFT=None2026.06 | 24.79 | 41 | 37 | 50 |