Multi-step interaction on 20Q
32.1WinrateNLAC
Evaluation Results
| Method | Links | |
|---|---|---|
| NLACParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 32.1 | |
| NLRLParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 31.8 | |
| NLQLParadigm=Fine-tuning, Base Model=QwQ-32B, Notes=ablation2025.12 | 31.4 | |
| ReActParadigm=Prompting, Base Model=GPT52025.12 | 30.2 | |
| Self-DistillationParadigm=Fine-tuning, Base Model=QwQ-32B, Notes=ablation2025.12 | 26.8 | |
| NLACParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 26 | |
| NLRLParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 25.8 | |
| GRPOParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 25.6 | |
| NLQLParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct, Notes=ablation2025.12 | 24.2 | |
| PPOParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 24 | |
| RFTParadigm=Fine-tuning, Base Model=QwQ-32B2025.12 | 22 | |
| GRPOParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 18.4 | |
| PPOParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 17.2 | |
| RFTParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct2025.12 | 12.6 | |
| Self-DistillationParadigm=Fine-tuning, Base Model=Qwen2.5-7B-Instruct, Notes=ablation2025.12 | 12.4 |