Conversational response generation on MD2Dial
31.2F1 ScoreChatR1-7b
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ChatR1-7bRAG=RAG, LLM=Qwen-7b, Training Strategy=Supervised Fine-tuning or RL Training2025.10 | 31.2 | 84.5 | |
| ChatR1 (w/o Rint.)RAG=RAG, LLM=Qwen-3b, Training Strategy=Supervised Fine-tuning or RL Training2025.10 | 26.4 | 77.4 | |
| ChatR1-3bRAG=RAG, LLM=Qwen-3b, Training Strategy=Supervised Fine-tuning or RL Training2025.10 | 26 | 83.1 | |
| SFTRAG=No, LLM=Qwen-3b, Training Strategy=Supervised Fine-tuning or RL Training2025.10 | 25.4 | 84.2 | |
| QR Search R1RAG=RAG, LLM=Qwen-3b, Training Strategy=Supervised Fine-tuning or RL Training2025.10 | 23.1 | 82.1 | |
| ChatGPT (DI)RAG=No, LLM=GPT-3.5, Training Strategy=Zero-Shot2025.10 | 21.6 | 81.7 | |
| Qwen-Instr. (RAG)RAG=RAG, LLM=Qwen-3b, Training Strategy=Zero-Shot2025.10 | 18.8 | 75.1 | |
| CoT R1RAG=No, LLM=Qwen-3b, Training Strategy=Supervised Fine-tuning or RL Training2025.10 | 18 | 80.2 | |
| IRCoTRAG=RAG, LLM=Qwen-3b, Training Strategy=Zero-Shot2025.10 | 13.3 | 67.5 | |
| Qwen-Instr. (DI)RAG=No, LLM=Qwen-3b, Training Strategy=Zero-Shot2025.10 | 13.2 | 64.4 | |
| Qwen-Instr. (CoT)RAG=No, LLM=Qwen-3b, Training Strategy=Zero-Shot2025.10 | 10.5 | 63.6 |