Conclusion Generation on Rule Distillation Dataset LLM evaluation 1.0
2.53AccuracyGPT-4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4Prompting=Symbolic and verbalized responses2024.02 | 2.53 | |
| EngineBackbone=Mistral-7b, Fine-tuned=true2024.02 | 2.44 | |
| GPT-3.5-TurboPrompting=Symbolic and verbalized responses2024.02 | 2.38 |