Premise Generation on Rule Distillation Dataset LLM evaluation 1.0
2.77AccuracyGPT-4
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4Prompting=Symbolic and verbalized responses2024.02 | 2.77 | 2.64 | 1.4 | 2.32 | |
| EngineBackbone=Mistral-7b, Fine-tuned=true2024.02 | 2.34 | 1.89 | 1.62 | 2.43 | |
| GPT-3.5-TurboPrompting=Symbolic and verbalized responses2024.02 | 1.91 | 1.72 | 1.06 | 2.3 |