Premise Completion on Rule Distillation Dataset LLM evaluation 1.0
2.78AccuracyEngine
Evaluation Results
| Method | Links | |
|---|---|---|
| EngineBackbone=Mistral-7b, Fine-tuned=true2024.02 | 2.78 | |
| GPT-4Prompting=Symbolic and verbalized responses2024.02 | 2.72 | |
| GPT-3.5-TurboPrompting=Symbolic and verbalized responses2024.02 | 1.57 |