Fault-recognition on FaultyScience
67.8AccuracyDeIllusionLLM
Evaluation Results
| Method | Links | |
|---|---|---|
| DeIllusionLLMDistillation source=Qwen2.5-72B, Backbone model=Qwen2.5-72B, Prompting protocol=natural prompting2026.03 | 67.8 | |
| DeIllusionLLMDistillation source=GPT-4, Backbone model=Qwen2.5-72B, Prompting protocol=natural prompting2026.03 | 42.7 | |
| GPT-4Prompting protocol=natural prompting2026.03 | 34.9 | |
| Llama3.3 70BPrompting protocol=natural prompting2026.03 | 14 | |
| Qwen2.5-72BPrompting protocol=natural prompting2026.03 | 10.8 | |
| Mixtral-8x7BPrompting protocol=natural prompting2026.03 | 10.2 |