Causal Judgment on BIG-Bench Hard
69.5AccuracyGPT-4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-42026.03 | 69.5 | |
| DeIllusionLLMDistillation source=GPT-4, Backbone model=Qwen2.5-72B2026.03 | 68.98 | |
| Qwen2.5-72B2026.03 | 42.78 | |
| DeIllusionLLMDistillation source=Qwen2.5-72B, Backbone model=Qwen2.5-72B2026.03 | 41.71 | |
| Llama3.3 70B2026.03 | 17.11 | |
| Mixtral-8x7B2026.03 | 16.58 |