Question Answering on ConditionalQA
85.3AccuracyPEARL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PEARLLLM Model=GPT-4o mini2026.01 | 85.3 | 53.2 | |
| CoTLLM Model=GPT-4o mini2026.01 | 85.1 | 46.5 | |
| PPA-PlanLLM Model=Qwen-2.5-14B2026.01 | 83.9 | 54.8 | |
| CoTLLM Model=Qwen-2.5-14B2026.01 | 83.1 | 36.7 | |
| CoTLLM Model=Llama-3.1-8B2026.01 | 82.2 | 39.6 | |
| PSLLM Model=Qwen-2.5-14B2026.01 | 81.5 | 33.9 | |
| PEARLLLM Model=Qwen-2.5-14B2026.01 | 81.4 | 56.1 | |
| PPA-PlanLLM Model=GPT-4o mini2026.01 | 81.3 | 50.3 | |
| PSLLM Model=GPT-4o mini2026.01 | 81.1 | 42.2 | |
| PSLLM Model=Llama-3.1-8B2026.01 | 80.8 | 25.7 | |
| GQALLM Model=GPT-4o mini2026.01 | 80.7 | 27.2 | |
| PEARLLLM Model=Llama-3.1-8B2026.01 | 80.1 | 75.9 | |
| PPA-PlanLLM Model=Llama-3.1-8B2026.01 | 79.1 | 75.9 | |
| GQALLM Model=Qwen-2.5-14B2026.01 | 78.9 | 17.8 | |
| GQALLM Model=Llama-3.1-8B2026.01 | 77.7 | 21.4 |