Question Answering on Overall
77.1AccuracyPPA-Plan
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PPA-PlanLLM Model=Qwen-2.5-14B2026.01 | 77.1 | 61.1 | 54.9 | |
| CoTLLM Model=GPT-4o mini2026.01 | 74.5 | 61.3 | 42 | |
| PPA-PlanLLM Model=GPT-4o mini2026.01 | 74.1 | 62.6 | 55.8 | |
| CoTLLM Model=Qwen-2.5-14B2026.01 | 72.8 | 57.9 | 34.7 | |
| PPA-PlanLLM Model=Llama-3.1-8B2026.01 | 72.6 | 61.2 | 70 | |
| GQALLM Model=GPT-4o mini2026.01 | 71.4 | 60.6 | 34.8 | |
| PEARLLLM Model=Qwen-2.5-14B2026.01 | 71.4 | 57.7 | 51.6 | |
| GQALLM Model=Qwen-2.5-14B2026.01 | 71.3 | 56.8 | 28.5 | |
| PSLLM Model=GPT-4o mini2026.01 | 71.2 | 58.2 | 38.9 | |
| PEARLLLM Model=GPT-4o mini2026.01 | 70.8 | 60.6 | 53.6 | |
| PSLLM Model=Qwen-2.5-14B2026.01 | 70.7 | 55.3 | 32.6 | |
| CoTLLM Model=Llama-3.1-8B2026.01 | 68.7 | 54.1 | 30.6 | |
| GQALLM Model=Llama-3.1-8B2026.01 | 68.5 | 55.3 | 28.3 | |
| PEARLLLM Model=Llama-3.1-8B2026.01 | 68.1 | 58.1 | 68.9 | |
| PSLLM Model=Llama-3.1-8B2026.01 | 65.3 | 48.4 | 28 |