Reasoning on AGIEval
48.88AGIEval Reasoning AccuracyQ-Opt + P-Opt
Evaluation Results
| Method | Links | |
|---|---|---|
| Q-Opt + P-OptImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 48.88 | |
| Q + P-OptImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 47.39 | |
| Q-Opt + CoTImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 46.96 | |
| PE2Implementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 46.78 | |
| Q-OptImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 46.09 | |
| No PromptImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 45.65 | |
| MARSImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 45.33 | |
| CoTImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 45.22 | |
| OPROImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 44.35 | |
| APEImplementation Model=Gemini-2.5-Pro, Target LLM=Gemini-2.0-Flash2026.03 | 43.44 |