Question Answering on DROP (test)
76.78ROUGEP2S
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| P2STraining Paradigm=Proposed Framework2026.01 | 76.78 | 69.11 | 72.14 | 70.85 | 70.7 | — | — | |
| RLPRTraining Paradigm=RLPR methods2026.01 | 75.48 | 67.18 | 68.04 | 67.57 | 67.6 | — | — | |
| SFT+GRPOTraining Paradigm=Fine-tuning and RL methods2026.01 | 75.28 | 66.5 | 70.14 | 68.55 | 68.4 | — | — | |
| DROTraining Paradigm=RLPR methods2026.01 | 74.85 | 66.28 | 67.17 | 66.65 | 66.7 | — | — | |
| General ReasonerTraining Paradigm=Fine-tuning and RL methods2026.01 | 73.03 | 67.89 | 65.32 | 66.3 | 66.5 | — | — | |
| VeriFreeTraining Paradigm=RLPR methods2026.01 | 71.98 | 64.42 | 62.17 | 63.4 | 63.33 | — | — | |
| Full-SftTraining Paradigm=Fine-tuning and RL methods2026.01 | 71.44 | 66 | 64.5 | 63.42 | 64.64 | — | — | |
| GRPOTraining Paradigm=Fine-tuning and RL methods2026.01 | 70.89 | 60 | 62.25 | 62.12 | 61.46 | — | — | |
| GRPO+SFT-lossTraining Paradigm=Fine-tuning and RL methods2026.01 | 66.18 | 59.5 | 63 | 58.9 | 60.47 | — | — | |
| Self-ConsistencyTraining Paradigm=Prompt-Based2026.01 | 45.51 | 51.17 | 52.67 | 52.35 | 52.06 | — | — | |
| Qwen2.5-1.5B-InstructTraining Paradigm=Base Model2026.01 | 42.23 | 51.67 | 50.75 | 49.15 | 50.52 | — | — | |
| COTTraining Paradigm=Prompt-Based2026.01 | 41.97 | 45.33 | 49 | 48.85 | 47.73 | — | — | |
| AFlowBackbone LLM=GPT-4o-mini, Validation budget=502026.03 | — | — | — | — | — | — | 79.48 | |
| CoTBackbone LLM=GPT-4o-mini2026.03 | — | — | — | — | — | — | 58.27 | |
| InstinctBackbone LLM=GPT-4o-mini, Validation budget=502026.03 | — | — | — | — | — | — | 71.9 | |
| IOBackbone LLM=GPT-4o-mini2026.03 | — | — | — | — | — | — | 53.09 | |
| MASPOBBackbone LLM=GPT-4o-mini, Validation budget=502026.03 | — | — | — | — | — | — | 82.28 | |
| MIPROBackbone LLM=GPT-4o-mini, Validation budget=502026.03 | — | — | — | — | — | — | 79.13 | |
| NRT-WS (-log p)Backbone=Llama-3.1-8B-Base2026.02 | — | — | — | — | — | 52.2 | — | |
| PromptBreederBackbone LLM=GPT-4o-mini, Validation budget=502026.03 | — | — | — | — | — | — | 71.85 | |
| ReActBackbone LLM=GPT-4o-mini2026.03 | — | — | — | — | — | — | 67.25 |