Long-Form Generation and Retrieval on HotPotQA full-wiki (test)
50.66AccuracyTextGrad-M
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TextGrad-MOptimization Strategy=Blockwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 50.66 | 74.59 | 2.2 | |
| TextGrad-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 50.53 | 74.12 | 1.73 | |
| TextGradValidation Protocol=w/o val revert, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 49.46 | 72.96 | — | |
| TextGradValidation Protocol=w/ val revert, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 49.06 | 72.39 | — | |
| AdalFlow-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 48.91 | 72.63 | 0.8 | |
| AdalFlowLMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 48.73 | 71.83 | — | |
| GEPALMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 47.6 | 72.11 | — | |
| COPRO-MOptimization Strategy=Blockwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 41.96 | 68.9 | 1.05 | |
| COPRO-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 41.23 | 68.79 | 0.94 | |
| COPROLMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 39.8 | 67.84 | — |