Question Answering on MMLU (Machine Learning subset, test split)
88.4AccuracyTEXTGRAD
Evaluation Results
| Method | Links | |
|---|---|---|
| TEXTGRADMode=Zero-shot, Model=gpt-4o2024.06 | 88.4 | |
| CoTMode=Zero-shot, Model=gpt-4o2024.06 | 85.7 | |
| LLM-based QA agent with external memoryModel Backend=GPT 5.4 Mini, Access Type=Closed-source2026.06 | 85.16 | |
| LLM-based QA agent with external memoryModel Backend=GPT-4o Mini, Access Type=Closed-source2026.06 | 70.31 | |
| LLM-based QA agent with external memoryModel Backend=Gemma2-9B, Access Type=Open-source2026.06 | 56.25 | |
| LLM-based QA agent with external memoryModel Backend=Phi3-14B, Access Type=Open-source2026.06 | 53.91 |