Multi-task Knowledge Evaluation on MMLU-Pro
9.1Accuracy ImprovementUltra-Dense Prompting
Evaluation Results
| Method | Links | |
|---|---|---|
| Ultra-Dense PromptingModel=Gemini 2.0, Prompt Strategy=Ultra-Dense (SDE > 0.80) vs Baseline2026.04 | 9.1 | |
| Ultra-Dense PromptingModel=Claude 3.7, Prompt Strategy=Ultra-Dense (SDE > 0.80) vs Baseline2026.04 | 8.2 | |
| Ultra-Dense PromptingModel=Average across Models, Prompt Strategy=Ultra-Dense (SDE > 0.80) vs Baseline2026.04 | 8 | |
| Ultra-Dense PromptingModel=GPT-4o, Prompt Strategy=Ultra-Dense (SDE > 0.80) vs Baseline2026.04 | 7.9 | |
| Ultra-Dense PromptingModel=GPT-4o-mini, Prompt Strategy=Ultra-Dense (SDE > 0.80) vs Baseline2026.04 | 7 |