Meta-evaluation on Overall Average
9.7Accuracy ImprovementUltra-Dense Prompting
Evaluation Results
| Method | Links | |
|---|---|---|
| Ultra-Dense PromptingModel=Gemini 2.02026.04 | 9.7 | |
| Ultra-Dense PromptingModel=Claude 3.72026.04 | 8.6 | |
| Ultra-Dense PromptingModel=Average across Models2026.04 | 8.4 | |
| Ultra-Dense PromptingModel=GPT-4o2026.04 | 7.9 | |
| Ultra-Dense PromptingModel=GPT-4o-mini2026.04 | 7.3 |