Slide Generation on AeSlides 7k (eval)
0Render ErrorClaude-Sonnet-4.5
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude-Sonnet-4.5Model Category=Proprietary Models2026.04 | 0 | 14 | 32 | 3.4 | 9.7 | 1.319 | 4.538 | 4.121 | 3.442 | |
| Visual GPT-5-nano RewardModel Category=Methodological Variants, Reward Formulation=Model-based reward, Reward Model=GPT-5-nano, Reward Input Modality=Visual slides, Base Model=GLM-4.7-Flash2026.04 | 0 | 25 | 37 | 10 | 16.7 | 1.914 | 4.234 | 3.932 | — | |
| Visual GPT-5-mini RewardModel Category=Methodological Variants, Reward Formulation=Model-based reward, Reward Model=GPT-5-mini, Reward Input Modality=Visual slides, Base Model=GLM-4.7-Flash2026.04 | 0 | 28 | 45 | 4.9 | 10.6 | 1.472 | 4.754 | 4.033 | 3.354 | |
| AeSlides (+ Verifiable Rewards)Model Category=Methodological Variants, Reward Formulation=Verifiable rewards, Base Model=GLM-4.7-Flash2026.04 | 0 | 64 | 75 | 3.2 | 8.7 | 1.071 | 4.729 | 4.042 | 3.435 | |
| AeSlides (+ Verifiable Rewards w/ GDPO)Model Category=Methodological Variants, Reward Formulation=Verifiable rewards, Optimization Algorithm=GDPO, Base Model=GLM-4.7-Flash2026.04 | 0 | 76 | 85 | 3.3 | 7.2 | 1.111 | 4.771 | 4.058 | 3.561 | |
| GLM-4.7-FlashModel Category=Base Model2026.04 | 0.78 | 24 | 36 | 5.9 | 12.6 | 1.545 | 4.654 | 3.988 | 3.314 | |
| Static GPT-5-mini RewardModel Category=Methodological Variants, Reward Formulation=Model-based reward, Reward Model=GPT-5-mini, Reward Input Modality=Static HTML, Base Model=GLM-4.7-Flash2026.04 | 0.87 | 51 | 64 | 5.3 | 16.1 | 1.754 | 4.638 | 4.018 | 3.308 | |
| Static GPT-5-nano RewardModel Category=Methodological Variants, Reward Formulation=Model-based reward, Reward Model=GPT-5-nano, Reward Input Modality=Static HTML, Base Model=GLM-4.7-Flash2026.04 | 1.07 | 39 | 55 | 8.4 | 14.6 | 1.921 | 4.117 | 3.92 | — | |
| GPT-5.2Model Category=Proprietary Models2026.04 | 1.65 | 10 | 26 | 3.9 | 25.4 | 1.322 | 4.454 | 4.154 | 3.076 | |
| DeepPresenter w/ heavy reflectionModel Category=Methodological Variants, Reflection Strategy=Agentic reflection, Base Model=GLM-4.7-Flash2026.04 | 1.74 | 27 | 41 | 7 | 21.2 | 2.17 | 4.396 | 3.875 | 3.107 |