Effect-size forecasting on AidGrade aggregated meta analysis benchmark (out-of-domain)
0.148RMSESynthetic-RCT(GPT-5.2) → ModernBERTr
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Synthetic-RCT(GPT-5.2) → ModernBERTrEvaluation Protocol=Supervised, Generator=GPT-5.2, Encoder=ModernBERTr2026.05 | 0.148 | 0.1055 | -0.1332 | 0.2532 | 0.2039 | 85.72 | 54.8 | 70.22 | |
| Synthetic-RCT(GPT-OSS-20B) → ModernBERTrEvaluation Protocol=Supervised, Generator=GPT-OSS-20B, Encoder=ModernBERTr2026.05 | 0.152 | 0.1026 | -0.1222 | 0.2233 | 0.1839 | 84.72 | 52.78 | 69.44 | |
| ModernBERTqEvaluation Protocol=Supervised2026.05 | 0.1872 | 0.128 | -1.7377 | -0.0296 | -0.0806 | 71.08 | 51.7 | 66.23 | |
| GPT-5.2Evaluation Protocol=Prompted2026.05 | 0.249 | 0.1688 | -1.887 | -0.1369 | -0.0765 | 75.68 | 52.7 | 50 | |
| Gemini 2.5 FlashEvaluation Protocol=Prompted2026.05 | 0.4001 | 0.3333 | -6.4528 | -0.1066 | -0.0341 | 74.32 | 48.65 | 28.38 | |
| GPT-OSS 120BEvaluation Protocol=Prompted2026.05 | 0.426 | 0.3436 | -7.4519 | -0.1618 | -0.1335 | 74.32 | 50 | 33.78 |