Multi-task Evaluation on Aggregate (HealthQA, ARC-C, PopQA, Squad1, ASQA)
62.8Average ScoreAMATA 8B
Evaluation Results
| Method | Links | |
|---|---|---|
| AMATA 8BModel Scale=8B, Backbone Architecture=AMATA2026.05 | 62.8 | |
| GiGPO 8BModel Scale=8B, Backbone Architecture=GiGPO2026.05 | 60.1 | |
| SPA-RL 8BModel Scale=8B, Backbone Architecture=SPA-RL2026.05 | 59.76 | |
| SMART 8BModel Scale=8B, Backbone Architecture=SMART2026.05 | 59.29 | |
| SelfRag 8BModel Scale=8B, Backbone Architecture=Self-RAG2026.05 | 51.81 | |
| GPT4oBackbone Architecture=GPT-4o2026.05 | 49.17 | |
| Llama-3-Ins.8BModel Scale=8B, Backbone Architecture=Llama-3-Ins2026.05 | 35.25 | |
| RADIT 8BModel Scale=8B, Backbone Architecture=RADIT2026.05 | 35.2 |