Question Answering Utility Evaluation on CAPID (test)
79GPT-4 ScoreLlama-3.1-8B (FT)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Llama-3.1-8B (FT)Training=Fine-tuned, Backbone=Llama-3.1-8B2026.02 | 79 | 73 | |
| Llama-3.1-8B (Ngong et al., 2025)Backbone=Llama-3.1-8B, Source=Ngong et al., 20252026.02 | 51 | 43 |