Question Answering Utility Evaluation on Reddit (test)
0.8GPT-4 ScoreLlama-3.1-8B (FT)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Llama-3.1-8B (FT)Training=Fine-tuned, Backbone=Llama-3.1-8B2026.02 | 0.8 | 0.79 | |
| Llama-3.1-8B (Ngong et al., 2025)Backbone=Llama-3.1-8B, Source=Ngong et al., 20252026.02 | 0.58 | 0.48 |