Citation-aware Question Answering on ALCE ASQA
43.1EM RecallFineRef
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FineRefBase Model=Mistral-Orca-7B2025.11 | 43.1 | 41 | 84.1 | 36.5 | 84.9 | |
| CaLFBase Model=Mistral-Orca-7B2025.11 | 41.7 | 40.3 | 84 | 34.5 | 81.5 | |
| GPT-4Model Version=gpt-4-06132025.11 | 41.3 | — | 67.1 | — | 71.9 | |
| AGREEBase Model=PaLM 22025.11 | 40.9 | — | — | — | 75.1 | |
| ChatGPTModel Version=gpt-3.5-turbo-03012025.11 | 40.4 | — | 66.6 | — | 73.1 | |
| FineRefBase Model=LLaMA2-7B-chat2025.11 | 40.3 | 38.5 | 85.2 | 32.1 | 74.9 | |
| Mistral-Orca-7BProtocol=In-context2025.11 | 40.2 | 38.7 | 54.7 | 31.9 | 55.6 | |
| Mistral-Orca-7BProtocol=Few-shot FT2025.11 | 38.4 | 38.4 | 78.6 | 29.9 | 62.6 | |
| CaLFBase Model=LLaMA2-7B-chat2025.11 | 37.7 | 37.8 | 86 | 29.3 | 70.4 | |
| LLaMA2-7B-chatProtocol=In-context2025.11 | 35 | 35.9 | 77.8 | 25.7 | 49.9 | |
| Blueprint (BP)Base Model=T5-3B2025.11 | 33.8 | — | — | — | 77.8 | |
| LLaMA2-7B-chatProtocol=Few-shot FT2025.11 | 32 | 34.9 | 69.2 | 22.3 | 55 | |
| Self-RAG 7BBase Model=Llama22025.11 | 30 | 35.7 | 74.3 | — | 67.3 |