Question Answering on TriviaQA DPR
72.6EMGPT-4-0613
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4-0613Model Family=OpenAI GPT2024.07 | 72.6 | 85.1 | |
| RankRAGBackbone=Llama-3, Model size=70B2024.07 | 72.6 | 82.9 | |
| RankRAGBackbone=Llama-2, Model size=70B2024.07 | 72.3 | 82.6 | |
| GPT-3.5-0613Model Family=OpenAI GPT2024.07 | 70.1 | 81.3 | |
| ChatQA-1.0Backbone=Llama-2, Model size=70B2024.07 | 69.8 | 80.2 | |
| RankRAGBackbone=Llama-2, Model size=13B2024.07 | 69.5 | 80 | |
| ChatQA-1.5Backbone=Llama-3, Model size=70B2024.07 | 69 | 80.4 | |
| RankRAGBackbone=Llama-3, Model size=8B2024.07 | 68.8 | 79.9 | |
| RankRAGBackbone=Llama-2, Model size=7B2024.07 | 68.3 | 78.9 | |
| GPT-4-turbo-2024-0409Model Family=OpenAI GPT2024.07 | 68 | 84.5 | |
| Llama-3-InstructBackbone=Llama-3, Model size=70B, RAG=true2024.07 | 67.6 | 79.6 | |
| ChatQA-1.0Backbone=Llama-2, Model size=13B2024.07 | 66.6 | 76.9 | |
| GPT-3.5-0613 RAGModel Family=OpenAI GPT, RAG=true2024.07 | 65.8 | 76.7 | |
| Llama-2-ChatBackbone=Llama-2, Configuration=Llama-2 RAG 70B, RAG=true2024.07 | 65.6 | — | |
| ChatQA-1.5Backbone=Llama-3, Model size=8B2024.07 | 65.4 | 75.8 | |
| ChatQA-1.0Backbone=Llama-2, Model size=7B2024.07 | 62.4 | 74.3 | |
| GPT-4-0613 RAGModel Family=OpenAI GPT, RAG=true2024.07 | 61.2 | 75.9 | |
| GPT-4-turbo-2024-0409 RAGModel Family=OpenAI GPT, RAG=true2024.07 | 57.6 | 79.2 | |
| Llama-3-InstructBackbone=Llama-3, Model size=8B, RAG=true2024.07 | 57.1 | 74.6 |