Question Answering on RGB (test)
100AccuracyRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| RPOGeneration LLM=LLaMA3-8B-instruct, Adaptive Category=Integrated-Eval, #API/LM calls=12025.01 | 100 | |
| RAGGeneration LLM=ChatGPT, #API/LM calls=12025.01 | 99.3 | |
| InstructRAGGeneration LLM=LLaMA3-8B-instruct, #API/LM calls=12025.01 | 99.3 | |
| RPOGeneration LLM=LLaMA2-7B, Adaptive Category=Integrated-Eval, #API/LM calls=12025.01 | 97.3 | |
| RAG + DPOGeneration LLM=LLaMA2-7B, #API/LM calls=12025.01 | 96.3 | |
| RAGGeneration LLM=LLaMA3-8B-instruct, #API/LM calls=12025.01 | 96.3 | |
| AstuteRAGGeneration LLM=ChatGPT, Adaptive Category=Pre-Eval, #API/LM calls=2-42025.01 | 94.6 | |
| RAG + SFTGeneration LLM=LLaMA2-7B, #API/LM calls=12025.01 | 94.6 | |
| Self-RAGGeneration LLM=LLaMA2-7B, Adaptive Category=Post-Eval, #API/LM calls=2-112025.01 | 92.6 | |
| CRAGGeneration LLM=LLaMA2-7B, Adaptive Category=Pre-Eval, #API/LM calls=62025.01 | 92 | |
| RAGGeneration LLM=LLaMA2-7B, #API/LM calls=12025.01 | 91.6 |