Question Answering on 15 Domain-Specific Knowledge Tasks (test)
78.4FiQA AccuracyBase
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BaseModel=Llama 3.1, Augmentation=w/ Cheat Sheet2025.11 | 78.4 | 47 | 61 | 21.7 | 67.7 | 49.7 | 57.4 | 61.8 | 53.2 | 74.7 | 53.8 | 73.8 | 64.6 | 60.3 | 51.5 | 58.4 | |
| KPPOModel=Llama 3.12025.11 | 77.3 | 55 | 70 | 51.7 | 71 | 58.6 | 69 | 68.7 | 61 | 75.9 | 69.7 | 80.8 | 71.9 | 69.2 | 63.6 | 67.6 | |
| KPPOModel=Qwen 2.52025.11 | 77.3 | 61 | 65 | 53.3 | 60.5 | 56.4 | 58.9 | 66.4 | 66.2 | 80.5 | 59.8 | 80.8 | 66.7 | 62.8 | 57.6 | 64.9 | |
| BaseModel=Qwen 2.5, Augmentation=w/ Cheat Sheet2025.11 | 76.3 | 57 | 62 | 30 | 58 | 43.6 | 51.2 | 53.4 | 54.5 | 69 | 59.8 | 66.9 | 63.5 | 61.5 | 49.2 | 57 | |
| VEModel=Qwen 2.5, Augmentation=w/ Web Search2025.11 | 76.3 | 61 | 65 | 43.3 | 62.1 | 52.5 | 52.7 | 56.5 | 57.1 | 72.4 | 52.3 | 76.2 | 63.5 | 61.5 | 48.5 | 60.1 | |
| APOModel=Qwen 2.5, Optimization Alignment=True (*)2025.11 | 76.3 | 57 | 64 | 35 | 55.7 | 45.3 | 58.1 | 53.4 | 53.3 | 63.2 | 53.8 | 66.2 | 61.5 | 59 | 46.2 | 56.5 | |
| PromptAgentModel=Qwen 2.52025.11 | 76.3 | 60 | 61 | 31.7 | 53.2 | 40.9 | 56.6 | 61.1 | 57.1 | 77 | 52.3 | 73.1 | 64.6 | 61.5 | 49.2 | 58.4 | |
| PromptAgentModel=Qwen 2.5, Optimization Alignment=True (*)2025.11 | 76.3 | 60 | 58 | 50 | 52.4 | 48.6 | 51.2 | 58.8 | 64.9 | 66.7 | 55.3 | 68.5 | 61.5 | 52.6 | 58.3 | 58.9 | |
| APOModel=Qwen 2.52025.11 | 75.3 | 62 | 55 | 30 | 54.8 | 45.9 | 50.4 | 53.4 | 57.1 | 64.4 | 53 | 71.5 | 63.5 | 55.1 | 47.7 | 55.9 | |
| AMPOModel=Qwen 2.52025.11 | 75.3 | 61 | 64 | 20 | 58.1 | 44.8 | 53.5 | 54.2 | 57.1 | 65.5 | 53 | 69.2 | 65.6 | 55.1 | 52.3 | 56.6 | |
| BaseModel=Qwen 2.52025.11 | 74.2 | 61 | 60 | 35 | 54 | 44.8 | 53.5 | 56.5 | 57.1 | 69 | 56.8 | 68.5 | 61.5 | 62.8 | 47.7 | 57.5 | |
| RAGModel=Qwen 2.5, Augmentation=w/ Training Set2025.11 | 74.2 | 47 | 57 | 41.7 | 50 | 45.9 | 45 | 48.1 | 65 | 52.9 | 51.5 | 64.6 | 60.4 | 53.9 | 38.6 | 53 | |
| RAGModel=Qwen 2.5, Augmentation=w/ Web Search2025.11 | 74.2 | 61 | 64 | 53.3 | 66.1 | 47 | 50.4 | 61.1 | 58.4 | 70.1 | 60.6 | 72.3 | 61.5 | 56.4 | 43.2 | 60 | |
| BaseModel=Llama 3.12025.11 | 73.2 | 49 | 69 | 28.3 | 61.3 | 47 | 65.1 | 63.4 | 61 | 71.3 | 62.1 | 76.9 | 66.7 | 53.9 | 53 | 60.1 | |
| OPROModel=Llama 3.12025.11 | 73.2 | 55 | 70 | 30 | 63.7 | 50.3 | 58.9 | 64.9 | 53.3 | 72.4 | 69.7 | 76.9 | 62.5 | 64.1 | 57.6 | 61.5 | |
| APOModel=Llama 3.12025.11 | 73.2 | 52 | 65 | 35 | 61.3 | 45.9 | 61.2 | 63.4 | 59.7 | 71.3 | 65.2 | 74.6 | 66.7 | 61.5 | 60.6 | 61.1 | |
| APOModel=Llama 3.1, Optimization Alignment=True (*)2025.11 | 73.2 | 55 | 63 | 33.3 | 66.1 | 51.4 | 57.4 | 63.4 | 58.4 | 71.3 | 57.6 | 73.1 | 62.5 | 53.9 | 56.8 | 59.8 | |
| AMPOModel=Llama 3.12025.11 | 73.2 | 49 | 65 | 28.3 | 60.5 | 45.3 | 62.8 | 63.4 | 61 | 72.4 | 66.7 | 76.2 | 60.4 | 53.9 | 62.1 | 60 | |
| PromptAgentModel=Llama 3.12025.11 | 73.2 | 51 | 65 | 28.3 | 55.7 | 39.8 | 62.8 | 64.1 | 67.5 | 74.7 | 65.2 | 76.2 | 69.8 | 64.1 | 54.6 | 60.8 | |
| PromptAgentModel=Llama 3.1, Optimization Alignment=True (*)2025.11 | 73.2 | 45 | 65 | 28.3 | 65.3 | 45.3 | 54.3 | 61.8 | 59.7 | 71.3 | 64.4 | 74.6 | 61.5 | 60.3 | 59.9 | 59.3 | |
| OPROModel=Qwen 2.52025.11 | 73.2 | 54 | 59 | 35 | 52.4 | 47 | 54.3 | 58 | 66.2 | 74.7 | 57.8 | 72.3 | 67.7 | 52.6 | 51.5 | 58.4 | |
| RAGModel=Llama 3.1, Augmentation=w/ Web Search2025.11 | 72.2 | 50 | 69 | 46.7 | 62.9 | 48.1 | 57.4 | 62.6 | 55.8 | 73.6 | 59.8 | 77.7 | 65.6 | 67.9 | 59.8 | 61.9 | |
| RAGModel=Llama 3.1, Augmentation=w/ Training Set2025.11 | 66 | 32 | 57 | 46.7 | 63.7 | 47.5 | 64.3 | 65.6 | 67.5 | 65.5 | 59.8 | 70.8 | 60.4 | 52.6 | 58.3 | 58.5 | |
| VEModel=Llama 3.1, Augmentation=w/ Web Search2025.11 | 66 | 60 | 65 | 43.3 | 75.8 | 50.8 | 66.7 | 62.6 | 64.9 | 67.8 | 63.6 | 70 | 65.6 | 62.8 | 54.5 | 62.6 |