Instruction Following on ComplexInstruct Level 4
82.2ISRDVRws
Evaluation Results
| Method | Links | |
|---|---|---|
| DVRwsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, warm-start=true2024.10 | 82.2 | |
| DVRcsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, cold-start=true2024.10 | 82 | |
| CRITICBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 79.1 | |
| ReActBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 72.4 | |
| R-SampleBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 72.2 | |
| DVRBackbone=Llama3.1-8B, Evaluation Protocol=zero-shot2024.10 | 69.7 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Warm-Start2024.10 | 67.4 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Cold-Start2024.10 | 65.3 | |
| GPT-4-turboEvaluation Protocol=zero-shot2024.10 | 65.2 | |
| BSMBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 64.8 | |
| U-SCBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 64 | |
| VanillaBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 63.2 | |
| ReflexionBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 63 | |
| CRITICBackbone=Llama-3-8B-Instruct2024.10 | 61.2 | |
| ReActBackbone=Llama-3-8B-Instruct2024.10 | 54.4 | |
| R-SampleBackbone=Llama-3-8B-Instruct2024.10 | 52.9 | |
| DVRBackbone=Mistral-7B, Evaluation Protocol=zero-shot2024.10 | 51.4 | |
| Llama3.1-8BEvaluation Protocol=zero-shot2024.10 | 50.1 | |
| U-SCBackbone=Llama-3-8B-Instruct2024.10 | 45.1 | |
| VanillaBackbone=Llama-3-8B-Instruct2024.10 | 44.2 | |
| ReflexionBackbone=Llama-3-8B-Instruct2024.10 | 41.5 | |
| BSMBackbone=Llama-3-8B-Instruct2024.10 | 41.3 | |
| Mistral-7BEvaluation Protocol=zero-shot2024.10 | 19.9 |