Instruction Following on ComplexInstruct Level 6
64.2ISRDVRws
Evaluation Results
| Method | Links | |
|---|---|---|
| DVRwsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, warm-start=true2024.10 | 64.2 | |
| DVRcsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, cold-start=true2024.10 | 63.1 | |
| CRITICBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 61.3 | |
| ReActBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 52.1 | |
| R-SampleBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 50.7 | |
| DVRBackbone=Llama3.1-8B, Evaluation Protocol=zero-shot2024.10 | 49.6 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Warm-Start2024.10 | 46.9 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Cold-Start2024.10 | 43.8 | |
| GPT-4-turboEvaluation Protocol=zero-shot2024.10 | 42.6 | |
| CRITICBackbone=Llama-3-8B-Instruct2024.10 | 41.5 | |
| U-SCBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 36.3 | |
| ReflexionBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 36.1 | |
| VanillaBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 35.9 | |
| BSMBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 34.2 | |
| R-SampleBackbone=Llama-3-8B-Instruct2024.10 | 31 | |
| ReActBackbone=Llama-3-8B-Instruct2024.10 | 30.7 | |
| Llama3.1-8BEvaluation Protocol=zero-shot2024.10 | 25.3 | |
| DVRBackbone=Mistral-7B, Evaluation Protocol=zero-shot2024.10 | 23.4 | |
| ReflexionBackbone=Llama-3-8B-Instruct2024.10 | 20.9 | |
| U-SCBackbone=Llama-3-8B-Instruct2024.10 | 20.6 | |
| VanillaBackbone=Llama-3-8B-Instruct2024.10 | 20.4 | |
| BSMBackbone=Llama-3-8B-Instruct2024.10 | 19.5 | |
| Mistral-7BEvaluation Protocol=zero-shot2024.10 | 6.3 |