Instruction Following on ComplexInstruct Level 1
0.982ISRDVRws
Evaluation Results
| Method | Links | |
|---|---|---|
| DVRwsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, warm-start=true2024.10 | 0.982 | |
| CRITICBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.981 | |
| DVRcsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, cold-start=true2024.10 | 0.98 | |
| ReActBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.975 | |
| R-SampleBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.973 | |
| U-SCBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.96 | |
| VanillaBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.955 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Warm-Start2024.10 | 0.954 | |
| GPT-4-turboEvaluation Protocol=zero-shot2024.10 | 0.953 | |
| ReflexionBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.953 | |
| DVRBackbone=Llama3.1-8B, Evaluation Protocol=zero-shot2024.10 | 0.952 | |
| DVRBackbone=Mistral-7B, Evaluation Protocol=zero-shot2024.10 | 0.95 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Cold-Start2024.10 | 0.95 | |
| BSMBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.95 | |
| CRITICBackbone=Llama-3-8B-Instruct2024.10 | 0.941 | |
| ReActBackbone=Llama-3-8B-Instruct2024.10 | 0.936 | |
| R-SampleBackbone=Llama-3-8B-Instruct2024.10 | 0.908 | |
| Llama3.1-8BEvaluation Protocol=zero-shot2024.10 | 0.905 | |
| U-SCBackbone=Llama-3-8B-Instruct2024.10 | 0.895 | |
| BSMBackbone=Llama-3-8B-Instruct2024.10 | 0.892 | |
| VanillaBackbone=Llama-3-8B-Instruct2024.10 | 0.891 | |
| ReflexionBackbone=Llama-3-8B-Instruct2024.10 | 0.888 | |
| Mistral-7BEvaluation Protocol=zero-shot2024.10 | 0.77 |