Instruction Following on ComplexInstruct Level 5
0.76ISRDVRws
Evaluation Results
| Method | Links | |
|---|---|---|
| DVRwsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, warm-start=true2024.10 | 0.76 | |
| DVRcsBackbone=Llama-3.1-70B-Instruct-AWQ-INT4, cold-start=true2024.10 | 0.757 | |
| CRITICBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.737 | |
| ReActBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.65 | |
| R-SampleBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.638 | |
| DVRBackbone=Llama3.1-8B, Evaluation Protocol=zero-shot2024.10 | 0.605 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Warm-Start2024.10 | 0.554 | |
| GPT-4-turboEvaluation Protocol=zero-shot2024.10 | 0.537 | |
| DVRBackbone=Llama-3-8B-Instruct, Start Type=Cold-Start2024.10 | 0.537 | |
| U-SCBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.525 | |
| ReflexionBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.516 | |
| VanillaBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.513 | |
| CRITICBackbone=Llama-3-8B-Instruct2024.10 | 0.511 | |
| BSMBackbone=Llama-3.1-70B-Instruct-AWQ-INT42024.10 | 0.496 | |
| R-SampleBackbone=Llama-3-8B-Instruct2024.10 | 0.398 | |
| ReActBackbone=Llama-3-8B-Instruct2024.10 | 0.391 | |
| DVRBackbone=Mistral-7B, Evaluation Protocol=zero-shot2024.10 | 0.364 | |
| Llama3.1-8BEvaluation Protocol=zero-shot2024.10 | 0.356 | |
| U-SCBackbone=Llama-3-8B-Instruct2024.10 | 0.312 | |
| VanillaBackbone=Llama-3-8B-Instruct2024.10 | 0.304 | |
| ReflexionBackbone=Llama-3-8B-Instruct2024.10 | 0.3 | |
| BSMBackbone=Llama-3-8B-Instruct2024.10 | 0.288 | |
| Mistral-7BEvaluation Protocol=zero-shot2024.10 | 0.124 |