Knowledge Elicitation on ALCUNA
3,048Success RateDiscriminator
Evaluation Results
| Method | Links | |
|---|---|---|
| DiscriminatorModel=LLaMA2 (7B), Prompt Variant=standard2024.02 | 3,048 | |
| DiscriminatorModel=LLaMA2 (7B), Prompt Variant=paraphrased2024.02 | 3,048 | |
| DiscriminatorModel=GPT-2 (774M), Prompt Variant=standard2024.02 | 210 | |
| DiscriminatorModel=GPT-2 (774M), Prompt Variant=paraphrased2024.02 | 210 | |
| DiscriminatorModel=Vicuna (7B), Prompt Variant=standard2024.02 | 90 | |
| DiscriminatorModel=Vicuna (7B), Prompt Variant=paraphrased2024.02 | 90 | |
| Few-shotsModel=Vicuna (7B), Prompt Variant=standard2024.02 | 80 | |
| Few-shotsModel=Vicuna (7B), Prompt Variant=paraphrased2024.02 | 80 | |
| DiscriminatorModel=GPT-J (6B), Prompt Variant=standard2024.02 | 72 | |
| DiscriminatorModel=GPT-J (6B), Prompt Variant=paraphrased2024.02 | 72 | |
| Few-shotsModel=LLaMA2 (7B), Prompt Variant=standard2024.02 | 63 | |
| Few-shotsModel=LLaMA2 (7B), Prompt Variant=paraphrased2024.02 | 63 | |
| Few-shotsModel=GPT-2 (774M), Prompt Variant=standard2024.02 | 30 | |
| Few-shotsModel=GPT-2 (774M), Prompt Variant=paraphrased2024.02 | 30 | |
| Few-shotsModel=GPT-J (6B), Prompt Variant=standard2024.02 | 8 | |
| Few-shotsModel=GPT-J (6B), Prompt Variant=paraphrased2024.02 | 8 | |
| Zero-shotModel=LLaMA2 (7B), Prompt Variant=standard2024.02 | 0 | |
| Zero-shotModel=LLaMA2 (7B), Prompt Variant=paraphrased2024.02 | 0 | |
| PGDCModel=LLaMA2 (7B)2024.02 | 0 | |
| Zero-shotModel=Vicuna (7B), Prompt Variant=standard2024.02 | 0 | |
| Zero-shotModel=Vicuna (7B), Prompt Variant=paraphrased2024.02 | 0 | |
| PGDCModel=Vicuna (7B)2024.02 | 0 | |
| Zero-shotModel=GPT-J (6B), Prompt Variant=standard2024.02 | 0 | |
| Zero-shotModel=GPT-J (6B), Prompt Variant=paraphrased2024.02 | 0 | |
| PGDCModel=GPT-J (6B)2024.02 | 0 | |
| Zero-shotModel=GPT-2 (774M), Prompt Variant=standard2024.02 | 0 | |
| Zero-shotModel=GPT-2 (774M), Prompt Variant=paraphrased2024.02 | 0 | |
| PGDCModel=GPT-2 (774M)2024.02 | 0 |