Knowledge Elicitation on KAssess
0.6984Success RatePGDC
Evaluation Results
| Method | Links | |
|---|---|---|
| PGDCModel=LLaMA2 (7B)2024.02 | 0.6984 | |
| PGDCModel=Vicuna (7B)2024.02 | 0.5763 | |
| Few-shotsModel=Vicuna (7B), Prompt Variant=paraphrased2024.02 | 0.5366 | |
| Zero-shotModel=Vicuna (7B), Prompt Variant=paraphrased2024.02 | 0.5115 | |
| Few-shotsModel=LLaMA2 (7B), Prompt Variant=paraphrased2024.02 | 0.5075 | |
| Zero-shotModel=LLaMA2 (7B), Prompt Variant=paraphrased2024.02 | 0.5 | |
| PGDCModel=GPT-J (6B)2024.02 | 0.4862 | |
| Zero-shotModel=GPT-J (6B), Prompt Variant=paraphrased2024.02 | 0.4023 | |
| DiscriminatorModel=Vicuna (7B), Prompt Variant=paraphrased2024.02 | 0.382 | |
| Few-shotsModel=GPT-J (6B), Prompt Variant=paraphrased2024.02 | 0.382 | |
| Few-shotsModel=Vicuna (7B), Prompt Variant=standard2024.02 | 0.3337 | |
| Few-shotsModel=LLaMA2 (7B), Prompt Variant=standard2024.02 | 0.3203 | |
| DiscriminatorModel=LLaMA2 (7B), Prompt Variant=paraphrased2024.02 | 0.2473 | |
| PGDCModel=GPT-2 (774M)2024.02 | 0.2471 | |
| Zero-shotModel=LLaMA2 (7B), Prompt Variant=standard2024.02 | 0.2369 | |
| Zero-shotModel=Vicuna (7B), Prompt Variant=standard2024.02 | 0.2321 | |
| Few-shotsModel=GPT-J (6B), Prompt Variant=standard2024.02 | 0.2047 | |
| Zero-shotModel=GPT-J (6B), Prompt Variant=standard2024.02 | 0.1595 | |
| DiscriminatorModel=GPT-2 (774M), Prompt Variant=paraphrased2024.02 | 0.1575 | |
| Zero-shotModel=GPT-2 (774M), Prompt Variant=paraphrased2024.02 | 0.1366 | |
| DiscriminatorModel=GPT-J (6B), Prompt Variant=standard2024.02 | 0.1267 | |
| Few-shotsModel=GPT-2 (774M), Prompt Variant=paraphrased2024.02 | 0.1144 | |
| DiscriminatorModel=Vicuna (7B), Prompt Variant=standard2024.02 | 0.099 | |
| DiscriminatorModel=LLaMA2 (7B), Prompt Variant=standard2024.02 | 0.0673 | |
| Zero-shotModel=GPT-2 (774M), Prompt Variant=standard2024.02 | 0.0403 | |
| Few-shotsModel=GPT-2 (774M), Prompt Variant=standard2024.02 | 0.0364 | |
| DiscriminatorModel=GPT-2 (774M), Prompt Variant=standard2024.02 | 0.0246 | |
| DiscriminatorModel=GPT-J (6B), Prompt Variant=paraphrased2024.02 | 0.0226 |