Moral Reasoning on MMLU Moral Scenarios (test)
0.86AccuracySKIG
Evaluation Results
| Method | Links | |
|---|---|---|
| SKIGLarge Language Model=GPT-42024.05 | 0.86 | |
| CoTLarge Language Model=GPT-42024.05 | 0.8 | |
| I/OLarge Language Model=GPT-42024.05 | 0.78 | |
| SKIGLarge Language Model=GPT-3.5 TURBO2024.05 | 0.71 | |
| TELarge Language Model=GPT-42024.05 | 0.6 | |
| SKIGLarge Language Model=MISTRAL-7B2024.05 | 0.58 | |
| TELarge Language Model=GPT-3.5 TURBO2024.05 | 0.54 | |
| CoTLarge Language Model=GPT-3.5 TURBO2024.05 | 0.52 | |
| SKIGLarge Language Model=DAVINCI2024.05 | 0.51 | |
| TELarge Language Model=MISTRAL-7B2024.05 | 0.5 | |
| I/OLarge Language Model=GPT-3.5 TURBO2024.05 | 0.42 | |
| CoTLarge Language Model=DAVINCI2024.05 | 0.39 | |
| I/OLarge Language Model=DAVINCI2024.05 | 0.38 | |
| I/OLarge Language Model=MISTRAL-7B2024.05 | 0.38 | |
| CoTLarge Language Model=MISTRAL-7B2024.05 | 0.37 | |
| TELarge Language Model=DAVINCI2024.05 | 0.35 | |
| TELarge Language Model=CURIE2024.05 | 0.28 | |
| SKIGLarge Language Model=BABBAGE2024.05 | 0.27 | |
| SKIGLarge Language Model=CURIE2024.05 | 0.26 | |
| I/OLarge Language Model=BABBAGE2024.05 | 0.25 | |
| SKIGLarge Language Model=ADA2024.05 | 0.24 | |
| I/OLarge Language Model=ADA2024.05 | 0.23 | |
| CoTLarge Language Model=ADA2024.05 | 0.23 | |
| CoTLarge Language Model=BABBAGE2024.05 | 0.21 | |
| CoTLarge Language Model=CURIE2024.05 | 0.21 | |
| TELarge Language Model=ADA2024.05 | 0.21 | |
| TELarge Language Model=BABBAGE2024.05 | 0.2 | |
| I/OLarge Language Model=CURIE2024.05 | 0.19 |