Skill Composition on SKILL-MIX (all)
98Ratio Full Marks (k=1)Mistral-7B-Instruct-v0.2
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Mistral-7B-Instruct-v0.2Fine-tuning Data=D_SKILL-MIX (1, 2), Grading Model=GPT-42024.09 | 98 | 98 | 75 | 90 | 46 | 80 | 16 | 73 | 3 | 67 | |
| LLaMA-2-13B-ChatFine-tuning dataset=D_SKILL-MIX (1, 2)2024.09 | 96 | 96 | 51 | 74 | 17 | 65 | 1 | 54 | 0 | 51 | |
| LLaMA-2-13B-ChatFine-tuning dataset=D_SKILL-MIX (1, 2, 3)2024.09 | 96 | 96 | 65 | 81 | 33 | 73 | 15 | 69 | 6 | 62 | |
| Mistral-7B-Instruct-v0.2Fine-tuning Data=D_SKILL-MIX (1, 2, 3), Grading Model=GPT-42024.09 | 96 | 96 | 85 | 93 | 54 | 83 | 19 | 75 | 4 | 70 | |
| Mistral-7B-Instruct-v0.2Fine-tuning Data=D_SKILL-MIX (1), Grading Model=GPT-42024.09 | 94 | 94 | 45 | 71 | 20 | 64 | 5 | 56 | 1 | 52 | |
| LLaMA-2-13B-ChatFine-tuning dataset=D_SKILL-MIX (1)2024.09 | 88 | 88 | 27 | 62 | 5 | 50 | 0 | 40 | 0 | 33 | |
| Mistral-7B-Instruct-v0.2Fine-tuning Data=None, Grading Model=GPT-42024.09 | 83 | 83 | 35 | 66 | 6 | 50 | 0 | 41 | 0 | 37 | |
| LLaMA-2-13B-ChatFine-tuning dataset=None2024.09 | 46 | 46 | 24 | 50 | 2 | 42 | 1 | 40 | 0 | 34 |