Skill Composition on SKILL-MIX (train)
98Ratio Full Marks (k=1)Mistral-7B-Instruct-v0.2
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Mistral-7B-Instruct-v0.2Fine-tuning Data=D_SKILL-MIX (1, 2), Grading Model=GPT-42024.09 | 98 | 98 | 65 | 81 | 26 | 72 | 13 | 69 | 8 | 68 | |
| Mistral-7B-Instruct-v0.2Fine-tuning Data=D_SKILL-MIX (1), Grading Model=GPT-42024.09 | 95 | 95 | 43 | 68 | 10 | 57 | 3 | 52 | 0 | 52 | |
| Mistral-7B-Instruct-v0.2Fine-tuning Data=D_SKILL-MIX (1, 2, 3), Grading Model=GPT-42024.09 | 92 | 92 | 66 | 81 | 34 | 76 | 18 | 72 | 5 | 68 | |
| LLaMA-2-13B-ChatFine-tuning dataset=D_SKILL-MIX (1, 2, 3)2024.09 | 89 | 89 | 51 | 73 | 24 | 68 | 8 | 64 | 3 | 60 | |
| LLaMA-2-13B-ChatFine-tuning dataset=D_SKILL-MIX (1, 2)2024.09 | 88 | 88 | 50 | 70 | 12 | 56 | 1 | 55 | 2 | 52 | |
| LLaMA-2-13B-ChatFine-tuning dataset=D_SKILL-MIX (1)2024.09 | 87 | 87 | 15 | 51 | 0 | 43 | 0 | 37 | 0 | 35 | |
| Mistral-7B-Instruct-v0.2Fine-tuning Data=None, Grading Model=GPT-42024.09 | 86 | 86 | 18 | 51 | 5 | 46 | 1 | 36 | 0 | 35 | |
| LLaMA-2-13B-ChatFine-tuning dataset=None2024.09 | 52 | 52 | 17 | 47 | 2 | 34 | 0 | 33 | 0 | 31 |