Automated Essay Scoring (AES) discourse component classification on PERSUADE 2.0 (test)
69Lead W-F1Baseline (70B)
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Baseline (70B)Model Size=70B, Evaluation Protocol=Zero-shot2026.06 | 69 | 61 | 81 | 79 | 61 | 50 | 49 | 34 | 60 | 48 | |
| IndependentModel Size=8B, Evaluation Protocol=Fine-tuned, Fine-tuning Strategy=Independent2026.06 | 62 | 57 | 39 | 47 | 34 | 34 | 42 | 41 | 12 | 7 | |
| SequentialModel Size=8B, Evaluation Protocol=Fine-tuned, Fine-tuning Strategy=Sequential (Curriculum learning)2026.06 | 62 | 57 | 42 | 50 | 40 | 50 | 65 | 63 | 87 | 85 | |
| LLaMA-8B (Base)Model Size=8B, Evaluation Protocol=Base (no fine-tuning)2026.06 | 14 | 9 | 16 | 10 | 13 | 7 | 20 | 12 | 16 | 12 | |
| RandomizedModel Size=8B, Evaluation Protocol=Fine-tuned, Fine-tuning Strategy=Randomized (Multi-task learning)2026.06 | 7 | 6 | 57 | 43 | 44 | 31 | 65 | 57 | 80 | 71 |