Continual Learning on HeteroCLBench
40.11SQuAD (QG)TASER
Evaluation Results
| Method | Links | |||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| TASERBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, probe rank budget=8, max rank=8, energy threshold=0.92026.06 | 40.11 | 33.86 | 85.41 | 40 | 71 | 81.4 | 95 | 64 | 36.12 | 56.42 | 51.08 | 73.2 | 100 | 83.8 | 61.37 | 80.76 | 35.88 | 36.58 | 77 | 63.31 | -0.94 | |
| MTLBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, Strategy=Multi-Task Learning (Upper Bound)2026.06 | 38.38 | 33.29 | 93.35 | 43.2 | 84.8 | 87.25 | 96.2 | 68.8 | 37.13 | 56.06 | 50.33 | 76.4 | 97.6 | 87.8 | 60.71 | 86.88 | 33.23 | 37.2 | 79.6 | 65.7 | — | |
| I-LoRABackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, EMA momentum=0.25, consistency weight=1.02026.06 | 37.2 | 31.32 | 83.05 | 40.8 | 69 | 84.59 | 95 | 62.6 | 36.29 | 54.79 | 48.53 | 75.2 | 95.8 | 80.2 | 57.68 | 81.34 | 30.39 | 35.83 | 75 | 61.82 | -1.56 | |
| ReplayBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, replay ratio=0.32026.06 | 36.69 | 30.64 | 89.48 | 38.8 | 71 | 85.44 | 95.8 | 72 | 35.3 | 53.01 | 47.36 | 71.8 | 96.6 | 82.2 | 58.27 | 82.51 | 31.37 | 35.81 | 76.4 | 62.66 | -2.03 | |
| EWCBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, lambda=10, samples per task=2002026.06 | 17.76 | 26.44 | 46.78 | 34.6 | 67 | 80.33 | 86.4 | 37.8 | 22.91 | 50.17 | 43.76 | 72.2 | 86.2 | 75.2 | 54.8 | 64.14 | 33.7 | 36.35 | 81.2 | 53.56 | -13.13 | |
| LAMOLBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, pseudo-samples per task=2002026.06 | 16.5 | 23.87 | 45.28 | 31.8 | 66.6 | 76.97 | 91.2 | 42.8 | 25.42 | 45.54 | 44.84 | 66.4 | 81.4 | 80.8 | 47.02 | 82.22 | 33.28 | 37.56 | 80.2 | 53.67 | -14.45 | |
| Seq FTBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, Strategy=Sequential Fine-Tuning2026.06 | 16.49 | 25.79 | 46.78 | 31.8 | 63.6 | 70.67 | 87.8 | 29.4 | 26.68 | 49.01 | 41.73 | 73.4 | 80.2 | 71.8 | 42.86 | 55.98 | 33.14 | 36 | 81.4 | 50.76 | -13.54 | |
| CL-MoEBackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, number of experts=4, top-k routing=22026.06 | 15.27 | 25.14 | 46.78 | 33.4 | 68.2 | 76.45 | 88 | 45 | 28.35 | 50.16 | 45.72 | 72.4 | 89.6 | 77.2 | 46.99 | 74.05 | 36.32 | 38.69 | 81.4 | 54.69 | -15.13 | |
| MoE-LoRABackbone=Llama-3-8B-Instruct, LoRA rank=8, Batch size=32, Learning rate=1 x 10−4, number of experts=42026.06 | 13.38 | 24.99 | 46.57 | 33 | 67 | 78.38 | 92.2 | 44.6 | 29.58 | 50.93 | 44.66 | 70 | 89.6 | 78.8 | 51.37 | 76.09 | 35.87 | 38.84 | 82.4 | 55.17 | -11.47 |