Language Modeling Evaluation on ARC, HellaSwag, MMLU, TruthfulQA, WinoGrande
34.64ARC AccuracyBOFT
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| BOFTAve. Mem.=145.1%, Max. Mem.=100.6%, Backbone=Qwen2.5 0.5B2026.01 | 34.64 | 51.7 | 58.18 | 39.57 | 56.43 | 48.1 | |
| QLoRAAve. Mem.=51.7%, Max. Mem.=45.6%, Backbone=Qwen2.5 0.5B2026.01 | 34.64 | 50.1 | 58.05 | 40.41 | 55.09 | 47.66 | |
| QLoRA w/ TOKENSEEKAve. Mem.=19.2%, Max. Mem.=13.4%, Backbone=Qwen2.5 0.5B2026.01 | 34.56 | 50.09 | 57.52 | 41.51 | 58.56 | 48.45 | |
| RanLoRAAve. Mem.=95.4%, Max. Mem.=86.7%, Backbone=Qwen2.5 0.5B2026.01 | 29.18 | 50.1 | 58.33 | 45.21 | 57.22 | 48.01 |