Large Language Model Evaluation on GSM8K, TruthfulQA, CommonsenseQA, MMLU, ARC, and TriviaQA
88AccuracyJoBS
Evaluation Results
| Method | Links | |
|---|---|---|
| JoBSModel=Qwen3-32B, Fine-tuning=full-parameter2026.02 | 88 | |
| LESS + AutoLoRAModel=Qwen3-32B, Fine-tuning=full-parameter2026.02 | 86 | |
| JoBSModel=Qwen3-14B, Fine-tuning=full-parameter2026.02 | 83 | |
| DoReMi + DARTSModel=Qwen3-32B, Fine-tuning=full-parameter2026.02 | 82 | |
| JoBSModel=Llama-3-8B-Instruct, Fine-tuning=full-parameter2026.02 | 81 | |
| DoReMi + DARTSModel=Qwen3-14B, Fine-tuning=full-parameter2026.02 | 81 | |
| DoReMi + DARTSModel=Llama-3-8B-Instruct, Fine-tuning=full-parameter2026.02 | 76 | |
| LESS + AutoLoRAModel=Qwen3-14B, Fine-tuning=full-parameter2026.02 | 76 | |
| LESS + AutoLoRAModel=Llama-3-8B-Instruct, Fine-tuning=full-parameter2026.02 | 73 |