Commonsense Reasoning on BoolQ, PIQA, SIQA, HellaS., WinoG., ARC-e, ARC-c, OBQA (test)
88BoolQ AccuracyPaLM (540B)
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| PaLM (540B)Model=PaLM (540B), PEFT Method=None2024.05 | 88 | 82.3 | — | 83.4 | 81.1 | 76.6 | 53 | 53.4 | — | |
| Dense w/oPruning=-, RM Blocks=0(0.0%)2026.06 | 86.33 | 80.3 | 51.59 | 80.48 | 70.96 | 81.94 | 54.95 | 48.8 | 69.42 | |
| BUDDYPruning=dynamic, RM Blocks=4(14.3%)2026.06 | 84.5 | 77.26 | 48.93 | 73.2 | 66.69 | 79.88 | 51.19 | 43.4 | 65.63 | |
| ShortGPTPruning=static, RM Blocks=4(14.3%)2026.06 | 82.39 | 77.42 | 50.61 | 72.95 | 66.77 | 79.25 | 50.51 | 44 | 65.49 | |
| Shortened LlamaPruning=static, RM Blocks=4(14.3%)2026.06 | 78.75 | 80.36 | 48.26 | 73.22 | 65.19 | 77.86 | 48.63 | 44.8 | 64.63 | |
| DoRAModel=Gemma2-9B, Rank=16, Mem.=60.3G, Time=21.3h2025.07 | 78.13 | 90.48 | 82.14 | 96.62 | 88.24 | 95.2 | 87.71 | 91.2 | 88.72 | |
| DoMIX (+ Math LoRA)Model=Gemma2-9B, Rank=16, Mem.=51.8G, Time=14.3h2025.07 | 77.61 | 91.51 | 82.4 | 96.93 | 90.37 | 96 | 88.74 | 92.8 | 89.55 | |
| C3ABackbone=LLaMA3-8B, Params (%)=0.26, Mem=56.08G, block size=4096/322024.07 | 76.9 | 91.4 | 82.1 | 96.7 | 86.9 | 89.6 | 79.4 | 86.1 | 85.9 | |
| SLEBPruning=static, RM Blocks=4(14.3%)2026.06 | 76.24 | 79.11 | 48.57 | 73.25 | 62.9 | 77.9 | 50.34 | 45.2 | 64.19 | |
| QuanTA (LLaMA2 13B)Model=LLaMA2-13B, PEFT Method=QuanTA (Ours), # Params (%)=0.029%2024.05 | 75.8 | 86.9 | 81.2 | 94.4 | 87 | 89.6 | 77.9 | 85.2 | 84.8 | |
| LoRA (with Joint Dataset)Model=Gemma2-9B, Rank=16, Mem.=51.8G, Time=14.3h2025.07 | 75.72 | 90.21 | 81.42 | 95.31 | 89.11 | 93.1 | 82.76 | 88.2 | 86.98 | |
| LoFTModel=LLaMA3-8B, rank (r)=162025.05 | 75.63 | 88.85 | 80.35 | 95.64 | 86.11 | 91.16 | 80.89 | 86.4 | 85.63 | |
| MoCBackbone=LLaMA3-8B, % Params=0.43, Time (↓) (h)=6.5, GPU Mem. (↓) (GB)=56.72026.06 | 75.5 | 89.5 | 82 | 96.6 | 88.8 | 91.5 | 81.6 | 88 | 86.7 | |
| MoCBackbone=Qwen2.5-14B, % Params=0.43, Time (↓) (h)=8.0, GPU Mem. (↓) (GB)=61.32026.06 | 75.5 | 91.8 | 82.4 | 96.8 | 91 | 96.6 | 90.2 | 96.4 | 90.1 | |
| LoRAModel=Gemma2-9B, Rank=16, Mem.=51.8G, Time=13.5h2025.07 | 75.44 | 89.72 | 81.78 | 95.58 | 87.69 | 92.89 | 84.3 | 90 | 87.17 | |
| DoRABackbone=LLaMA3-8B, Params (%)=0.71, Mem=63.37G, rank=322024.07 | 75.3 | 88.9 | 82.2 | 94.9 | 86 | 89 | 79.8 | 84.9 | 85.3 | |
| FourierMoEModel=Gemma 7B, Trainable Parameters (%)=0.032026.04 | 75.26 | 91.05 | 82.55 | 95.81 | 90.21 | 95.44 | 85.62 | 89.6 | 88.19 | |
| LoRAModel=Gemma 7B, Trainable Parameters (%)=0.142026.04 | 75.17 | 88.74 | 77.58 | 95.21 | 89.11 | 92.93 | 84.73 | 88 | 86.43 | |
| AdaLoRABackbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=28.3M, Time=12.5h, Mem=58G2024.06 | 75.1 | 86.4 | 76.7 | 75.4 | 83.3 | 90.4 | 79.1 | 85 | 81.4 | |
| DoRABackbone=Qwen2.5-14B, % Params=0.64, Time (↓) (h)=14.3, GPU Mem. (↓) (GB)=94.72026.06 | 75.1 | 90.1 | 82 | 96.3 | 89.4 | 95 | 88.2 | 93 | 88.6 | |
| LoHaBackbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=28.3M, Time=25.5h, Mem=68G2024.06 | 75 | 89.7 | 81.1 | 95 | 83.3 | 91.2 | 80.5 | 85.8 | 85.2 | |
| DoRAModel=LLaMA3-8B, Rank=16, Mem.=66.5G, Time=14.3h2025.07 | 74.95 | 89.34 | 80.3 | 95.52 | 85.64 | 90.66 | 79.52 | 85.8 | 85.22 | |
| FLORABackbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=28.4M, Time=8.2h, Mem=31G2024.06 | 74.8 | 86.7 | 79.9 | 93.9 | 85.1 | 90.2 | 79.3 | 84.2 | 84.2 | |
| DoMIX (+ Math LoRA)Model=LLaMA3-8B, Rank=32, Mem.=54.6G, Time=9.2h2025.07 | 74.77 | 89.12 | 79.63 | 95.84 | 86.35 | 91.08 | 80.72 | 85.2 | 85.34 | |
| DoRA+ (LLaMA3 8B)Model=LLaMA3-8B, PEFT Method=DoRA+, # Params (%)=0.71%2024.05 | 74.6 | 89.3 | 79.9 | 95.5 | 85.6 | 90.5 | 80.4 | 85.8 | 85.2 | |
| DoRAModel=LLaMA3-8B, Trainable Params (%)=0.71%2024.02 | 74.6 | 89.3 | 79.9 | 95.5 | 85.6 | 90.5 | 80.4 | 85.8 | 85.2 | |
| DoRA*Backbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=57.4M, Time=14.8h, Mem=33G, Rank=larger rank2024.06 | 74.6 | 89.3 | 79.9 | 95.5 | 85.6 | 90.5 | 80.4 | 85.8 | 85.2 | |
| MoSLORABackbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=28.4M, Time=8.2h, Mem=31G2024.06 | 74.6 | 89.7 | 81 | 95 | 85.8 | 90.5 | 81.5 | 86.8 | 85.6 | |
| DoRA*Backbone=LLaMA3-8B, % Params=0.71, Time (↓) (h)=10.5, GPU Mem. (↓) (GB)=69.12026.06 | 74.6 | 89.3 | 79.9 | 95.5 | 85.6 | 90.5 | 80.4 | 85.8 | 85.2 | |
| DoRAModel=LLaMA3-8B, rank (r)=162025.05 | 74.56 | 88.52 | 80.09 | 95.17 | 86.74 | 90.19 | 79.78 | 84.6 | 84.96 | |
| LoFTModel=LLaMA3-8B, rank (r)=42025.05 | 74.53 | 88.52 | 80.04 | 95.45 | 85.32 | 89.73 | 78.92 | 84.2 | 84.59 | |
| DoRA (LLaMA3 8B)Model=LLaMA3-8B, PEFT Method=DoRA, # Params (%)=0.35%2024.05 | 74.5 | 88.8 | 80.3 | 95.5 | 84.7 | 90.1 | 79.1 | 87.2 | 85 | |
| DoRA†Model=LLaMA3-8B, Trainable Params (%)=0.35%, Configuration=rank halved2024.02 | 74.5 | 88.8 | 80.3 | 95.5 | 84.7 | 90.1 | 79.1 | 87.2 | 85 | |
| DoRABackbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=29.1M, Time=14.5h, Mem=33G2024.06 | 74.5 | 88.8 | 80.3 | 95.5 | 84.7 | 90.1 | 79.1 | 87.2 | 85 | |
| LoRAModel=LLaMA3-8B, rank (r)=162025.05 | 74.46 | 88.14 | 81.37 | 94.81 | 85.08 | 89.18 | 80.72 | 86 | 84.97 | |
| LLMBRACESBase Model=Llama3-8B, Rank (r)=32, Param.=4.2M, Param. (%)=0.05%, Supervised Fine-tuning=true2025.03 | 74.4 | 89.12 | 81.37 | 95.55 | 86.66 | 92.97 | 83.19 | 88.8 | 86.51 | |
| QuanTA (LLaMA3 8B)Model=LLaMA3-8B, PEFT Method=QuanTA (Ours), # Params (%)=0.035%2024.05 | 74.3 | 88.1 | 81.8 | 95.1 | 87.3 | 91.1 | 81.7 | 87.2 | 85.8 | |
| MoCBackbone=Mistralv3-7B, % Params=0.48, Time (↓) (h)=5.5, GPU Mem. (↓) (GB)=55.62026.06 | 74.2 | 88.9 | 81 | 95.6 | 87.9 | 88.9 | 79.5 | 87.8 | 85.5 | |
| Control*Backbone=LLaMA3-8B, % Params=0.42, Time (↓) (h)=4.4, GPU Mem. (↓) (GB)=54.02026.06 | 74.1 | 87.8 | 80.7 | 95.5 | 86 | 90.8 | 80 | 87.8 | 85.3 | |
| DoMIX (+ Math LoRA)Model=LLaMA3-8B, Rank=16, Mem.=54.5G, Time=9.2h2025.07 | 73.94 | 88.36 | 80.25 | 95.85 | 85.95 | 91.04 | 80.55 | 85.8 | 85.22 | |
| LoRABackbone=LLaMA3-8B, Params (%)=0.70, Mem=51.18G, rank=322024.07 | 73.8 | 88.2 | 80.4 | 94 | 85.5 | 87.5 | 78.1 | 84 | 83.9 | |
| LoFTModel=LLaMA3-8B, rank (r)=22025.05 | 73.76 | 87.11 | 79.84 | 94.72 | 84.29 | 89.98 | 79.61 | 84.6 | 84.24 | |
| DoRAModel=LLaMA3-8B, Rank=32, Mem.=66.6G, Time=14.3h2025.07 | 73.73 | 88.74 | 80.96 | 95.63 | 87.92 | 90.45 | 77.82 | 86.6 | 85.23 | |
| FourierMoEModel=LLaMA-2 7B, Trainable Parameters (%)=0.062026.04 | 73.73 | 84.6 | 81.27 | 92.33 | 86.82 | 88.24 | 77.21 | 87.4 | 83.95 | |
| LLaMA38B LoRA + GASTModel=LLaMA38B, PEFT=LoRA + GAST2026.03 | 73.6 | 87.4 | 81 | 95.2 | 86.5 | 90 | 79.8 | 85 | 84.8 | |
| KaSAModel=LLaMA-2 7B, Trainable Parameters (%)=0.842026.04 | 73.6 | 84.4 | 80.2 | 91.5 | 84.5 | 84.7 | 72.1 | 81.2 | 81.53 | |
| GOATModel=LLaMA-2 7B, Trainable Parameters (%)=0.962026.04 | 73.6 | 83.95 | 80.5 | 87.12 | 85 | 87.79 | 76.88 | 87 | 82.73 | |
| MoLExBackbone=Qwen2.5-14B, % Params=0.64, Time (↓) (h)=20.3, GPU Mem. (↓) (GB)=124.82026.06 | 73.5 | 90.5 | 81.9 | 95.5 | 88.2 | 94.4 | 85.8 | 92.2 | 87.8 | |
| DoRAModel=Gemma 7B, Trainable Parameters (%)=0.142026.04 | 73.49 | 90.44 | 79.19 | 95.03 | 90 | 93.79 | 84.73 | 88.67 | 86.92 | |
| MELoRAModel=Gemma 7B, Trainable Parameters (%)=0.142026.04 | 73.49 | 89.5 | 79.99 | 94.6 | 89.9 | 93.18 | 84.3 | 89.4 | 86.79 | |
| C3ABackbone=LLaMA2-7B, Params (%)=0.35, Mem=44.89G, block size=4096/322024.07 | 73.4 | 83.4 | 82.1 | 88.3 | 84.9 | 86.6 | 66.7 | 82.5 | 81 | |
| LoRABackbone=Qwen2.5-14B, % Params=0.63, Time (↓) (h)=9.4, GPU Mem. (↓) (GB)=62.12026.06 | 73.4 | 90.4 | 82.2 | 96 | 88.6 | 94.7 | 86.1 | 90.6 | 87.7 | |
| LoRA (LLaMA2 13B)Model=LLaMA2-13B, PEFT Method=LoRA, # Params (%)=0.67%2024.05 | 73.3 | 85.6 | 80.8 | 91.6 | 85.5 | 84.2 | 73.7 | 83.3 | 82.3 | |
| RoAd2Model=13B, #Paras.=0.03%2024.08 | 73.3 | 86.4 | 82 | 94.4 | 86.1 | 87.4 | 74.1 | 87 | 83.8 | |
| LoRABase Model=Llama3-8B, Rank (r)=16, Param.=6.8M, Param. (%)=0.08%, Supervised Fine-tuning=true2025.03 | 73.27 | 88.25 | 78.92 | 94.96 | 87.21 | 90.95 | 77.99 | 86.2 | 84.72 | |
| QuanTA (LLaMA 13B)Model=LLaMA-13B, PEFT Method=QuanTA (Ours), # Params (%)=0.029%2024.05 | 73.2 | 85.4 | 82.1 | 93.4 | 85.1 | 87.8 | 73.3 | 84.4 | 83.1 | |
| RoAd4Model=13B, #Paras.=0.07%2024.08 | 73.2 | 85.5 | 82.4 | 94.5 | 86.3 | 86.8 | 74.6 | 86 | 83.7 | |
| LLaMA13B LoRA + GASTModel=LLaMA13B, PEFT=LoRA + GAST2026.03 | 73.2 | 84.5 | 81.9 | 90.8 | 85.5 | 84.6 | 71.5 | 82.9 | 81.8 | |
| LoRABackbone=LLaMA-3.1-8B, fine-tuning=true, r=8, #Params=14.2M, Memory (GB)=54.12025.05 | 73.18 | 85.31 | 74.36 | 86.57 | 74.19 | 90.95 | 80.29 | 84 | 81.11 | |
| MoLoRAModel=LLaMA-2 7B, Trainable Parameters (%)=0.962026.04 | 73.15 | 83.68 | 80.09 | 74.57 | 85.95 | 87.33 | 72.53 | 86.2 | 80.43 | |
| ChatGPT2024.07 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| ChatGPTModel=ChatGPT, PEFT Method=None2024.05 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| ChatGPTModel=ChatGPT2024.02 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| GPT3.5Model=GPT3.52024.08 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| ChatGPTPEFT=N/A, Params=N/A2024.07 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| ChatGPTModel=ChatGPT2024.07 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| ChatGPTModel=ChatGPT, PEFT=-2026.03 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77 | |
| ChatGPTModel=ChatGPT2026.04 | 73.1 | 85.4 | 68.5 | 78.5 | 66.1 | 89.8 | 79.9 | 74.8 | 77.01 | |
| DoRABackbone=LLaMA-3.1-8B, fine-tuning=true, r=8, #Params=14.9M, Memory (GB)=65.62025.05 | 73.09 | 85.96 | 75.08 | 90.48 | 75.53 | 90.74 | 81.4 | 84.4 | 82.09 | |
| FT (LLaMA2 7B)Model=LLaMA2-7B, PEFT Method=FT, # Params (%)=100%2024.05 | 72.9 | 83 | 79.8 | 92.4 | 83 | 86.6 | 72 | 80.1 | 81.2 | |
| Adam-SPDPEFT=LoRA, LLM=LLaMA-13B, lambda=1.22024.11 | 72.9 | 85.6 | 80.7 | 92 | 83.7 | 85.6 | 71.6 | 85.6 | 82.2 | |
| LilyBackbone=LLaMA3-8B, PEFT=Lily, Params=1.2M2024.07 | 72.9 | 85.6 | 77.8 | 92.7 | 83.3 | 89.7 | 77.6 | 82.8 | 82.8 | |
| LLaMA13B Series + ISTModel=LLaMA13B, PEFT=Series + IST2026.03 | 72.9 | 82.2 | 81.4 | 87.9 | 84 | 82.7 | 69.1 | 81.1 | 80.2 | |
| LLaMA13B Series + GASTModel=LLaMA13B, PEFT=Series + GAST2026.03 | 72.9 | 82 | 82.8 | 89.5 | 85.8 | 84.2 | 70.6 | 82 | 81.2 | |
| LLaMA13B Parallel + GASTModel=LLaMA13B, PEFT=Parallel + GAST2026.03 | 72.8 | 86.1 | 80.6 | 91 | 85.8 | 86 | 72.1 | 84 | 82.3 | |
| ControlBackbone=Qwen2.5-14B, % Params=0.43, Time (↓) (h)=6.5, GPU Mem. (↓) (GB)=58.72026.06 | 72.8 | 88.8 | 81.3 | 94.6 | 87.5 | 94.4 | 86.9 | 91.2 | 87.2 | |
| HydraLoRAModel=LLaMA-2 7B, Trainable Parameters (%)=0.842026.04 | 72.78 | 84.06 | 79.68 | 80.34 | 86.66 | 87.12 | 72.35 | 86 | 81.12 | |
| BUDDYPruning=dynamic, RM Blocks=8(28.6%)2026.06 | 72.78 | 72.52 | 46.42 | 59.92 | 60.77 | 68.9 | 40.02 | 36.4 | 57.22 | |
| LLMBRACESBase Model=Llama3-8B, Rank (r)=16, Param.=2.1M, Param. (%)=0.03%, Supervised Fine-tuning=true2025.03 | 72.75 | 88.52 | 81.17 | 95.27 | 86.42 | 92.59 | 80.97 | 87.8 | 85.69 | |
| LoRA-DashModel=LLaMA3-8B, Rank=16, Mem.=74.8G, Time=13.4h2025.07 | 72.72 | 87.21 | 79.17 | 94.65 | 87.37 | 89.52 | 76.96 | 86 | 84.2 | |
| LLaMA38B LoRA + ISTModel=LLaMA38B, PEFT=LoRA + IST2026.03 | 72.7 | 88.3 | 80.5 | 94.7 | 84.4 | 89.8 | 79.9 | 86.6 | 84.6 | |
| LLaMA13B Parallel + ISTModel=LLaMA13B, PEFT=Parallel + IST2026.03 | 72.6 | 86 | 79.2 | 89.1 | 83.5 | 84.8 | 70.6 | 82.8 | 81.1 | |
| TopLoRAModel=Llama-3-8B, Rank (r)=16, Params (%)=0.13692025.09 | 72.6 | 88.3 | 80.09 | 94.31 | 86.42 | 91.92 | 81.14 | 85.2 | 85 | |
| Parallel Adapters (LLaMA 13B)Model=LLaMA-13B, PEFT Method=Parallel*, # Params (%)=2.89%2024.05 | 72.5 | 84.8 | 79.8 | 92.1 | 84.7 | 84.2 | 71.2 | 82.4 | 81.5 | |
| DoRA (LLaMA 13B)Model=LLaMA-13B, PEFT Method=DoRA, # Params (%)=0.35%2024.05 | 72.5 | 85.3 | 79.9 | 90.1 | 82.9 | 82.7 | 69.7 | 83.6 | 80.8 | |
| ParallelModel=LLaMA-13B, Trainable Params (%)=2.89%2024.02 | 72.5 | 84.9 | 79.8 | 92.1 | 84.7 | 84.2 | 71.2 | 82.4 | 81.4 | |
| DoRA†Model=LLaMA-13B, Trainable Params (%)=0.35%, Configuration=rank halved2024.02 | 72.5 | 85.3 | 79.9 | 90.1 | 82.9 | 82.7 | 69.7 | 83.6 | 80.8 | |
| AdapterPModel=13B, #Paras.=2.89%2024.08 | 72.5 | 84.9 | 79.8 | 92.1 | 84.7 | 84.2 | 71.2 | 82.4 | 81.5 | |
| LLaMA13B ParallelModel=LLaMA13B, PEFT=Parallel2026.03 | 72.5 | 84.9 | 79.8 | 92.1 | 84.7 | 84.2 | 71.2 | 82.4 | 81.4 | |
| DoRA+ (LLaMA 13B)Model=LLaMA-13B, PEFT Method=DoRA+, # Params (%)=0.68%2024.05 | 72.4 | 84.9 | 81.5 | 92.4 | 84.2 | 84.2 | 69.6 | 82.8 | 81.5 | |
| QuanTA (LLaMA2 7B)Model=LLaMA2-7B, PEFT Method=QuanTA (Ours), # Params (%)=0.041%2024.05 | 72.4 | 83.8 | 79.7 | 92.5 | 83.9 | 85.3 | 72.5 | 82.6 | 81.6 | |
| DoRAModel=LLaMA-13B, Trainable Params (%)=0.68%2024.02 | 72.4 | 84.9 | 81.5 | 92.4 | 84.2 | 84.2 | 69.6 | 82.8 | 81.5 | |
| DORAModel=13B, #Paras.=0.68%2024.08 | 72.4 | 84.9 | 81.5 | 92.4 | 84.2 | 84.2 | 69.6 | 82.8 | 81.5 | |
| LoRA-XSBackbone=LLaMA-3.1-8B, fine-tuning=true, r=298, #Params=14.2M, Memory (GB)=56.22025.05 | 72.35 | 86.51 | 75.18 | 91.73 | 74.98 | 90.74 | 79.52 | 84 | 81.88 | |
| DoRABackbone=LLaMA2-7B, Params (%)=0.84, Mem=55.24G, rank=322024.07 | 72.3 | 84.2 | 78.7 | 88.5 | 84 | 80.7 | 69.1 | 83.7 | 80.2 | |
| LoRABackbone=LLaMA-3 8B, Evaluation Protocol=Fine-tuning, Param=28.3M, Time=8.0h, Mem=29G2024.06 | 72.3 | 86.7 | 79.3 | 93.5 | 84.8 | 87.7 | 75.7 | 82.8 | 82.8 | |
| Control*Backbone=LLaMA2-7B, % Params=0.50, Time (↓) (h)=4.2, GPU Mem. (↓) (GB)=42.62026.06 | 72.3 | 82.5 | 79.2 | 89.1 | 83.1 | 83 | 68.5 | 79 | 79.6 | |
| VeRABackbone=LLaMA3-8B, Params (%)=0.04, Mem=66.03G, rank=163842024.07 | 72.2 | 87.5 | 80 | 94.3 | 83.9 | 84.5 | 75.6 | 82.4 | 82.5 | |
| RoAd1Model=13B, #Paras.=0.02%2024.08 | 72.2 | 85.1 | 81.2 | 94.1 | 84.4 | 86.6 | 73.7 | 86.6 | 83 | |
| PSOFTBackbone=LLaMA-3.1-8B, fine-tuning=true, r=424, #Params=14.5M, Memory (GB)=58.42025.05 | 72.17 | 86.51 | 75.79 | 91.28 | 75.61 | 91.46 | 81.48 | 86 | 82.54 |