General Language Understanding on ARC, HellaSwag, MMLU, TruthfulQA, Winogrande, and GSM8K
55.55ARC ScoreTG-PT
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| TG-PT2024.06 | 55.55 | 78.69 | 45.04 | 38.44 | 73.56 | 11.9 | 50.53 | |
| Human (ShareGPT)Data Augmentation Strategy=Human (ShareGPT)2024.06 | 54.69 | 74.05 | 50.6 | 49.86 | 71.9 | 21.38 | 53.75 | |
| LLaMA-2-Base2024.06 | 54.01 | 78.63 | 45.6 | 38.92 | 73.95 | 13.27 | 50.73 | |
| LLaMA2-chat (LLM)Model Type=LLaMA2-chat (LLM)2024.06 | 53.5 | 78.58 | 47.24 | 45.32 | 72.53 | 23.28 | 53.41 | |
| TG-SFT (Balance-Tree)Data Augmentation Strategy=Balance-Tree2024.06 | 53.41 | 75.83 | 50.09 | 50.69 | 70.01 | 20.77 | 53.47 | |
| Random2024.06 | 51.62 | 62.07 | 44.79 | 41.03 | 71.43 | 0.45 | 45.23 | |
| LLaVA (LoRA)Model Type=LLaVA, Tuning Method=LoRA2024.06 | 51.02 | 74.08 | 48.75 | 47.49 | 70.24 | 16.98 | 51.43 | |
| LLaVA (Full-Param)Model Type=LLaVA, Tuning Method=Full-Param2024.06 | 49.06 | 72.71 | 47.98 | 49.26 | 68.75 | 15.85 | 50.6 | |
| TG-SFT (Wide-Tree)Data Augmentation Strategy=Wide-Tree2024.06 | 49.06 | 76.48 | 50.19 | 50.3 | 70.48 | 21.3 | 52.97 |