Language Modeling on Finance (Fin)
0PPL Change (%)GAIN
Evaluation Results
| Method | Links | |
|---|---|---|
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+Med2026.04 | 0 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+WT2026.04 | 0.1 | |
| LoRABackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+PG2026.04 | 1.3 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+Med2026.04 | 2.5 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+PG2026.04 | 4.2 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+HS2026.04 | 4.6 | |
| GAINBackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+HS2026.04 | 4.7 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+SST2026.04 | 4.8 | |
| GAINBackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+MdQ2026.04 | 4.9 | |
| GAINBackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+SST2026.04 | 4.9 | |
| GAINBackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+Fin2026.04 | 5 | |
| GAINBackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+PG2026.04 | 5 | |
| GAINBackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+LB2026.04 | 5 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+LB2026.04 | 5.2 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+MdQ2026.04 | 5.4 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+Fin2026.04 | 5.6 | |
| GAINBackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+PG2026.04 | 5.7 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+MdQ2026.04 | 6.4 | |
| LoRABackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+MdQ2026.04 | 7.4 | |
| LoRABackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+Fin2026.04 | 7.8 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+SST2026.04 | 11.6 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+Fin2026.04 | 13.4 | |
| LoRABackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+LB2026.04 | 13.7 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+LB2026.04 | 15.5 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+WT2026.04 | 16.3 | |
| LoRABackbone=GPT-2 Large (774M), Learning rate=10^-3, Training sequence stage=+HS2026.04 | 37.4 | |
| LoRABackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+SST2026.04 | 48 | |
| LoRABackbone=Mistral-7B, Learning Rate=10⁻³, Tokens per domain=200K, Training Stage=+HS2026.04 | 50.6 |