Time-series reasoning on HAR-CoT 1.0 (test)
65.44F1 ScoreOpenTSLM SoftPrompt (Llama3.2-1B)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OpenTSLM SoftPrompt (Llama3.2-1B)Category=OpenTSLM SoftPrompt, Base Model=Llama3.2-1B2025.10 | 65.44 | 71.48 | |
| OpenTSLM Flamingo (Gemma3-1B-pt)Category=OpenTSLM Flamingo, Base Model=Gemma3-1B-pt2025.10 | 65.44 | 71.48 | |
| OpenTSLM SoftPrompt (Llama3.2-3B)Category=OpenTSLM SoftPrompt, Base Model=Llama3.2-3B2025.10 | 64.87 | 67.89 | |
| OpenTSLM Flamingo (Llama3.2-1B)Category=OpenTSLM Flamingo, Base Model=Llama3.2-1B2025.10 | 62.93 | 69.27 | |
| OpenTSLM Flamingo (Llama3.2-3B)Category=OpenTSLM Flamingo, Base Model=Llama3.2-3B2025.10 | 62.77 | 69.03 | |
| Llama3.2-3BCategory=Tokenized Finetuned, Protocol=LoRA Finetuned2025.10 | 60.44 | 66.87 | |
| OpenTSLM Flamingo (Gemma3-270M)Category=OpenTSLM Flamingo, Base Model=Gemma3-270M2025.10 | 57.75 | 63.43 | |
| Gemma3-1B-ptCategory=Tokenized Finetuned, Protocol=LoRA Finetuned2025.10 | 52.15 | 63.9 | |
| Llama3.2-1BCategory=Tokenized Finetuned, Protocol=LoRA Finetuned2025.10 | 51.28 | 62.71 | |
| Gemma3-4B FTCategory=Image (Plot), Protocol=Finetuned2025.10 | 44.01 | 51.02 | |
| Gemma3-270MCategory=Tokenized Finetuned, Protocol=LoRA Finetuned2025.10 | 40.66 | 54.56 | |
| Random BaselineCategory=Random Baseline2025.10 | 11.49 | 12.5 | |
| GPT-4oCategory=Image (Plot), Protocol=Zero-shot2025.10 | 10.83 | 13.9 | |
| GPT-4oCategory=Tokenized Time-Series, Protocol=Zero-shot2025.10 | 2.95 | 11.74 |