Knowledge-based reasoning on CTU
67.5AccuracyVeriTime
Evaluation Results
| Method | Links | |
|---|---|---|
| VeriTimeModel Category=Base: Qwen3-4B-Instruct, Method Variant=VeriTime (SFT+RL)2026.02 | 67.5 | |
| AutoformerModel Category=Classical Models2026.02 | 67.2 | |
| VeriTimeModel Category=Base: Qwen2.5-3B-Instruct, Method Variant=VeriTime (SFT+RL)2026.02 | 64.93 | |
| PatchTSTModel Category=Classical Models2026.02 | 64 | |
| TimesNetModel Category=Classical Models2026.02 | 64 | |
| Time-R1Model Category=Time Series Language Models, Backbone=Qwen2.5-7B2026.02 | 59.17 | |
| Mistral-7B-v0.3Model Category=General LLMs2026.02 | 54.24 | |
| GPT-4o-miniModel Category=General LLMs2026.02 | 53.39 | |
| Qwen2.5-3B-Instruct (Base)Model Category=Base: Qwen2.5-3B-Instruct, Method Variant=Base2026.02 | 52.54 | |
| DLinearModel Category=Classical Models2026.02 | 52.4 | |
| FEDformerModel Category=Classical Models2026.02 | 51.6 | |
| Qwen2.5-7B-InstructModel Category=General LLMs2026.02 | 50.85 | |
| iTransformerModel Category=Classical Models2026.02 | 46.4 | |
| Qwen3-4B-Instruct (Base)Model Category=Base: Qwen3-4B-Instruct, Method Variant=Base2026.02 | 42.5 | |
| Time-MQAModel Category=Time Series Language Models, Backbone=Qwen2.5-7B2026.02 | 38.4 | |
| Time-MQAModel Category=Time Series Language Models, Backbone=Mistral-7B2026.02 | 37.5 | |
| Meta-Llama3-8B-InstructModel Category=General LLMs2026.02 | 37.29 | |
| DeepSeek-R1-Distill-Qwen-7BModel Category=General LLMs2026.02 | 34.75 | |
| Time-MQAModel Category=Time Series Language Models, Backbone=Llama3-8B2026.02 | 30.77 |