Knowledge-based reasoning on RCW
64.89AccuracyVeriTime
Evaluation Results
| Method | Links | |
|---|---|---|
| VeriTimeModel Category=Base: Qwen2.5-3B-Instruct, Method Variant=VeriTime (SFT+RL)2026.02 | 64.89 | |
| VeriTimeModel Category=Base: Qwen3-4B-Instruct, Method Variant=VeriTime (SFT+RL)2026.02 | 63.59 | |
| FEDformerModel Category=Classical Models2026.02 | 62.28 | |
| TimesNetModel Category=Classical Models2026.02 | 59.33 | |
| AutoformerModel Category=Classical Models2026.02 | 58.92 | |
| iTransformerModel Category=Classical Models2026.02 | 55.71 | |
| PatchTSTModel Category=Classical Models2026.02 | 52.14 | |
| Time-MQAModel Category=Time Series Language Models, Backbone=Mistral-7B2026.02 | 44.62 | |
| Qwen2.5-3B-Instruct (Base)Model Category=Base: Qwen2.5-3B-Instruct, Method Variant=Base2026.02 | 43.32 | |
| Qwen3-4B-Instruct (Base)Model Category=Base: Qwen3-4B-Instruct, Method Variant=Base2026.02 | 43.08 | |
| Meta-Llama3-8B-InstructModel Category=General LLMs2026.02 | 42.78 | |
| Mistral-7B-v0.3Model Category=General LLMs2026.02 | 41.71 | |
| DLinearModel Category=Classical Models2026.02 | 39.55 | |
| Time-MQAModel Category=Time Series Language Models, Backbone=Llama3-8B2026.02 | 38.57 | |
| Time-MQAModel Category=Time Series Language Models, Backbone=Qwen2.5-7B2026.02 | 36.84 | |
| Time-R1Model Category=Time Series Language Models, Backbone=Qwen2.5-7B2026.02 | 33.52 | |
| GPT-4o-miniModel Category=General LLMs2026.02 | 31.55 | |
| Qwen2.5-7B-InstructModel Category=General LLMs2026.02 | 29.95 | |
| DeepSeek-R1-Distill-Qwen-7BModel Category=General LLMs2026.02 | 28.88 |