Correlation Reasoning on Spatio-Temporal Synthetic Dataset 1.0 (test)
87.12AccuracySTReasoner-8B (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| STReasoner-8B (Ours)Category=Spatio-Temporal RMs, Prompting=TS Encoder, Tokens (M)=0.72, Est. Cost ($)=0.272026.01 | 87.12 | |
| Qwen3-VL-8B-Instruct - SFT+S-GRPOCategory=Open-Source Models, Prompting=Image, Tokens (M)=1.65, Est. Cost ($)=0.662026.01 | 83.92 | |
| Qwen3-8B - SFT+S-GRPOCategory=Open-Source Models, Prompting=Text, Tokens (M)=10.26, Est. Cost ($)=3.852026.01 | 81.34 | |
| Qwen3-VL-8B-Instruct - SFTCategory=Open-Source Models, Prompting=Image, Tokens (M)=1.65, Est. Cost ($)=0.662026.01 | 80.78 | |
| Qwen3-8B - SFTCategory=Open-Source Models, Prompting=Text, Tokens (M)=10.26, Est. Cost ($)=3.852026.01 | 79.84 | |
| Claude-4.5-SonnetCategory=Proprietary Models, Prompting=Text, Tokens (M)=8.05, Est. Cost ($)=45.802026.01 | 77.87 | |
| Claude-4.5-SonnetCategory=Proprietary Models, Prompting=Image, Tokens (M)=2.84, Est. Cost ($)=17.482026.01 | 76.04 | |
| GPT-5.2Category=Proprietary Models, Prompting=Image, Tokens (M)=1.89, Est. Cost ($)=6.692026.01 | 65.08 | |
| GPT-5.2Category=Proprietary Models, Prompting=Text, Tokens (M)=6.84, Est. Cost ($)=22.482026.01 | 58.79 | |
| Qwen3-VL-8B-InstructCategory=Open-Source Models, Prompting=Image, Tokens (M)=1.65, Est. Cost ($)=0.662026.01 | 53.52 | |
| Time-R1-7BCategory=Time Series RMs, Prompting=Text, Tokens (M)=10.26, Est. Cost ($)=3.852026.01 | 48.62 | |
| ChatTS-8BCategory=Time Series LMs, Prompting=TS Encoder, Tokens (M)=0.72, Est. Cost ($)=0.272026.01 | 41.08 | |
| Time-MQA-7BCategory=Time Series LMs, Prompting=Text, Tokens (M)=10.26, Est. Cost ($)=3.852026.01 | 17.9 | |
| Qwen3-8BCategory=Open-Source Models, Prompting=Text, Tokens (M)=10.26, Est. Cost ($)=3.852026.01 | 5.53 |