Entity Reasoning on Spatio-Temporal Synthetic Dataset 1.0 (test)
75.71AccuracySTReasoner-8B (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| STReasoner-8B (Ours)Category=Spatio-Temporal RMs, Prompting=TS Encoder, Tokens (M)=0.50, Est. Cost ($)=0.272026.01 | 75.71 | |
| Qwen3-VL-8B-Instruct - SFT+S-GRPOCategory=Open-Source Models, Prompting=Image, Tokens (M)=1.20, Est. Cost ($)=0.662026.01 | 69.43 | |
| Qwen3-8B - SFT+S-GRPOCategory=Open-Source Models, Prompting=Text, Tokens (M)=7.31, Est. Cost ($)=3.852026.01 | 65.41 | |
| Qwen3-8B - SFTCategory=Open-Source Models, Prompting=Text, Tokens (M)=7.31, Est. Cost ($)=3.852026.01 | 62.65 | |
| Qwen3-VL-8B-Instruct - SFTCategory=Open-Source Models, Prompting=Image, Tokens (M)=1.20, Est. Cost ($)=0.662026.01 | 61.31 | |
| Claude-4.5-SonnetCategory=Proprietary Models, Prompting=Text, Tokens (M)=5.67, Est. Cost ($)=45.802026.01 | 41.93 | |
| Claude-4.5-SonnetCategory=Proprietary Models, Prompting=Image, Tokens (M)=2.12, Est. Cost ($)=17.482026.01 | 41.85 | |
| GPT-5.2Category=Proprietary Models, Prompting=Image, Tokens (M)=1.38, Est. Cost ($)=6.692026.01 | 40.54 | |
| GPT-5.2Category=Proprietary Models, Prompting=Text, Tokens (M)=4.86, Est. Cost ($)=22.482026.01 | 38.78 | |
| Qwen3-VL-8B-InstructCategory=Open-Source Models, Prompting=Image, Tokens (M)=1.20, Est. Cost ($)=0.662026.01 | 31.16 | |
| Time-R1-7BCategory=Time Series RMs, Prompting=Text, Tokens (M)=7.31, Est. Cost ($)=3.852026.01 | 29.65 | |
| ChatTS-8BCategory=Time Series LMs, Prompting=TS Encoder, Tokens (M)=0.50, Est. Cost ($)=0.272026.01 | 19.51 | |
| Time-MQA-7BCategory=Time Series LMs, Prompting=Text, Tokens (M)=7.31, Est. Cost ($)=3.852026.01 | 14.24 | |
| Qwen3-8BCategory=Open-Source Models, Prompting=Text, Tokens (M)=7.31, Est. Cost ($)=3.852026.01 | 5.28 |