Reasoning on TSEvol and TS&Language 1.0 (test)
0.634Causal ScoreTSLM+GRLM
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| TSLM+GRLMParadigm=RL-Injection, GRLM Backbone=R1-Distilled-Qwen-32B2026.02 | 0.634 | 0.543 | 0.532 | 0.537 | 0.561 | 10.4 | 7.9 | |
| TSLM (Qwen-VL-3B)Paradigm=RL2026.02 | 0.627 | 0.496 | 0.313 | 0.597 | 0.508 | — | — | |
| TSLM+GRLMParadigm=RL-Injection, GRLM Backbone=Qwen3-32B2026.02 | 0.627 | 0.512 | 0.588 | 0.49 | 0.554 | 9.1 | 10.4 | |
| TSLM (Qwen-VL-3B)Paradigm=SFT2026.02 | 0.623 | 0.52 | 0.357 | 0.507 | 0.502 | — | — | |
| GRLM (Qwen3-32B)Paradigm=Few-shot2026.02 | 0.622 | 0.473 | 0.46 | 0.427 | 0.495 | — | -1.4 | |
| TSLM+GRLMParadigm=SFT-Injection, GRLM Backbone=R1-Distilled-Qwen-32B2026.02 | 0.594 | 0.535 | 0.519 | 0.49 | 0.534 | 6.4 | 2.7 | |
| TSLM+GRLMParadigm=SFT-Injection, GRLM Backbone=Qwen3-32B2026.02 | 0.569 | 0.543 | 0.592 | 0.41 | 0.528 | 5.2 | 5.2 | |
| GRLM (R1-Distilled-Qwen-32B)Paradigm=Few-shot2026.02 | 0.542 | 0.558 | 0.478 | 0.513 | 0.523 | — | 0.6 | |
| GRLM (R1-Distilled-Qwen-32B)Paradigm=Zero-shot2026.02 | 0.522 | 0.55 | 0.525 | 0.483 | 0.52 | — | — | |
| GRLM (Qwen3-32B)Paradigm=Zero-shot2026.02 | 0.507 | 0.473 | 0.623 | 0.407 | 0.502 | — | — |