Reasoning on TWI-oriented TreeBench online setting
37.1AccuracyRTWI
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RTWIModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 37.1 | 40.8 | 59.4 | |
| DeepconfModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 35.6 | 39.3 | 51.7 | |
| RTWIModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34.8 | 45.8 | 42.8 | |
| CISCModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34.4 | 43.5 | 38.6 | |
| DeepconfModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34.4 | 43.3 | 33.8 | |
| Self-Cer.Model Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34.4 | 43.4 | 42.3 | |
| BaseModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34 | — | — | |
| SCModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34 | 43.4 | — | |
| ASCModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34 | 43.6 | 41.2 | |
| ESCModel Variant=Qwen3-VL Instruct, Setting=Online2026.02 | 34 | 43.5 | 26.8 | |
| BaseModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 32.8 | — | — | |
| SCModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 30.9 | 37.8 | — | |
| ASCModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 30.9 | 37.7 | 32.1 | |
| ESCModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 30.9 | 37.7 | 10.7 | |
| Self-Cer.Model Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 30.9 | 37.6 | 32.3 | |
| CISCModel Variant=Qwen3-VL Thinking, Setting=Online2026.02 | 27.7 | 36.5 | 48.9 |