Natural Language Reasoning on Big-GSM
54.4AccuracyTCR
Evaluation Results
| Method | Links | |
|---|---|---|
| TCRBackbone Model=Qwen2.5-7B-Instruct2026.01 | 54.4 | |
| TCRBackbone Model=Phi-3-Instruct2026.01 | 53.9 | |
| Base ModelBackbone Model=Qwen2.5-7B-Instruct2026.01 | 52.7 | |
| Base ModelBackbone Model=Phi-3-Instruct2026.01 | 52.5 |