Math Word Problem solving on ASDiv-A (5-fold cross-val)
87.5AccuracyMSAT-DEDUCTREASONER
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MSAT-DEDUCTREASONERInput Configuration=digit tokenization, Pre-training method=MSAT2023.06 | 87.5 | 2.5 | |
| DEDUCTREASONERInput Configuration=symbolic masks2023.06 | 85 | — | |
| DEDUCTREASONERInput Configuration=digit tokenization2023.06 | 84.1 | -0.9 | |
| MSAT-ROBERTAGENInput Configuration=digit tokenization, Pre-training method=MSAT2023.06 | 81.8 | 9.7 | |
| Large language models w/ Chain-of-Thought promptingBackbone=code-davinci-002, Prompting strategy=Chain-of-Thought2023.06 | 80.4 | — | |
| ROBERTAGENInput Configuration=symbolic masks2023.06 | 72.1 | — | |
| ROBERTAGENInput Configuration=digit tokenization2023.06 | 71.9 | -0.2 |