Question Answering on TabMWP (Accuracy)
88.04Accuracyzero-shot
Evaluation Results
| Method | Links | |
|---|---|---|
| zero-shotSetting=Tuned LLM (LoRA)2026.06 | 88.04 | |
| GRABSetting=Tuned LLM (LoRA)2026.06 | 87.78 | |
| GRABSetting=Frozen LLM2026.06 | 87.01 | |
| Prompt tuningSetting=Frozen LLM2026.06 | 84.75 | |
| TAMOSetting=Frozen LLM2026.06 | 84.49 | |
| TableLLamaSetting=Others2026.06 | 80.05 | |
| GPT-5.4-miniSetting=Others2026.06 | 72.06 | |
| NWCADModel=Ministral-3-8B2026.04 | 54.2 | |
| AdaCADModel=Ministral-3-8B2026.04 | 53.8 | |
| CoCoAModel=Ministral-3-8B2026.04 | 53.2 | |
| CADModel=Ministral-3-8B2026.04 | 52.2 | |
| NWCADModel=Llama-3.1-70B2026.04 | 50 | |
| AdaCADModel=Llama-3.1-70B2026.04 | 49.12 | |
| CoCoAModel=Llama-3.1-70B2026.04 | 45.88 | |
| NWCADModel=Llama-3.1-8B2026.04 | 36 | |
| zero-shotSetting=Inference-only2026.06 | 34.75 | |
| AdaCADModel=Llama-3.1-8B2026.04 | 34.4 | |
| With-contextModel=Ministral-3-8B2026.04 | 31.8 | |
| CoCoAModel=Llama-3.1-8B2026.04 | 30.2 | |
| CADModel=Llama-3.1-70B2026.04 | 30 | |
| With-contextModel=Llama-3.1-70B2026.04 | 28.38 | |
| CADModel=Llama-3.1-8B2026.04 | 27.2 | |
| With-contextModel=Llama-3.1-8B2026.04 | 18.4 | |
| BaselineModel=Llama-3.1-70B2026.04 | 6.62 | |
| BaselineModel=Llama-3.1-8B2026.04 | 5.2 | |
| BaselineModel=Ministral-3-8B2026.04 | 5 |