Financial Question Answering on FinQA
83.46AccuracyTaNOS
Evaluation Results
| Method | Links | |
|---|---|---|
| TaNOSTrain Data=FinQA2026.04 | 83.46 | |
| Formula-R1-PlusBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 80.47 | |
| Fin-R1Parameters=7B2025.03 | 76 | |
| SMCS2025.07 | 75.24 | |
| Self-MoA2025.07 | 74.11 | |
| QwQ-32B2025.07 | 73.67 | |
| GPT-4.12025.07 | 72.97 | |
| Qwen2.5-32B-InstructParameters=32B2025.03 | 72 | |
| DeepSeek-R1Parameters=671B2025.03 | 71 | |
| DeepSeek-R1-Distill-Qwen-32BParameters=32B2025.03 | 70 | |
| RL-F1Reward=RL-F1, Rollout-Group Rejection (Rubric)=false, Rollout-Group Rejection (Variance)=false2025.06 | 69 | |
| SFTTrain Data=FinQA2026.04 | 68.72 | |
| Full DROReward=DRO, Rollout-Group Rejection (Rubric)=true, Rollout-Group Rejection (Variance)=true2025.06 | 68.4 | |
| Qwen2.5-14B-InstructParameters=14B2025.03 | 68 | |
| DeepSeek-R1-Distill-Llama-70BParameters=70B2025.03 | 68 | |
| R3Reward=R3, Rollout-Group Rejection (Rubric)=false, Rollout-Group Rejection (Variance)=false2025.06 | 67.1 | |
| Avg Prob (RLPR)Reward=Avg Prob (RLPR), Rollout-Group Rejection (Rubric)=false, Rollout-Group Rejection (Variance)=false2025.06 | 66.8 | |
| TableMasterBackbone=GPT-4o-mini, Evaluation Protocol=Prompting-Based2025.05 | 66.4 | |
| Avg Logprob (VeriFree)Reward=Avg Logprob (VeriFree), Rollout-Group Rejection (Rubric)=false, Rollout-Group Rejection (Variance)=false2025.06 | 66.4 | |
| Formula-R1Backbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 62.16 | |
| DeepSeek-R1-Distill-Qwen-14BParameters=14B2025.03 | 62 | |
| Qwen2.5-7B-InstructParameters=7B2025.03 | 60 | |
| BaseReward=Base2025.06 | 58.1 | |
| DeepSeek-R1-Distill-Qwen-7BParameters=7B2025.03 | 55 | |
| SFTTrain Data=MultiHiertt2026.04 | 50.51 | |
| TabAFBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based, Distribution Setting=Out-of-distribution2025.05 | 45.07 | |
| TableGPT2Backbone=Qwen 2.5 7B, Evaluation Protocol=Finetuning-Based, Distribution Setting=Out-of-distribution2025.05 | 40.28 | |
| SFTTrain Data=NumReason-5002026.04 | 27.44 | |
| TableLLMBackbone=Qwen 7B, Evaluation Protocol=Finetuning-Based, Distribution Setting=Out-of-distribution2025.05 | 8.63 | |
| TableLlamaBackbone=Llama-2 7B, Evaluation Protocol=Finetuning-Based, Distribution Setting=Out-of-distribution2025.05 | 2.27 |