Cross-modal multi-expert orchestration on FinQA
86.1AccuracyQwen-2-72B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-2-72B-Instruct#Tok=1,640, TFLOPs=236.2, Lat. (s)=20.6, GPU DRAM Usage (GB)=> 145.02026.05 | 86.1 | |
| DynaGraph (Ours, 8B)#Tok=2,480, TFLOPs=39.7, Lat. (s)=30.2, GPU DRAM Usage (GB)=16.6 (O(1))2026.05 | 82.5 | |
| Standard ToT#Tok=6,930, TFLOPs=110.9, Lat. (s)=76.3, GPU DRAM Usage (GB)=16.52026.05 | 80.7 | |
| Reflexion#Tok=7,690, TFLOPs=123.0, Lat. (s)=86.9, GPU DRAM Usage (GB)=16.52026.05 | 78.8 | |
| Multi-Agent (3 × 8B)#Tok=2,780, TFLOPs=44.5, Lat. (s)=34.3, GPU DRAM Usage (GB)=> 49.52026.05 | 77.6 | |
| Self-Consistency (k=5)#Tok=3,490, TFLOPs=55.8, Lat. (s)=38.4, GPU DRAM Usage (GB)=16.52026.05 | 76.4 | |
| ReAct#Tok=5,080, TFLOPs=81.3, Lat. (s)=59.5, GPU DRAM Usage (GB)=16.52026.05 | 76.2 | |
| Standard CoT#Tok=1,260, TFLOPs=20.2, Lat. (s)=14.9, GPU DRAM Usage (GB)=16.52026.05 | 70.5 | |
| Standard Prompting#Tok=420, TFLOPs=6.7, Lat. (s)=4.8, GPU DRAM Usage (GB)=16.52026.05 | 55 |