Financial Reasoning on Financial Reasoning Tasks and FinAgent Aggregated (Overall Avg)
74.9Overall Average AccuracySupervisor-Committee + DoC
Evaluation Results
| Method | Links | |
|---|---|---|
| Supervisor-Committee + DoCBackbone=Gemini 3.1 Pro, Evaluation Protocol=LLM-as-a-Judge2026.05 | 74.9 | |
| Supervisor-CommitteeBackbone=Gemini 3.1 Pro, Evaluation Protocol=LLM-as-a-Judge2026.05 | 65.2 | |
| Supervisor + AgentsBackbone=Gemini 3.1 Pro, Evaluation Protocol=LLM-as-a-Judge2026.05 | 64.7 | |
| LLMBackbone=Gemini 3.1 Pro, Evaluation Protocol=LLM-as-a-Judge2026.05 | 54.3 | |
| LLM + Tools (ReAct)Backbone=Gemini 3.1 Pro, Evaluation Protocol=LLM-as-a-Judge2026.05 | 52.3 |