Spreadsheet Understanding on SpreadsheetLLM benchmark
91Answer AccuracySpreadsheetLLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SpreadsheetLLMTechnique=SpreadsheetLLM, Model=Claude Sonnet 4.52026.01 | 91 | 5.49 | |
| SpreadsheetLLMTechnique=SpreadsheetLLM, Model=GPT-52026.01 | 90 | 5.5 | |
| SpreadsheetLLMTechnique=SpreadsheetLLM, Model=Gemini 2.5 Pro2026.01 | 89 | 10 | |
| FRTRTechnique=FRTR, Model=GPT-52026.01 | 87 | 18.06 | |
| FRTRTechnique=FRTR, Model=Gemini 2.5 Pro2026.01 | 85 | 24.06 | |
| FRTRTechnique=FRTR, Model=Claude Sonnet 4.52026.01 | 84 | 10.4 | |
| SpreadsheetLLMTechnique=SpreadsheetLLM, Model=GPT-OSS-120b2026.01 | 80 | 4.01 | |
| SpreadsheetLLMTechnique=SpreadsheetLLM, Model=GPT-4o2026.01 | 78 | 0.81 | |
| FRTRTechnique=FRTR, Model=GPT-4o2026.01 | 77 | 2.48 | |
| FRTRTechnique=FRTR, Model=GPT-OSS-120b2026.01 | 75 | 7.37 | |
| SpreadsheetLLMTechnique=SpreadsheetLLM, Model=LLaMA Maverick-17B-instruct2026.01 | 73 | 0.73 | |
| Naïve Full-ContextTechnique=Naïve Full-Context, Model=GPT-52026.01 | 68 | 18.07 | |
| Naïve Full-ContextTechnique=Naïve Full-Context, Model=Gemini 2.5 Pro2026.01 | 67 | 15.48 | |
| Naïve Full-ContextTechnique=Naïve Full-Context, Model=GPT-OSS-120b2026.01 | 59 | 8.61 | |
| Naïve Full-ContextTechnique=Naïve Full-Context, Model=Claude Sonnet 4.52026.01 | 55 | 9.06 | |
| FRTRTechnique=FRTR, Model=LLaMA Maverick-17B-instruct2026.01 | 53 | 2.18 | |
| Naïve Full-ContextTechnique=Naïve Full-Context, Model=LLaMA Maverick-17B-instruct2026.01 | 41 | 2.45 | |
| Naïve Full-ContextTechnique=Naïve Full-Context, Model=GPT-4o2026.01 | 35 | 3.01 |