Question Answering on QA Dataset 150 questions Overall
86.7Accuracyoracle
Evaluation Results
| Method | Links | |
|---|---|---|
| oracleModel=GPT-4o-mini, Tokens=2992026.03 | 86.7 | |
| oracleModel=GPT-3.5, Tokens=2992026.03 | 85.3 | |
| stm+sum+ltmModel=GPT-3.5, Tokens=5912026.03 | 85.3 | |
| stm+sum+ltmModel=GPT-4o-mini, Tokens=5912026.03 | 84.7 | |
| uniformModel=GPT-3.5, Tokens=7872026.03 | 83.3 | |
| uniformModel=GPT-4o-mini, Tokens=7872026.03 | 81.3 | |
| hybridModel=GPT-4o-mini, Tokens=3792026.03 | 70.7 | |
| hybridModel=GPT-3.5, Tokens=3792026.03 | 69.3 |