Insight-level Evaluation on SCOpE-QA Quantization collection
4.42Insight ScoreINSIGHTGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.42 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.01 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.89 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.86 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.8 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.72 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.39 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.33 | |
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 3.18 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.08 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 2.99 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.99 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.83 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.78 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.66 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.56 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.48 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.3 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.26 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 1.9 |