Insight-level Evaluation on SCOpE-QA Preference Optimization collection
4.47Insight-level ScoreINSIGHTGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.47 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.13 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.07 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.73 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.7 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.45 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.37 | |
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 3.15 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 3.13 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.01 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 2.94 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 2.92 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.72 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.56 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.38 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.33 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.32 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.32 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.25 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 1.81 |