Insight-level Evaluation on SCOpE-QA Ethical Bias & Fairness collection
4.5Insight-level ScoreINSIGHTGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.5 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.3 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.21 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.76 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.56 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 3.49 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.42 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.36 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.22 | |
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 3.2 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.12 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 2.9 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.65 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.54 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.51 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.47 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.43 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.37 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.37 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.32 |