Insight-level Evaluation on SCOpE-QA LLM for Healthcare collection
4.32Insight-level ScoreINSIGHTGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.32 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.15 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 4.02 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.67 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.64 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.6 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.57 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.52 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.51 | |
| INSIGHTGENTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 3.44 | |
| INSIGHTGENTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 3.4 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Gemini-1.5-Flash2026.04 | 3.3 | |
| FAISS+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.96 | |
| FAISSTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.65 | |
| FAISS+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.51 | |
| Direct GPTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.43 | |
| FAISSTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2.17 | |
| GPT+COTTarget Model=GPT-4o, Evaluator Model=Claude-3-Sonnet2026.04 | 2.13 | |
| Direct GPTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 2 | |
| GPT+COTTarget Model=Claude-3.5-Sonnet, Evaluator Model=Claude-3-Sonnet2026.04 | 1.84 |