83 global sensemaking questions
4.87Overall ScoreKEO
Evaluation Results
| Method | Links | |
|---|---|---|
| KEOBackbone=gemma-3-it, Evaluator=Llama-3.3-it2025.10 | 4.87 | |
| Text-Chunk RAGBackbone=gemma-3-it, Evaluator=Llama-3.3-it2025.10 | 4.47 | |
| KEOBackbone=phi-4, Evaluator=Llama-3.3-it2025.10 | 4.44 | |
| KEOBackbone=mistral-nemo-it, Evaluator=Llama-3.3-it2025.10 | 4.39 | |
| Text-Chunk RAGBackbone=phi-4, Evaluator=Llama-3.3-it2025.10 | 4.33 | |
| Vanilla LLMBackbone=phi-4, Evaluator=Llama-3.3-it2025.10 | 4.32 | |
| Text-Chunk RAGBackbone=mistral-nemo-it, Evaluator=Llama-3.3-it2025.10 | 4.32 | |
| KEOBackbone=gemma-3-it, Evaluator=GPT-4o2025.10 | 4.31 | |
| Vanilla LLMBackbone=gemma-3-it, Evaluator=Llama-3.3-it2025.10 | 4.29 | |
| Vanilla LLMBackbone=mistral-nemo-it, Evaluator=Llama-3.3-it2025.10 | 4.13 | |
| Text-Chunk RAGBackbone=gemma-3-it, Evaluator=GPT-4o2025.10 | 4.12 | |
| KEOBackbone=phi-4, Evaluator=GPT-4o2025.10 | 4.09 | |
| Text-Chunk RAGBackbone=phi-4, Evaluator=GPT-4o2025.10 | 3.9 | |
| KEOBackbone=mistral-nemo-it, Evaluator=GPT-4o2025.10 | 3.87 | |
| Text-Chunk RAGBackbone=mistral-nemo-it, Evaluator=GPT-4o2025.10 | 3.84 | |
| Vanilla LLMBackbone=gemma-3-it, Evaluator=GPT-4o2025.10 | 3.7 | |
| Vanilla LLMBackbone=phi-4, Evaluator=GPT-4o2025.10 | 3.68 | |
| Vanilla LLMBackbone=mistral-nemo-it, Evaluator=GPT-4o2025.10 | 3.39 |