Conversational Evaluation on CoReflect 1.0 (Iteration 3)
4.86ODIGemini 2.5 Pro
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Gemini 2.5 ProIteration=3, Rating Scale=1-52026.01 | 4.86 | 4.86 | 4.7 | 4.81 | 4.76 | 4.86 | 4.79 | 4.8 | 4.81 | |
| Gemini 2.5 FlashIteration=3, Rating Scale=1-52026.01 | 4.79 | 4.72 | 4.12 | 4.6 | 4.7 | 4.72 | 4.76 | 4.75 | 4.68 | |
| Qwen3-NextIteration=3, Rating Scale=1-52026.01 | 4.73 | 4.03 | 4.5 | 4.42 | 4.62 | 4.72 | 4.7 | 4.68 | 4.55 | |
| DeepSeek-R1Iteration=3, Rating Scale=1-52026.01 | 4.68 | 4.65 | 4.59 | 4.64 | 4.6 | 4.54 | 4.54 | 4.56 | 4.6 | |
| Claude Sonnet 4Iteration=3, Rating Scale=1-52026.01 | 4.65 | 4.76 | 4.25 | 4.56 | 4.75 | 4.74 | 4.73 | 4.74 | 4.65 | |
| Claude Sonnet 4.5Iteration=3, Rating Scale=1-52026.01 | 4.37 | 4.69 | 3.53 | 4.2 | 4.13 | 4.68 | 4.57 | 4.46 | 4.33 | |
| Claude Haiku 4.5Iteration=3, Rating Scale=1-52026.01 | 4.02 | 4.64 | 3.16 | 3.94 | 4.47 | 4.57 | 4.61 | 4.55 | 4.25 |