Well-being support evaluation on 10 situational well-being prompts (test)
9.5ScoreClaude 3.7 Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude 3.7 SonnetJudge=GPT-52025.11 | 9.5 | |
| GPT-4oJudge=GPT-4o2025.11 | 8.9 | |
| GPT-4oJudge=GPT-52025.11 | 8.8 | |
| Claude 3.7 SonnetJudge=GPT-4o2025.11 | 8.7 | |
| Gemma-3Judge=GPT-4o2025.11 | 8.7 | |
| LLaMA-3Judge=GPT-52025.11 | 8.6 | |
| LLaMA-3Judge=GPT-4o2025.11 | 8.6 | |
| Al LunaJudge=GPT-52025.11 | 8.5 | |
| Gemma-3Judge=GPT-52025.11 | 8.5 | |
| Al LunaJudge=GPT-4o2025.11 | 8.5 | |
| LlamaSupportJudge=GPT-52025.11 | 8.4 | |
| LlamaSupportJudge=GPT-4o2025.11 | 8.4 | |
| MistralJudge=GPT-4o2025.11 | 8.3 | |
| MistralJudge=GPT-52025.11 | 7.9 | |
| Phi-4Judge=GPT-52025.11 | 7.3 | |
| Phi-4Judge=GPT-4o2025.11 | 7.3 | |
| MentalLLaMA-2Judge=GPT-4o2025.11 | 6.5 | |
| MentalLLaMA-2Judge=GPT-52025.11 | 5.8 | |
| Tell MeJudge=Human, Pipeline=RAG Pipeline2025.11 | 3.8 | |
| Tell MeJudge=Human, Pipeline=Non-RAG (Baseline)2025.11 | 3.6 |