Mental Health Assistant Evaluation on 10 situational well-being prompts
8.9ScoreGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oJudge=GPT-4o, Rank=12025.11 | 8.9 | |
| Claude 3.7 SonnetJudge=GPT-4o, Rank=22025.11 | 8.7 | |
| Gemma-3Judge=GPT-4o, Rank=22025.11 | 8.7 | |
| LLaMA-3Judge=GPT-4o, Rank=42025.11 | 8.6 | |
| Al LunaJudge=GPT-4o, Rank=52025.11 | 8.5 | |
| LlamaSupportJudge=GPT-4o, Rank=62025.11 | 8.4 | |
| MistralJudge=GPT-4o, Rank=72025.11 | 8.3 | |
| Phi-4Judge=GPT-4o, Rank=82025.11 | 7.3 | |
| MentalLLaMA-2Judge=GPT-4o, Rank=92025.11 | 6.5 |