Automated evaluation of tutor responses on MRBench extended (test)
0.646Macro-F1BJTU
Evaluation Results
| Method | Links | |
|---|---|---|
| BJTU# LLMs=4 (Qwen/Qwen2.5-72B), # Parameters=288B, Parameter Size vs. 2B=144x larger2025.12 | 0.646 | |
| MSA# LLMs=5 x 4 (mistralai/Mistral-7B-v0.1), # Parameters=140B, Parameter Size vs. 2B=70x larger2025.12 | 0.643 | |
| BLCU-ICALL# LLMs=4 (Qwen/Qwen2.5-7B), # Parameters=28B, Parameter Size vs. 2B=14x larger2025.12 | 0.632 | |
| bea-jh# LLMs=4 (zai-org/glm-4-9b), # Parameters=36B, Parameter Size vs. 2B=18x larger2025.12 | 0.625 | |
| LoMTL# LLMs=1 (google/gemma-2-2b-it), # Parameters=2B, Parameter Size vs. 2B=-2025.12 | 0.601 |