Pedagogical Dialogue Classification on MRBench (test)
91Mistake ID AccS5: HPO-FT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| S5: HPO-FTarchitecture=Hierarchical Pedagogical Oversight, mode=fine-tuned, backbone=Llama-3-8B-Instruct, optimization=QLoRA2025.12 | 91 | 86 | 89 | 83 | 84.5 | |
| S4: HPO-Basearchitecture=Hierarchical Pedagogical Oversight, mode=frozen agents2025.12 | 90 | 84 | 87 | 81 | 82.5 | |
| GPT-4omode=Zero-shot, parameters=175B+2025.12 | 88 | 82 | 85 | 80 | 81.2 | |
| S3: Unstructuredarchitecture=Unstructured Adversarial2025.12 | 88 | 82 | 85 | 78 | 80 | |
| S2: Cooperativearchitecture=Collaborative (no debate)2025.12 | 86 | 80 | 83 | 77 | 78.5 | |
| Llama-70Bbackbone=Llama-3-70B2025.12 | 85 | 78 | 81 | 74 | 76 | |
| S1: Singlebackbone=Llama-3-70B, architecture=Single-Agent2025.12 | 79 | 71 | 76 | 68 | 69.5 |