Factuality Evaluation on AITutor-EvalKit (test)
96.2Overall ScoreGPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5model_type=Proprietary2026.06 | 96.2 | 97.49 | 95.01 | |
| GPT-4.1-nano + SFT V4backbone=GPT-4.1-nano, training_method=SFT, config_version=V42026.06 | 84.4 | 75.57 | 92.51 | |
| Qwen3-8B + DPO V4*backbone=Qwen3-8B, training_method=DPO, config_version=V4, training_dataset=extended dataset2026.06 | 70.1 | 56.99 | 82.15 | |
| GPT-4.1-nano + DPO V4backbone=GPT-4.1-nano, training_method=DPO, config_version=V42026.06 | 66.7 | 70.56 | 63.15 | |
| Qwen3-8B + DPO V4backbone=Qwen3-8B, training_method=DPO, config_version=V42026.06 | 60.1 | 42.59 | 76.2 | |
| Qwen3-8B + SFT V4backbone=Qwen3-8B, training_method=SFT, config_version=V42026.06 | 59.7 | 39.67 | 78.12 | |
| Qwen3-4B + DPO V2backbone=Qwen3-4B, training_method=DPO, config_version=V22026.06 | 58.3 | 39.04 | 76.01 | |
| Qwen3-4B + SFT V2backbone=Qwen3-4B, training_method=SFT, config_version=V22026.06 | 56.1 | 35.85 | 74.57 | |
| Qwen3-4B + DPO V4backbone=Qwen3-4B, training_method=DPO, config_version=V42026.06 | 56 | 35.91 | 74.47 | |
| Qwen3-4B + SFT V4backbone=Qwen3-4B, training_method=SFT, config_version=V42026.06 | 55.7 | 33.82 | 75.82 | |
| Qwen3-8B + SFT V2backbone=Qwen3-8B, training_method=SFT, config_version=V22026.06 | 55.6 | 35.91 | 73.7 | |
| Qwen3-4B + DPO V3backbone=Qwen3-4B, training_method=DPO, config_version=V32026.06 | 53.2 | 40.08 | 65.26 | |
| Qwen3-8B + DPO V3backbone=Qwen3-8B, training_method=DPO, config_version=V32026.06 | 51.5 | 38.83 | 63.15 | |
| SocraticLMmodel_type=Existing Tutoring Model2026.06 | 50.2 | 51.17 | 49.34 | |
| Qwen3-8B + SFT V3backbone=Qwen3-8B, training_method=SFT, config_version=V32026.06 | 49.7 | 26.51 | 71.02 | |
| Qwen3-4B + SFT V3backbone=Qwen3-4B, training_method=SFT, config_version=V32026.06 | 48.6 | 27.97 | 67.56 | |
| Qwen3-8B + DPO V1backbone=Qwen3-8B, training_method=DPO, config_version=V12026.06 | 48.4 | 42.17 | 54.13 | |
| Qwen3-8B + SFT V1backbone=Qwen3-8B, training_method=SFT, config_version=V12026.06 | 46.3 | 21.5 | 69.1 | |
| Qwen3-4B + SFT V1backbone=Qwen3-4B, training_method=SFT, config_version=V12026.06 | 43.1 | 24.01 | 60.65 | |
| TutorRL-7Bmodel_type=Existing Tutoring Model2026.06 | 39.8 | 33.4 | 45.68 | |
| Qwen3-8B + DPO V2backbone=Qwen3-8B, training_method=DPO, config_version=V22026.06 | 39.2 | 28.39 | 49.14 | |
| GPT-4.1-nanomodel_type=Proprietary2026.06 | 38.1 | 15.87 | 58.54 | |
| Qwen3-4B + DPO V1backbone=Qwen3-4B, training_method=DPO, config_version=V12026.06 | 32.9 | 24.63 | 40.5 | |
| Qwen3-8Bmodel_type=Open-Source Base Model2026.06 | 13.7 | 2.09 | 24.38 | |
| Qwen3-4Bmodel_type=Open-Source Base Model2026.06 | 11.7 | 3.13 | 19.58 |