Factuality Evaluation on TruthfulQA latest (test)
84.57AccuracySkillAggregation-X
Evaluation Results
| Method | Links | |
|---|---|---|
| SkillAggregation-XJudge Model Size=~70B, Number of Runs=52024.10 | 84.57 | |
| SkillAggregationJudge Model Size=~70B, Number of Runs=52024.10 | 84.45 | |
| DawidSkeneJudge Model Size=~70B2024.10 | 84.08 | |
| SkillAggregation w/o. Reg.Judge Model Size=~70B, Number of Runs=52024.10 | 84.04 | |
| CrowdlayerJudge Model Size=~70B, Number of Runs=52024.10 | 83.87 | |
| Average ProbabilityJudge Model Size=~70B2024.10 | 83.85 | |
| Majority VotingJudge Model Size=~70B2024.10 | 83.63 | |
| Train on Majority VotingJudge Model Size=~70B, Number of Runs=52024.10 | 82.41 | |
| SkillAggregation-XJudge Model Size=7B/8B, Number of Runs=52024.10 | 68.77 | |
| SkillAggregationJudge Model Size=7B/8B, Number of Runs=52024.10 | 68.74 | |
| SkillAggregation w/o. Reg.Judge Model Size=7B/8B, Number of Runs=52024.10 | 68.07 | |
| Average ProbabilityJudge Model Size=7B/8B2024.10 | 68.06 | |
| DawidSkeneJudge Model Size=7B/8B2024.10 | 67.84 | |
| CrowdlayerJudge Model Size=7B/8B, Number of Runs=52024.10 | 67.74 | |
| Majority VotingJudge Model Size=7B/8B2024.10 | 67.47 | |
| Train on Majority VotingJudge Model Size=7B/8B, Number of Runs=52024.10 | 67.32 |