MergeBench
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
MergeBench
39.56Instruction Score
21
MergeBench
52.6MATH-500 Score
12
MergeBench Expert models Llama-3.2-3B (test)
53.52Instruction Score
11
MergeBench Llama-3.2-3B (test)
44.1Average Score
11
MergeBench (Vision-Language tasks: MMSI-Bench, EmbSpatial, MMMU_Med, PathVQA, OCRBench, CharXiv)
32.6MMSI-Bench
11