ResearchBenchmarksGeneral Language Model Capability on MMLU, GSM8K, HumanEval, and BBH AggregateFollow68.42Average ScoreVAR11.604826.354941.10555.8551Feb 16, 2025Evaluation ResultsMethodMethodLinksAverage ScoreVARBase Model=Qwen2.5-7BBase Model=Qwen2.5-7B2025.0268.42ALoLBase Model=Qwen2.5-7BBase Model=Qwen2.5-7B2025.0262.4BaseBase Model=Qwen2.5-7BBase Model=Qwen2.5-7B2025.0261.8DPOBase Model=Qwen2.5-7BBase Model=Qwen2.5-7B2025.0257.44VARBase Model=Llama2-7BBase Model=Llama2-7B2025.0224.2ALoLBase Model=Llama2-7BBase Model=Llama2-7B2025.0222.71DPOBase Model=Llama2-7BBase Model=Llama2-7B2025.0220.86BaseBase Model=Llama2-7BBase Model=Llama2-7B2025.0213.79