Multi-task Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Multi-task Evaluation Suite
49Average Performance
21
Multi-task Evaluation Suite Instruction, Math, Multilingual, Safety
1.015Average Score
9
Multi-task Evaluation Suite Llama-3.2-1B (test)
394.81MT Throughput (token/s)
6