ResearchBenchmarksNatural Language Understanding and Reasoning on General Benchmarks ItalianFollow37.47ARC-C-itQwen2.529.014831.209933.40535.6001Dec 25, 2025Evaluation ResultsMethodMethodLinksARC-C-itBelebele-itHellaswag-itMMLU (Global)Evalita-LLM (agg.)Average ScoreQwen2.52025.1237.4770.4447.5546.7143.3349.1Gamayun2025.1235.967.2252.6341.8741.2847.78Qwen32025.1235.3363.8945.6149.1340.2446.84Gemma32025.1234.9942.5647.4337.1936.2739.69EuroLM2025.1232.0824.5650.7527.433.9633.75Llama3.22025.1229.344842.3438.6435.6538.79