Cultural Reasoning on CulturalBench
89.16Mean@3DeepSeek-V3.2
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-V3.2Reasoning Mode=Think2026.04 | 89.16 | |
| DeepSeek-V3.2Reasoning Mode=Non-Think2026.04 | 84.6 | |
| o4-mini-highReasoning Mode=Think2026.04 | 82.31 | |
| x1-Qwen3-32BReasoning Mode=Think, Task LoRA=+ Culture2026.04 | 81.99 | |
| x1-Qwen3-14BReasoning Mode=Think, Task LoRA=+ Culture2026.04 | 81.58 | |
| Qwen3-32BReasoning Mode=Think2026.04 | 81.26 | |
| x1-Qwen3-32BReasoning Mode=Non-Think, Task LoRA=+ Culture2026.04 | 80.47 | |
| Qwen3-32BReasoning Mode=Non-Think2026.04 | 78.76 | |
| Qwen3-14BReasoning Mode=Think2026.04 | 78.24 | |
| x1-Qwen3-14BReasoning Mode=Non-Think, Task LoRA=+ Culture2026.04 | 76.07 | |
| Qwen3-14BReasoning Mode=Non-Think2026.04 | 75.5 | |
| x1-Qwen3-4BReasoning Mode=Think, Task LoRA=+ Culture2026.04 | 72.74 | |
| Qwen3-4BReasoning Mode=Think2026.04 | 70.85 | |
| Qwen3-4BReasoning Mode=Non-Think2026.04 | 68.76 | |
| x1-Qwen3-4BReasoning Mode=Non-Think, Task LoRA=+ Culture2026.04 | 68.46 | |
| x1-DeepSeek-R1-Distill-Llama-8BReasoning Mode=Think, Task LoRA=+ Culture2026.04 | 60.88 | |
| DeepSeek-R1-Distill-Llama-8BReasoning Mode=Think2026.04 | 57.19 | |
| x1-DeepSeek-R1-Distill-Llama-8BReasoning Mode=Non-Think, Task LoRA=+ Culture2026.04 | 51.13 | |
| x1-DeepSeek-R1-Distill-Qwen-7BReasoning Mode=Think, Task LoRA=+ Culture2026.04 | 49.04 | |
| x1-DeepSeek-R1-Distill-Qwen-7BReasoning Mode=Non-Think, Task LoRA=+ Culture2026.04 | 44.82 | |
| DeepSeek-R1-Distill-Qwen-7BReasoning Mode=Think2026.04 | 38.63 | |
| DeepSeek-R1-Distill-Llama-8BReasoning Mode=Non-Think2026.04 | 35.02 | |
| DeepSeek-R1-Distill-Qwen-7BReasoning Mode=Non-Think2026.04 | 29.58 |