Commonsense Reasoning on XStoryCloze
80.93Average ScoreCC-TUNING+SDRRL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| CC-TUNING+SDRRLModel Backbone=Qwen2.5-7B2025.06 | 80.93 | — | — | — | — | — | |
| ML-SFT+SDRRLModel Backbone=Qwen2.5-7B2025.06 | 80.67 | — | — | — | — | — | |
| CC-TUNING+ENModel Backbone=Qwen2.5-7B2025.06 | 74.69 | — | — | — | — | — | |
| CC-TUNING+MTModel Backbone=LLaMA-3.1-8B2025.06 | 73.54 | — | — | — | — | — | |
| ML-SFT+ENModel Backbone=Qwen2.5-7B2025.06 | 71.63 | — | — | — | — | — | |
| CC-TUNINGModel Backbone=Qwen2.5-7B2025.06 | 71.43 | — | — | — | — | — | |
| CC-TUNING+MTModel Backbone=Qwen2.5-7B2025.06 | 71.39 | — | — | — | — | — | |
| CC-TUNINGModel Backbone=LLaMA-3.1-8B2025.06 | 70.6 | — | — | — | — | — | |
| ML-SFT+MTModel Backbone=Qwen2.5-7B2025.06 | 70.5 | — | — | — | — | — | |
| ML-SFTModel Backbone=Qwen2.5-7B2025.06 | 70.06 | — | — | — | — | — | |
| ML-SFT+MTModel Backbone=LLaMA-3.1-8B2025.06 | 69.9 | — | — | — | — | — | |
| CC-TUNING+SDRRLModel Backbone=LLaMA-3.1-8B2025.06 | 69.19 | — | — | — | — | — | |
| ML (Q3)Filtering Strategy=ML (Q3)2026.04 | 67.5 | — | — | — | — | — | |
| ML (15%)Filtering Strategy=ML (15%)2026.04 | 66.78 | — | — | — | — | — | |
| HQFiltering Strategy=HQ2026.04 | 66.25 | — | — | — | — | — | |
| MLFiltering Strategy=ML2026.04 | 66.25 | — | — | — | — | — | |
| MKC-eFiltering Strategy=MKC-e2026.04 | 66.18 | — | — | — | — | — | |
| HQ seedFiltering Strategy=HQ seed2026.04 | 66.05 | — | — | — | — | — | |
| No filteringFiltering Strategy=No filtering2026.04 | 65.59 | — | — | — | — | — | |
| ML-SFTModel Backbone=LLaMA-3.1-8B2025.06 | 65.23 | — | — | — | — | — | |
| ML-SFT+ENModel Backbone=LLaMA-3.1-8B2025.06 | 65.13 | — | — | — | — | — | |
| CC-TUNING+ENModel Backbone=LLaMA-3.1-8B2025.06 | 60.94 | — | — | — | — | — | |
| PHSATraining Tokens=100B, Inference Top-K=4, Training Top-K=42026.01 | 59.76 | — | — | — | — | — | |
| InfLLM v2Training Tokens=100B, Inference Top-K=2, Training Top-K=22026.01 | 59.56 | — | — | — | — | — | |
| InfLLM v2Training Tokens=100B, Inference Top-K=N/A, Training Top-K=22026.01 | 59.5 | — | — | — | — | — | |
| PHSATraining Tokens=100B, Inference Top-K=N/A, Training Top-K=42026.01 | 59.36 | — | — | — | — | — | |
| PHSATraining Tokens=100B, Inference Top-K=2, Training Top-K=22026.01 | 58.97 | — | — | — | — | — | |
| DenseTraining Tokens=100B, Inference Top-K=N/A2026.01 | 58.9 | — | — | — | — | — | |
| DenseTraining Tokens=100B, Inference Top-K=22026.01 | 58.9 | — | — | — | — | — | |
| PHSATraining Tokens=100B, Inference Top-K=N/A, Training Top-K=22026.01 | 58.9 | — | — | — | — | — | |
| InfLLM v2Training Tokens=100B, Inference Top-K=4, Training Top-K=42026.01 | 58.24 | — | — | — | — | — | |
| InfLLM v2Training Tokens=100B, Inference Top-K=N/A, Training Top-K=42026.01 | 57.91 | — | — | — | — | — | |
| ML-SFT+SDRRLModel Backbone=LLaMA-3.1-8B2025.06 | 55.82 | — | — | — | — | — | |
| X-InstructionParameters=13B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 54 | 56.6 | 67 | 61.4 | 58.2 | — | |
| Bactrian-MParameters=13B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 52.8 | 53.8 | 66 | 59.2 | 57.4 | — | |
| X-InstructionParameters=7B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 52.5 | 57.4 | 64.2 | 59.8 | 56.6 | — | |
| Bactrian-MParameters=7B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 51.1 | 55 | 62.9 | 55.1 | 54.2 | — | |
| LLAMA 2Parameters=13B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 50.8 | 52.6 | 64.1 | 55.4 | 51.5 | — | |
| LLAMA 2Parameters=7B, Zero-shot=true, In-context learning=true, Prompt template language=English2024.05 | 49.5 | 54.2 | 59.6 | 53.6 | 50.4 | — | |
| 1B Model (HQ filtering)Filtering Strategy=Monolingual high-quality (HQ), Model Scale=1B2026.04 | — | — | — | — | — | 66.25 | |
| 1B Model (Multilingual classifier)Filtering Strategy=Multilingual (ML), Model Scale=1B2026.04 | — | — | — | — | — | 66.25 | |
| 1B Model (No filtering)Filtering Strategy=No filtering, Model Scale=1B2026.04 | — | — | — | — | — | 65.59 | |
| BLOOMZ-7B1Parameters=7.1B2026.01 | — | — | 83.82 | — | 68.43 | — | |
| GoldfishBackbone=GPT-2, Training=from-scratch2026.01 | — | — | 53.21 | — | 53.21 | — | |
| GPT-2 + FTBackbone=GPT-2, Training=finetuned2026.01 | — | — | 50.76 | — | 51.57 | — | |
| MCLBackbone=GPT-2, Alignment=dense-representation2026.01 | — | — | 51.62 | — | 54.07 | — | |
| SENSIABackbone=GPT-2, Alignment=sense-aligned2026.01 | — | — | 52.88 | — | 54.2 | — | |
| XGLM-7B5Parameters=7.5B2026.01 | — | — | 59.63 | — | 55.33 | — |