Commonsense Reasoning on Winogrande (ACC)
80.71AccuracyLoPT-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| LoPT-GRPOBackbone=Qwen2.5-32B2026.05 | 80.71 | |
| BaseBackbone=Qwen2.5-32B2026.05 | 80.35 | |
| E2E-GRPOBackbone=Qwen2.5-32B2026.05 | 80.27 | |
| MUDDFORMEREvaluation Protocol=Zero-shot, Number of Parameters=760M, Training Tokens=20B2026.05 | 55.64 | |
| TRANSFORMEREvaluation Protocol=Zero-shot, Number of Parameters=1.3B, Training Tokens=30B2026.05 | 54.85 | |
| SATFORMEREvaluation Protocol=Zero-shot, Number of Parameters=1.3B, Training Tokens=30B2026.05 | 54.3 | |
| HYPERCONNECTIONSEvaluation Protocol=Zero-shot, Number of Parameters=760M, Training Tokens=20B2026.05 | 52.95 | |
| RESFORMEREvaluation Protocol=Zero-shot, Number of Parameters=1.3B, Training Tokens=30B2026.05 | 52.88 | |
| RESFORMEREvaluation Protocol=Zero-shot, Number of Parameters=760M, Training Tokens=20B2026.05 | 52.64 | |
| MUDDFORMEREvaluation Protocol=Zero-shot, Number of Parameters=130M, Training Tokens=5B2026.05 | 52.49 | |
| DENSEFORMEREvaluation Protocol=Zero-shot, Number of Parameters=760M, Training Tokens=20B2026.05 | 52.17 | |
| TRANSFORMEREvaluation Protocol=Zero-shot, Number of Parameters=130M, Training Tokens=5B2026.05 | 51.85 | |
| RESFORMEREvaluation Protocol=Zero-shot, Number of Parameters=340M, Training Tokens=10B2026.05 | 51.46 | |
| RESFORMEREvaluation Protocol=Zero-shot, Number of Parameters=130M, Training Tokens=5B2026.05 | 51.3 | |
| MUDDFORMEREvaluation Protocol=Zero-shot, Number of Parameters=340M, Training Tokens=10B2026.05 | 51.07 | |
| SATFORMEREvaluation Protocol=Zero-shot, Number of Parameters=340M, Training Tokens=10B2026.05 | 51.07 | |
| HYPERCONNECTIONSEvaluation Protocol=Zero-shot, Number of Parameters=340M, Training Tokens=10B2026.05 | 51.06 | |
| HYPERCONNECTIONSEvaluation Protocol=Zero-shot, Number of Parameters=130M, Training Tokens=5B2026.05 | 50.98 | |
| SATFORMEREvaluation Protocol=Zero-shot, Number of Parameters=130M, Training Tokens=5B2026.05 | 50.91 | |
| TRANSFORMEREvaluation Protocol=Zero-shot, Number of Parameters=340M, Training Tokens=10B2026.05 | 50.83 | |
| TRANSFORMEREvaluation Protocol=Zero-shot, Number of Parameters=760M, Training Tokens=20B2026.05 | 50.75 | |
| SATFORMEREvaluation Protocol=Zero-shot, Number of Parameters=760M, Training Tokens=20B2026.05 | 50.67 | |
| DENSEFORMEREvaluation Protocol=Zero-shot, Number of Parameters=130M, Training Tokens=5B2026.05 | 50.43 | |
| DENSEFORMEREvaluation Protocol=Zero-shot, Number of Parameters=340M, Training Tokens=10B2026.05 | 48.15 |