General Reasoning on AVG Reasoning Suite
77.4AccuracyQwen3.6-35B-A3B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen3.6-35B-A3BInference type=single-pass/fixed-budget2026.05 | 77.4 | — | — | — | |
| SU-01Inference type=single-pass/fixed-budget2026.05 | 77.3 | — | — | — | |
| GLM-4.7-FlashInference type=single-pass/fixed-budget2026.05 | 72 | — | — | — | |
| Nemotron-Cascade-2Inference type=single-pass/fixed-budget2026.05 | 71.8 | — | — | — | |
| Gemma-4-31BInference type=single-pass/fixed-budget2026.05 | 70.9 | — | — | — | |
| P1-30B-A3BInference type=single-pass/fixed-budget2026.05 | 69 | — | — | — | |
| LThinker++Model Series=Llama3.1-8B, Serving Setting=Throughput2026.04 | 61.56 | 21.3 | 999 | 2.7 | |
| CoTModel Series=Qwen2.5-7B, Serving Setting=Throughput2026.04 | 61.21 | 70.8 | 675 | 0.2 | |
| CoTModel Series=Llama3.1-8B, Serving Setting=Throughput2026.04 | 60.54 | 96.9 | 790 | 0.4 | |
| VanillaModel Series=Llama3.1-8B, Serving Setting=Throughput2026.04 | 60.48 | 28.1 | 3,143 | 10.7 | |
| TokenSkipModel Series=Qwen2.5-7B, Serving Setting=Throughput2026.04 | 60.1 | 42.7 | 3,017 | 10.2 | |
| LThinker++Model Series=Qwen2.5-7B, Serving Setting=Throughput2026.04 | 60.02 | 22.6 | 940 | 3.1 | |
| VanillaModel Series=Qwen2.5-7B, Serving Setting=Throughput2026.04 | 59.62 | 21.5 | 3,120 | 10.3 | |
| TokenSkipModel Series=Llama3.1-8B, Serving Setting=Throughput2026.04 | 58.06 | 47.2 | 2,984 | 9.9 | |
| Distill-R1Model Series=Qwen2.5-7B, Serving Setting=Throughput2026.04 | 54.03 | 501.6 | 3,003 | 11.3 | |
| LThinker*Model Series=Qwen2.5-7B, Serving Setting=Throughput2026.04 | 53.6 | 28 | 811 | 3 | |
| LThinker*Model Series=Llama3.1-8B, Serving Setting=Throughput2026.04 | 53.04 | 21.1 | 787 | 1.8 | |
| Distill-R1Model Series=Llama3.1-8B, Serving Setting=Throughput2026.04 | 52.12 | 174.6 | 1,332 | 4.4 |