General Reasoning on LiveBench
53.47AccuracyPerSyn
Evaluation Results
| Method | Links | |
|---|---|---|
| PerSynStudent Model=Qwen2.5-14B2025.10 | 53.47 | |
| CARStudent Model=Qwen2.5-14B2025.10 | 52.06 | |
| ARM + MPFoundation Model=GPT-4o2025.10 | 51.9 | |
| Family-StrongStudent Model=Qwen2.5-14B2025.10 | 50.59 | |
| ARM + MPFoundation Model=LLaMA-3.3-70B2025.10 | 50 | |
| PerSynStudent Model=Qwen2.5-7B2025.10 | 49.08 | |
| MixStudent Model=Qwen2.5-14B2025.10 | 48.85 | |
| LLM-DebateFoundation Model=GPT-4o2025.10 | 47.5 | |
| ARMFoundation Model=GPT-4o2025.10 | 47.5 | |
| CARStudent Model=Qwen2.5-7B2025.10 | 47.33 | |
| Self-RefineFoundation Model=LLaMA-3.3-70B2025.10 | 46.9 | |
| StrongStudent Model=Qwen2.5-14B2025.10 | 46.34 | |
| CoTFoundation Model=GPT-4o2025.10 | 46.2 | |
| LLM-DebateFoundation Model=LLaMA-3.3-70B2025.10 | 46.2 | |
| ADASFoundation Model=LLaMA-3.3-70B, Evaluation Setup=1000-sample2025.10 | 46.2 | |
| ARMFoundation Model=LLaMA-3.3-70B2025.10 | 46.2 | |
| Family-StrongStudent Model=Qwen2.5-7B2025.10 | 46.15 | |
| ARM + MPFoundation Model=GPT-4.1-nano2025.10 | 45.6 | |
| AFlowFoundation Model=GPT-4o, Evaluation Setup=1000-sample2025.10 | 45 | |
| CoT-SCFoundation Model=LLaMA-3.3-70B2025.10 | 45 | |
| MixStudent Model=Qwen2.5-7B2025.10 | 44.26 | |
| StrongStudent Model=Qwen2.5-7B2025.10 | 43.02 | |
| CoT-SCFoundation Model=GPT-4o2025.10 | 42.5 | |
| ADASFoundation Model=GPT-4o, Evaluation Setup=1000-sample2025.10 | 41.9 | |
| AFlowFoundation Model=GPT-4o, Evaluation Setup=test set2025.10 | 41.9 | |
| ARMFoundation Model=GPT-4.1-nano2025.10 | 39.4 | |
| ADASFoundation Model=GPT-4o, Evaluation Setup=test set2025.10 | 38.8 | |
| CoTFoundation Model=LLaMA-3.3-70B2025.10 | 38.1 | |
| AFlowFoundation Model=LLaMA-3.3-70B, Evaluation Setup=test set2025.10 | 38.1 | |
| PerSynStudent Model=Gemma-2-9B2025.10 | 37.84 | |
| Self-RefineFoundation Model=GPT-4o2025.10 | 37.5 | |
| ADASFoundation Model=LLaMA-3.3-70B, Evaluation Setup=test set2025.10 | 37.5 | |
| PerSynStudent Model=Llama-3.1-8B2025.10 | 37.13 | |
| CoT-SCFoundation Model=GPT-4.1-nano2025.10 | 36.9 | |
| CARStudent Model=Gemma-2-9B2025.10 | 36.63 | |
| Family-StrongStudent Model=Gemma-2-9B2025.10 | 36.09 | |
| CARStudent Model=Llama-3.1-8B2025.10 | 35.86 | |
| MixStudent Model=Llama-3.1-8B2025.10 | 35.42 | |
| MixStudent Model=Gemma-2-9B2025.10 | 34.63 | |
| LLM-DebateFoundation Model=GPT-4.1-nano2025.10 | 33.8 | |
| StrongStudent Model=Gemma-2-9B2025.10 | 33.49 | |
| Family-StrongStudent Model=Llama-3.1-8B2025.10 | 33.25 | |
| CoTFoundation Model=GPT-4.1-nano2025.10 | 33.1 | |
| StrongStudent Model=Llama-3.1-8B2025.10 | 32.87 | |
| ADASFoundation Model=GPT-4.1-nano, Evaluation Setup=test set2025.10 | 31.2 | |
| AFlowFoundation Model=GPT-4.1-nano, Evaluation Setup=test set2025.10 | 30.6 | |
| AFlowFoundation Model=GPT-4.1-nano, Evaluation Setup=1000-sample2025.10 | 30.6 | |
| ADASFoundation Model=GPT-4.1-nano, Evaluation Setup=1000-sample2025.10 | 29.4 | |
| SDAR-8BScale=8B, Tokens=55B, FLOPs=2640, Decoding Strategy=greedy static decoding, Block Size=42026.06 | 28.6 | |
| Self-RefineFoundation Model=GPT-4.1-nano2025.10 | 28.1 | |
| OPDLM-4BScale=4B, Tokens=0.076B, FLOPs=2.4, Decoding Strategy=greedy static decoding, Block Size=42026.06 | 27.8 | |
| OPDLM-8BScale=8B, Tokens=0.066B, FLOPs=4.2, Decoding Strategy=greedy static decoding, Block Size=42026.06 | 25.8 | |
| SDAR-4BScale=4B, Tokens=55B, FLOPs=1320, Decoding Strategy=greedy static decoding, Block Size=42026.06 | 25.3 | |
| AFlowFoundation Model=LLaMA-3.3-70B, Evaluation Setup=1000-sample2025.10 | 15.6 | |
| Fast-dLLM-v2-7BScale=8B, Tokens=1B, FLOPs=42, Decoding Strategy=greedy static decoding, Block Size=42026.06 | 9.5 |