Language Model Evaluation on LiveBench
72.8Average ScoreCoThinker
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CoThinkerModel=Gemini-2.5-Flash, Tokens=8192, Decoding strategy=greedy2025.06 | 72.8 | 76.3 | 69.2 | — | |
| DMADModel=Gemini-2.5-Flash, Tokens=8192, Decoding strategy=greedy2025.06 | 59.7 | 56.7 | 62.8 | — | |
| CoThinkerModel=GPT-4.1-Mini, Tokens=8192, Decoding strategy=greedy2025.06 | 55.4 | 40 | 70.8 | — | |
| IO (Baseline)Model=Gemini-2.5-Flash, Tokens=8192, Decoding strategy=greedy2025.06 | 45.1 | 59.3 | 31 | — | |
| DMADModel=GPT-4.1-Mini, Tokens=8192, Decoding strategy=greedy2025.06 | 39.1 | 34.2 | 44 | — | |
| IO (Baseline)Model=GPT-4.1-Mini, Tokens=8192, Decoding strategy=greedy2025.06 | 37.4 | 34 | 40.8 | — | |
| CoThinkerModel=Qwen3-32B, Tokens=8192, Decoding strategy=greedy2025.06 | 22.1 | 18.9 | 25.2 | — | |
| IO (Baseline)Model=Qwen3-32B, Tokens=8192, Decoding strategy=greedy2025.06 | 11.7 | 3.4 | 20 | — | |
| DMADModel=Qwen3-32B, Tokens=8192, Decoding strategy=greedy2025.06 | 11.5 | 8.8 | 14.2 | — | |
| CoThinkerModel=DeepSeek-R1-8B, Tokens=8192, Decoding strategy=greedy2025.06 | 5.8 | 2.9 | 8.8 | — | |
| DMADModel=DeepSeek-R1-8B, Tokens=8192, Decoding strategy=greedy2025.06 | 5.2 | 3.8 | 6.5 | — | |
| IO (Baseline)Model=DeepSeek-R1-8B, Tokens=8192, Decoding strategy=greedy2025.06 | 2.3 | 1.9 | 2.8 | — |