Reasoning on DeepScaler
57.3AccuracyUAB
Evaluation Results
| Method | Links | |
|---|---|---|
| UABBackbone Model=Cohere, Budget=N=42026.05 | 57.3 | |
| LLM-JudgeBackbone Model=Cohere, Budget=N=42026.05 | 57.1 | |
| UniformBackbone Model=Cohere, Budget=N=42026.05 | 56.8 | |
| N=1Backbone Model=Cohere, Budget=N=12026.05 | 53.7 | |
| UABBackbone Model=Gemma3-27B, Budget=N=42026.05 | 41.1 | |
| LLM-JudgeBackbone Model=Gemma3-27B, Budget=N=42026.05 | 40.3 | |
| UniformBackbone Model=Gemma3-27B, Budget=N=42026.05 | 40.2 | |
| UABModel=Qwen2.5-7B, N=42026.05 | 38.1 | |
| UABBackbone Model=GPT-OSS-20B, Budget=N=42026.05 | 36.4 | |
| RandomModel=Qwen2.5-7B, N=42026.05 | 36.1 | |
| LLM-JudgeBackbone Model=GPT-OSS-20B, Budget=N=42026.05 | 35.1 | |
| UniformBackbone Model=GPT-OSS-20B, Budget=N=42026.05 | 34.7 | |
| LLM-JudgeModel=Qwen2.5-7B, N=42026.05 | 34.3 | |
| N=1Backbone Model=Gemma3-27B, Budget=N=12026.05 | 33.7 | |
| UniformModel=Qwen2.5-7B, N=42026.05 | 33.3 | |
| LengthModel=Qwen2.5-7B, N=42026.05 | 27.8 | |
| N=1Model=Qwen2.5-7B, N=12026.05 | 27.5 | |
| N=1Backbone Model=GPT-OSS-20B, Budget=N=12026.05 | 25.5 | |
| UABModel=Qwen2.5-1.5B, N=42026.05 | 22.4 | |
| RandomModel=Qwen2.5-1.5B, N=42026.05 | 21.4 | |
| UABModel=Llama3.2-3B, N=42026.05 | 21.4 | |
| LengthModel=Qwen2.5-1.5B, N=42026.05 | 21.2 | |
| LengthModel=Llama3.2-3B, N=42026.05 | 20.2 | |
| UniformModel=Qwen2.5-1.5B, N=42026.05 | 19.2 | |
| LLM-JudgeModel=Qwen2.5-1.5B, N=42026.05 | 18.8 | |
| RandomModel=Llama3.2-3B, N=42026.05 | 18.8 | |
| UniformModel=Llama3.2-3B, N=42026.05 | 17.9 | |
| N=1Model=Qwen2.5-1.5B, N=12026.05 | 17.4 | |
| N=1Model=Llama3.2-3B, N=12026.05 | 16.3 | |
| LLM-JudgeModel=Llama3.2-3B, N=42026.05 | 16.3 |