Sudoku Solving on Sudoku
100Success Rate (pass@1)GPT-OSS-120B
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-OSS-120B2026.01 | 100 | |
| GPT-5-nano2026.01 | 100 | |
| Qwen2.5-3B-It + Evolving Stage2026.01 | 97 | |
| Scout-PPO2026.01 | 85 | |
| SSLBackbone=Qwen2.5, Model Scale=7B, Reward Strategy=Sweet Spot Learning2026.01 | 45.4 | |
| RL-ContinuousBackbone=Qwen2.5, Model Scale=7B, Reward Strategy=Continuous2026.01 | 45 | |
| RL-BinaryBackbone=Qwen2.5, Model Scale=7B, Reward Strategy=Binary2026.01 | 44.7 | |
| SSLBackbone=Qwen2.5, Model Scale=3B, Reward Strategy=Sweet Spot Learning2026.01 | 31 | |
| Block-R1Source Domain=Multi-domain, Backbone=LLaDA-8B-Instruct2026.05 | 26.95 | |
| StableDRLSource Domain=Sudoku, Backbone=LLaDA-8B-Instruct2026.05 | 25.39 | |
| RL-ContinuousBackbone=Qwen2.5, Model Scale=3B, Reward Strategy=Continuous2026.01 | 17.3 | |
| RL-BinaryBackbone=Qwen2.5, Model Scale=3B, Reward Strategy=Binary2026.01 | 15.5 |