RTL Generation on CVDP
42.9Pass@1GPT-OSS-120B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-OSS-120BRole=Teacher, SFT=null, RL=null2026.06 | 42.9 | 57.9 | 62.2 | |
| STGRole=Fine-tuned, Base Model=Qwen3-8B, SFT=true, RL=false2026.06 | 36.5 | 52.9 | 58.1 | |
| STGRole=Fine-tuned, Base Model=Qwen3-4B-Thinking, SFT=true, RL=false2026.06 | 35.6 | 52.4 | 57.9 | |
| CodeV-R1Role=Fine-tuned, Base Model=Qwen2.5-C-7B-Instruct, SFT=true, RL=true2026.06 | 34.5 | 50.4 | 54.8 | |
| SiliconMind-V1Role=Fine-tuned, Base Model=Qwen3-8B, SFT=true, RL=false2026.06 | 34.4 | 49.2 | 53.8 | |
| SiliconMind-V1Role=Fine-tuned, Base Model=Qwen3-4B-Thinking, SFT=true, RL=false2026.06 | 33.4 | 47.3 | 51.9 | |
| STGRole=Fine-tuned, Base Model=Qwen2.5-C-7B-Instruct, SFT=true, RL=false2026.06 | 32.4 | 50.5 | 56 | |
| SiliconMind-V1Role=Fine-tuned, Base Model=Qwen2.5-C-7B-Instruct, SFT=true, RL=false2026.06 | 31.3 | 47.5 | 52.9 | |
| VeriRL (reproduced)Role=Fine-tuned, Base Model=Qwen2.5-C-7B-Instruct, SFT=true, RL=true2026.06 | 18.1 | 27.5 | 31.9 | |
| Qwen3-8BRole=Base, SFT=null, RL=null2026.06 | 17.4 | 28.7 | 34.4 | |
| Qwen3-4B-ThinkingRole=Base, SFT=null, RL=null2026.06 | 15.4 | 24.8 | 29.1 | |
| Qwen2.5-C-7B-InstructRole=Base, SFT=null, RL=null2026.06 | 13.6 | 25.1 | 29.8 |