Analog Circuit Sizing on ACS In-domain 8 trained tasks (train)
0.94ACCIA ScoreTurn-Level GRPO (Ours)
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Turn-Level GRPO (Ours)Eval=Multi-turn2026.01 | 0.94 | 1 | 0.91 | 1 | 1 | 0.98 | 0.99 | 0.97 | 0.97 | |
| Qwen3-30B-Instruct-2507 + Trajectory-Level GRPOEval=Multi-turn2026.01 | 0.69 | 0.98 | 0.74 | 0.99 | 0.98 | 0.92 | 0.87 | 0.61 | 0.85 | |
| Qwen3-30B-Instruct-2507 + Single-Turn GRPOEval=ST-iter2026.01 | 0.68 | 0.99 | 0.61 | 0.93 | 0.97 | 0.93 | 0.93 | 0.57 | 0.83 | |
| Bayesian Optimization2026.01 | 0.51 | 0.83 | 0.23 | 0.78 | 0.86 | 0.41 | 0.69 | 0.2 | 0.56 | |
| Qwen3-235B-Instruct-2507Eval=ST-iter2026.01 | 0.33 | 0.88 | 0.07 | 0.85 | 0.87 | 0.6 | 0.66 | 0.01 | 0.53 | |
| Qwen3-235B-Instruct-2507Eval=Multi-turn2026.01 | 0.29 | 0.76 | 0.06 | 0.75 | 0.77 | 0.55 | 0.66 | 0.01 | 0.48 | |
| DeepSeek-V3.2 (thinking)Eval=Multi-turn2026.01 | 0.26 | 0.85 | 0.31 | 0.78 | 0.81 | 0.78 | 0.65 | 0.55 | 0.62 | |
| DeepSeek-V3.2 (thinking)Eval=ST-iter2026.01 | 0.25 | 0.89 | 0.33 | 0.8 | 0.74 | 0.53 | 0.66 | 0.65 | 0.61 | |
| DeepSeek-V3.2 (no-think)Eval=ST-iter2026.01 | 0.24 | 0.93 | 0.34 | 0.83 | 0.88 | 0.6 | 0.67 | 0.5 | 0.62 | |
| DeepSeek-V3.2 (no-think)Eval=Multi-turn2026.01 | 0.23 | 0.89 | 0.31 | 0.81 | 0.89 | 0.79 | 0.63 | 0.46 | 0.63 | |
| Qwen3-30B-Instruct-2507Eval=Multi-turn2026.01 | 0.2 | 0.65 | 0.15 | 0.71 | 0.76 | 0.5 | 0.59 | 0.01 | 0.45 | |
| Qwen3-30B-Instruct-2507Eval=ST-iter2026.01 | 0.18 | 0.79 | 0.21 | 0.75 | 0.83 | 0.39 | 0.65 | 0 | 0.47 |