Comprehensive Molecule Optimization on TOMG-Bench MOLOPT (test)
19.77LogP SR × SimActive-GRPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Active-GRPOHardware=40GB-A100, Seeds=3, Mechanism=Active imitate-reinforce and active referencing2026.07 | 19.77 | 19.04 | 14.4 | 17.73 | |
| Offline-strengthened RePOHardware=40GB-A100, Seeds=3, Reference Type=Stronger fixed target2026.07 | 19.74 | 18.53 | 11.3 | 16.52 | |
| Iterative SFTHardware=40GB-A100, Seeds=3, Mechanism=Self-distillation without active policy improvement2026.07 | 18.88 | 17.36 | 12.57 | 16.27 | |
| RePOHardware=40GB-A100, Seeds=3, Reference Type=Fixed-reference baseline2026.07 | 18.77 | 18.6 | 12.58 | 16.65 | |
| Zero-shotHardware=40GB-A100, Seeds=1, Evaluation Mode=Zero-shot2026.07 | 17 | 13.14 | 11.14 | 13.76 | |
| GRPO-onlyHardware=40GB-A100, Seeds=3, Training Strategy=GRPO without answer-level guidance2026.07 | 12.22 | 9.56 | 6.99 | 9.59 |