Molecular Optimization on C-MuMO Out-of-Domain (OOD)
39.5SORGRPOMistral
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GRPOMistralBackbone=Mistral, Training Strategy=C-MORAL (GRPO)2026.04 | 39.5 | 20.8 | 60 | 19.5 | |
| GDPOMistralBackbone=Mistral, Training Strategy=C-MORAL (GDPO)2026.04 | 38.3 | 19.8 | 59 | 27.2 | |
| GRPOLlamaBackbone=Llama, Training Strategy=C-MORAL (GRPO)2026.04 | 37.2 | 19.6 | 60 | 10.5 | |
| GDPOLlamaBackbone=Llama, Training Strategy=C-MORAL (GDPO)2026.04 | 35.6 | 19.5 | 59 | 19.1 | |
| GeLLM4O-CLlamaBackbone=Llama, Training Strategy=Supervised Fine-Tuning (SFT) Baseline2026.04 | 25.2 | 10.2 | 57 | 6.5 | |
| GeLLM4O-CMistralBackbone=Mistral, Training Strategy=Supervised Fine-Tuning (SFT) Baseline2026.04 | 24.4 | 9.8 | 60 | 27.3 |