Molecular Optimization on C-MuMO In-Domain (IND)
48.9SORGRPOMistral
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GRPOMistralBackbone=Mistral, Training Strategy=C-MORAL (GRPO)2026.04 | 48.9 | 25.1 | 59 | 96.1 | |
| GDPOMistralBackbone=Mistral, Training Strategy=C-MORAL (GDPO)2026.04 | 47 | 25 | 59 | 110.4 | |
| GDPOLlamaBackbone=Llama, Training Strategy=C-MORAL (GDPO)2026.04 | 43.4 | 25.4 | 57 | 110.3 | |
| GRPOLlamaBackbone=Llama, Training Strategy=C-MORAL (GRPO)2026.04 | 40.3 | 20.1 | 58 | 102.6 | |
| GeLLM4O-CMistralBackbone=Mistral, Training Strategy=Supervised Fine-Tuning (SFT) Baseline2026.04 | 33.7 | 14.4 | 58 | 51.4 | |
| GeLLM4O-CLlamaBackbone=Llama, Training Strategy=Supervised Fine-Tuning (SFT) Baseline2026.04 | 30.2 | 13.7 | 56 | 61.3 |