Science Reasoning and Simulation on ScienceWorld OOD
0.46ScoreTask-Perturbed NLL Optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| Task-Perturbed NLL OptimizationBackbone=Qwen3-8B2026.06 | 0.46 | |
| GRPOBackbone=Qwen3-8B2026.06 | 0.4 | |
| Task-Perturbed NLL OptimizationBackbone=Qwen3-4B2026.06 | 0.25 | |
| GRPOBackbone=Qwen3-4B2026.06 | 0.22 |