Science Reasoning and Simulation on ScienceWorld In-domain
62ScoreTask-Perturbed NLL Optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| Task-Perturbed NLL OptimizationBackbone=Qwen3-8B2026.06 | 62 | |
| GRPOBackbone=Qwen3-8B2026.06 | 57 | |
| Task-Perturbed NLL OptimizationBackbone=Qwen3-4B2026.06 | 51 | |
| GRPOBackbone=Qwen3-4B2026.06 | 46 |