Scientific Reasoning on ScienceWorld Unseen
62Average RewardCo-Evolving Agents
Evaluation Results
| Method | Links | |
|---|---|---|
| Co-Evolving AgentsAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 62 | |
| Co-Evolving AgentsBackbone=Qwen3-4B-Instruct-25072025.11 | 58.5 | |
| Llama-2-7B-Chat + ETOAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 55.5 | |
| ETOBackbone=Qwen3-4B-Instruct-25072025.11 | 55.2 | |
| Llama-2-7B-Chat + RFTAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 54.3 | |
| Llama-2-7B-Chat + PPOAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 51.7 | |
| Llama-2-7B-Chat + SFTAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 41.9 | |
| SFTBackbone=Qwen3-4B-Instruct-25072025.11 | 40.8 | |
| GPT-4Adaptation=In-context2025.11 | 38.1 | |
| GPT-3.5-TurboAdaptation=In-context2025.11 | 10.5 | |
| DELTAMEMLLM=DeepSeek-V4-flash, Decoding Temperature=0, Prompt Framework=ReAct, Node Embeddings=E5-base-v2, Learning Protocol=Online learning, in-context demonstration=nicl = 12026.06 | 0.8688 | |
| SynapseLLM=DeepSeek-V4-flash, Decoding Temperature=0, Prompt Framework=ReAct, Node Embeddings=E5-base-v2, Learning Protocol=Online learning, in-context demonstration=nicl = 12026.06 | 0.8558 | |
| AWMLLM=DeepSeek-V4-flash, Decoding Temperature=0, Prompt Framework=ReAct, Node Embeddings=E5-base-v2, Learning Protocol=Online learning, in-context demonstration=nicl = 12026.06 | 0.7453 | |
| No MemoryLLM=DeepSeek-V4-flash, Decoding Temperature=0, Prompt Framework=ReAct, Node Embeddings=E5-base-v2, Learning Protocol=Zero-shot, in-context demonstration=nicl = 12026.06 | 0.7186 | |
| RBankLLM=DeepSeek-V4-flash, Decoding Temperature=0, Prompt Framework=ReAct, Node Embeddings=E5-base-v2, Learning Protocol=Online learning, in-context demonstration=nicl = 12026.06 | 0.6898 |