General Competence on G2U Overall
2.8Average Rank (Overall)Human
Evaluation Results
| Method | Links | |
|---|---|---|
| HumanParadigm=Control Group2025.11 | 2.8 | |
| Qwen3-VL-8BParadigm=Interactive Physical Reasoner Group, Interactive Physical Reasoner (IPR) Status=w/ IPR2025.11 | 4.9 | |
| DQNParadigm=Reinforcement Learning (RL) Group, Optimization Objective (@)=curiosity2025.11 | 10.6 | |
| DreamerV3Paradigm=World Model Group, Optimization Objective (@)=curiosity2025.11 | 10.7 | |
| DQNParadigm=Reinforcement Learning (RL) Group, Optimization Objective (@)=utility2025.11 | 11.4 | |
| PPOParadigm=Reinforcement Learning (RL) Group, Optimization Objective (@)=survival2025.11 | 12 | |
| DQNParadigm=Reinforcement Learning (RL) Group, Optimization Objective (@)=survival2025.11 | 12.2 | |
| GenieReduxParadigm=World Model Group, Optimization Objective (@)=utility2025.11 | 12.4 | |
| DreamerV3Paradigm=World Model Group, Optimization Objective (@)=survival2025.11 | 13.1 | |
| Qwen3-VL-8B-BCParadigm=Imitation Learning (IL) Group2025.11 | 13.3 | |
| GPT-5Paradigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=survival2025.11 | 13.3 | |
| GenieReduxParadigm=World Model Group, Optimization Objective (@)=survival2025.11 | 14.2 | |
| PPOParadigm=Reinforcement Learning (RL) Group, Optimization Objective (@)=utility2025.11 | 14.7 | |
| PPOParadigm=Reinforcement Learning (RL) Group, Optimization Objective (@)=curiosity2025.11 | 14.8 | |
| DreamerV3Paradigm=World Model Group, Optimization Objective (@)=utility2025.11 | 15.4 | |
| GenieReduxParadigm=World Model Group, Optimization Objective (@)=curiosity2025.11 | 16.1 | |
| GPT-4oParadigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=survival2025.11 | 16.4 | |
| ACT-BCParadigm=Imitation Learning (IL) Group2025.11 | 16.6 | |
| GPT-5Paradigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=utility2025.11 | 16.8 | |
| Qwen3-VL-30B-A3BParadigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=utility2025.11 | 17.6 | |
| GPT-5Paradigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=curiosity2025.11 | 17.9 | |
| Qwen3-VL-8BParadigm=Interactive Physical Reasoner Group, Interactive Physical Reasoner (IPR) Status=w/o IPR2025.11 | 18.2 | |
| V-JEPA2Paradigm=World Model Group, Optimization Objective (@)=survival2025.11 | 18.3 | |
| GPT-4oParadigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=utility2025.11 | 18.8 | |
| GPT-4oParadigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=curiosity2025.11 | 19.4 | |
| V-JEPA2Paradigm=World Model Group, Optimization Objective (@)=utility2025.11 | 20.2 | |
| V-JEPA2Paradigm=World Model Group, Optimization Objective (@)=curiosity2025.11 | 20.8 | |
| Qwen3-VL-30B-A3BParadigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=curiosity2025.11 | 22.4 | |
| Qwen3-VL-30B-A3BParadigm=Multimodal Large Language Model (MLLM) Group, Optimization Objective (@)=survival2025.11 | 22.7 | |
| RandomParadigm=Control Group2025.11 | 26.9 |