Target Viewpoint Reproduction on TVRBench 500-task (test)
93Overall Success RateHuman
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| HumanSample size=five participants, Subset=balanced 100-task subset2026.05 | 93 | 100 | 88 | 88 | 96 | 22.8 | 2.1 | 0.05 | 0.9 | 0 | |
| Gemini-3.1-ProMemory representation=Action-Only (AO), Decoding=lowest temperature2026.05 | 12 | 21.6 | 21.6 | 0.8 | 4 | 10.3 | 87.1 | 1.47 | 41.9 | 8.2 | |
| GPT-5Memory representation=Visual-Action (VA), Decoding=lowest temperature2026.05 | 8 | 15.2 | 8 | 3.2 | 5.6 | 33.7 | 27.3 | 1.3 | 43.2 | 4.2 | |
| GPT-5Memory representation=Action-Only (AO), Decoding=lowest temperature2026.05 | 8 | 22.4 | 6.4 | 2.4 | 0.8 | 34 | 0 | 1.54 | 56.6 | 7 | |
| Qwen3.5-27BMemory representation=Action-Only (AO), Backbone=Qwen3.5, Parameters=27B, Decoding=greedy2026.05 | 7.8 | 14.4 | 13.6 | 0 | 3.2 | 28.3 | 75.9 | 1.57 | 49.2 | 6.6 | |
| Qwen3.6-27BMemory representation=Action-Only (AO), Backbone=Qwen3.6, Parameters=27B, Decoding=greedy2026.05 | 7 | 12.8 | 9.6 | 1.6 | 4 | 27.2 | 80.8 | 1.66 | 53.7 | 7.6 | |
| GPT-4oMemory representation=Action-Only (AO), Decoding=lowest temperature2026.05 | 5.2 | 13.6 | 5.6 | 0.8 | 0.8 | 33.6 | 49 | 1.6 | 52.3 | 9.2 | |
| Qwen3.6-35B-A3BMemory representation=Action-Only (AO), Type=MoE, Decoding=greedy2026.05 | 4.8 | 9.6 | 8 | 0.8 | 0.8 | 28.8 | 84.5 | 1.8 | 70.6 | 9.3 | |
| Qwen3.5-35B-A3BMemory representation=Action-Only (AO), Type=MoE, Decoding=greedy2026.05 | 3.8 | 8 | 5.6 | 0 | 1.6 | 33.1 | 67.2 | 2 | 76 | 9.8 | |
| Qwen3.5-27BMemory representation=Visual-Action (VA), Backbone=Qwen3.5, Parameters=27B, Decoding=greedy2026.05 | 3.2 | 5.6 | 4 | 0.8 | 2.4 | 31.2 | 82 | 1.71 | 52.6 | 9.8 | |
| Qwen3.6-27BMemory representation=Visual-Action (VA), Backbone=Qwen3.6, Parameters=27B, Decoding=greedy2026.05 | 3.2 | 8.8 | 3.2 | 0.8 | 0 | 30.9 | 82.6 | 1.94 | 57 | 12.9 | |
| Qwen3.5-9BMemory representation=Action-Only (AO), Backbone=Qwen3.5, Parameters=9B, Decoding=greedy2026.05 | 2.8 | 6.4 | 4.8 | 0 | 0 | 29.9 | 89.6 | 1.94 | 67.8 | 12.8 | |
| GPT-4oMemory representation=Visual-Action (VA), Decoding=lowest temperature2026.05 | 2.8 | 5.6 | 4 | 1.6 | 0 | 31.3 | 87.3 | 1.68 | 61.1 | 11.9 | |
| Qwen3.5-35B-A3BMemory representation=Visual-Action (VA), Type=MoE, Decoding=greedy2026.05 | 0.8 | 2.4 | 0.8 | 0 | 0 | 33.8 | 84 | 2.03 | 80.4 | 10.6 | |
| Qwen3.6-35B-A3BMemory representation=Visual-Action (VA), Type=MoE, Decoding=greedy2026.05 | 0.2 | 0 | 0.8 | 0 | 0 | 34.1 | 94.7 | 2.1 | 74.6 | 14.7 | |
| Qwen3.5-9BMemory representation=Visual-Action (VA), Backbone=Qwen3.5, Parameters=9B, Decoding=greedy2026.05 | 0 | 0 | 0 | 0 | 0 | 34.3 | 100 | 2.05 | 86.8 | 15.8 |