Web Agent Navigation on Mind2Web Cross-Domain 1.0
445Success RateDuSAR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DuSARModel=Gemma3-12B2025.12 | 445 | 47.4 | 39.4 | |
| DuSARModel=Llama3.1-70B2025.12 | 361 | 45.8 | 36.8 | |
| DuSARModel=Llama3.1-8B2025.12 | 300 | 35.1 | 31 | |
| TRADModel=Llama3.1-70B2025.12 | 194 | 38.8 | 33.5 | |
| TRADModel=Gemma3-12B2025.12 | 88 | 28.5 | 24.6 | |
| SynapseModel=Gemma3-12B2025.12 | 62 | 30.5 | 22.5 | |
| PolySkill (+Update)Backbone=GLM-4.5, Training tasks=1009 tasks2025.10 | 46 | — | — | |
| ASI (+Update)Backbone=GLM-4.5, Training tasks=1009 tasks2025.10 | 45.1 | — | — | |
| SynapseModel=Llama3.1-70B2025.12 | 44 | 29.5 | 17.3 | |
| BaselineBackbone=GLM-4.5, Training tasks=1009 tasks2025.10 | 43.7 | — | — | |
| PolySkillBackbone=GLM-4.5, Training tasks=1009 tasks2025.10 | 42.9 | — | — | |
| ASIBackbone=GLM-4.5, Training tasks=1009 tasks2025.10 | 42.6 | — | — | |
| PolySkill (+Update)Backbone=Qwen3-Coder-480B-A35B, Training tasks=1009 tasks2025.10 | 39.9 | — | — | |
| ASI (+Update)Backbone=Qwen3-Coder-480B-A35B, Training tasks=1009 tasks2025.10 | 38.7 | — | — | |
| ReActModel=Llama3.1-70B2025.12 | 38 | 10.8 | 8.9 | |
| BaselineBackbone=Qwen3-Coder-480B-A35B, Training tasks=1009 tasks2025.10 | 37.5 | — | — | |
| PolySkillBackbone=Qwen3-Coder-480B-A35B, Training tasks=1009 tasks2025.10 | 35.9 | — | — | |
| ASIBackbone=Qwen3-Coder-480B-A35B, Training tasks=1009 tasks2025.10 | 35.2 | — | — | |
| SynapseModel=Llama3.1-8B2025.12 | 33 | 21.1 | 9.6 | |
| ReActModel=Gemma3-12B2025.12 | 33 | 21.8 | 15.4 | |
| SynapseModel=Llama2-7B2025.12 | 22 | 13 | 8.6 | |
| ReActModel=Llama2-7B2025.12 | 11 | 6.6 | 5.2 | |
| DuSARModel=Llama2-7B2025.12 | 11 | 12.5 | 9.8 | |
| TRADModel=Llama3.1-8B2025.12 | 5 | 15.4 | 10.1 | |
| TRADModel=Llama2-7B2025.12 | 0 | 10.6 | 7.4 | |
| ReActModel=Llama3.1-8B2025.12 | 0 | 5.7 | 3.1 |