Question Answering on Search-QA
51Average ScoreGEPO
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| GEPOType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 51 | — | — | — | — | — | — | — | — | — | |
| RLSDBackbone=Qwen2.5-7B-Instruct2026.05 | 49 | 46.8 | 63 | 44.4 | 45.5 | 48.9 | 21.5 | 73 | — | — | |
| SDARBackbone=Qwen2.5-7B-Instruct2026.05 | 49 | 46.3 | 63.5 | 48.2 | 43.8 | 48.4 | 19.6 | 73 | — | — | |
| RLSDBackbone=Qwen2.5-7B-Instruct2026.06 | 49 | 46.8 | 63 | 44.4 | 45.5 | 48.9 | 21.5 | 73 | — | — | |
| SDARBackbone=Qwen2.5-7B-Instruct2026.06 | 49 | 46.3 | 63.5 | 48.2 | 43.8 | 48.4 | 19.6 | 73 | — | — | |
| UCOBBackbone=Qwen2.5-7B-Instruct2026.06 | 48.2 | 46.4 | 65.6 | 46.7 | 45.7 | 42.9 | 19.2 | 70.6 | — | — | |
| D2SkillBackbone=Qwen2.5-7B-Instruct2026.06 | 48.1 | 48.7 | 63.4 | 44.9 | 47.5 | 43.7 | 21 | 67.7 | — | — | |
| Skill-SDBackbone=Qwen2.5-7B-Instruct2026.05 | 47.8 | 47.1 | 64.5 | 47.8 | 44.2 | 42.1 | 20.2 | 69 | — | — | |
| Skill-SDBackbone=Qwen2.5-7B-Instruct2026.06 | 47.8 | 47.1 | 64.5 | 47.8 | 44.2 | 42.1 | 20.2 | 69 | — | — | |
| Skill-GRPO*Backbone=Qwen2.5-7B-Instruct2026.05 | 47.5 | 44.8 | 63 | 45.1 | 43.7 | 43.7 | 20.5 | 71.4 | — | — | |
| SkillRLBackbone=Qwen2.5-7B-Instruct2026.06 | 47.5 | 45.9 | 63.3 | 45.9 | 43.2 | 40.3 | 20.2 | 73.8 | — | — | |
| GiGPOType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 47.2 | — | — | — | — | — | — | — | — | — | |
| GiGPOBackbone=Qwen2.5-7B-Instruct2026.06 | 47.2 | 46.4 | 64.7 | 46.1 | 41.6 | 43.6 | 18.9 | 68.9 | — | — | |
| SkillRLBackbone=Qwen2.5-(VL)-7B-Instruct, Skill Augmentation=true2026.04 | 47.1 | 45.9 | 63.3 | 45.9 | 43.2 | 40.3 | 20.2 | 73.8 | — | — | |
| GRPO+OPSDBackbone=Qwen2.5-7B-Instruct2026.05 | 47 | 47.3 | 64.5 | 46.9 | 43.8 | 39.3 | 18 | 69.4 | — | — | |
| GEPOType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 46 | — | — | — | — | — | — | — | — | — | |
| StepOPSDBackbone=Qwen2.5-3B-Instruct, lambda_mix=0.05, alpha_clip=0.052026.05 | 45.7 | 45 | 61.6 | 46.2 | 39.5 | 39.5 | 14.4 | 65.3 | — | — | |
| SAPOBackbone=Qwen2.5-7B-Instruct2026.06 | 44.7 | 48.4 | 62.9 | 46.7 | 45 | 45.2 | 18.3 | 46.4 | — | — | |
| Skill1Backbone=Qwen2.5-7B-Instruct2026.06 | 44.7 | 46.8 | 46.3 | 47.8 | 43.7 | 39.3 | 18.2 | 70.6 | — | — | |
| GRPO+OPSDBackbone=Qwen2.5-3B-Instruct2026.05 | 44.6 | 44.9 | 61.2 | 45.2 | 40.4 | 38.5 | 16 | 66.1 | — | — | |
| GRPO+OPSDBackbone=Qwen2.5-3B-Instruct2026.05 | 44.6 | 44.9 | 61.2 | 45.2 | 40.4 | 38.5 | 16 | 66.1 | — | — | |
| StepOPSDBackbone=Qwen2.5-3B-Instruct2026.06 | 44.5 | 45 | 61.6 | 46.2 | 39.5 | 39.5 | 14.4 | 65.3 | — | — | |
| SKILL0Backbone=Qwen2.5-(VL)-7B-Instruct2026.04 | 44.4 | 42.7 | 61.1 | 45.3 | 40 | 38.3 | 16.4 | 66.9 | — | — | |
| SKILL0Backbone=Qwen2.5-(VL)-7B-Instruct, Reduced Token Overhead=true2026.04 | 44.4 | 42.7 | 61.1 | 45.3 | 40 | 38.3 | 16.4 | 66.9 | 0.34 | — | |
| StepOPSDBackbone=Qwen2.5-3B-Instruct, lambda_mix=0.22026.05 | 44.3 | 44.4 | 61.4 | 46.8 | 40.4 | 38.1 | 14.1 | 65 | — | — | |
| Skill-SDBackbone=Qwen2.5-3B-Instruct2026.05 | 44.1 | 44.4 | 60.4 | 44 | 39.5 | 40.4 | 15.4 | 64.9 | — | — | |
| Skill-SDBackbone=Qwen2.5-3B-Instruct2026.05 | 44.1 | 44.4 | 60.4 | 44 | 39.5 | 40.4 | 15.4 | 64.9 | — | — | |
| Skill-SDBackbone=Qwen2.5-3B-Instruct2026.06 | 44.1 | 44.4 | 60.4 | 44 | 39.5 | 40.4 | 15.4 | 64.9 | — | — | |
| RLSDBackbone=Qwen2.5-3B-Instruct2026.05 | 43.8 | 41.5 | 58.6 | 42.3 | 40.4 | 40.2 | 16.8 | 66.9 | — | — | |
| RLSDBackbone=Qwen2.5-3B-Instruct2026.05 | 43.8 | 41.5 | 58.6 | 42.3 | 40.4 | 40.2 | 16.8 | 66.9 | — | — | |
| RLSDBackbone=Qwen2.5-3B-Instruct2026.06 | 43.8 | 41.5 | 58.6 | 42.3 | 40.4 | 40.2 | 16.8 | 66.9 | — | — | |
| StepOPSDBackbone=Qwen2.5-3B-Instruct, lambda_mix=0.052026.05 | 43.7 | 43.6 | 61.2 | 43.8 | 39.2 | 38.1 | 15.8 | 64.5 | — | — | |
| UCOBBackbone=Qwen2.5-3B-Instruct2026.06 | 43.6 | 45 | 61.4 | 47 | 37.2 | 35.8 | 12.5 | 66.2 | — | — | |
| Skill-GRPOBackbone=Qwen2.5-3B-Instruct2026.05 | 43.5 | 44.3 | 59.6 | 44.3 | 39 | 36.1 | 14.5 | 66.4 | — | — | |
| SDARBackbone=Qwen2.5-3B-Instruct2026.05 | 43.4 | 44.8 | 58.1 | 44.3 | 38.6 | 36.2 | 15.7 | 66.1 | — | — | |
| SDARBackbone=Qwen2.5-3B-Instruct2026.05 | 43.4 | 44.8 | 58.1 | 44.3 | 38.6 | 36.2 | 15.7 | 66.1 | — | — | |
| SDARBackbone=Qwen2.5-3B-Instruct2026.06 | 43.4 | 44.8 | 58.1 | 44.3 | 38.6 | 36.2 | 15.7 | 66.1 | — | — | |
| Skill1Backbone=Qwen2.5-3B-Instruct2026.06 | 43.2 | 44.2 | 60.3 | 44.8 | 39.2 | 35.9 | 13.1 | 64.9 | — | — | |
| EvolveRBackbone=Qwen2.5-(VL)-7B-Instruct2026.04 | 43.1 | 43.5 | 63.4 | 44.6 | 38.2 | 42 | 15.6 | 54.4 | — | — | |
| EvolveRBackbone=Qwen2.5-(VL)-7B-Instruct2026.04 | 43.1 | 43.5 | 63.4 | 45.9 | 38.2 | 42 | 15.6 | 54.4 | — | — | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.05 | 42.6 | 43.5 | 58.8 | 43 | 36.8 | 32.2 | 11.7 | 72.5 | — | — | |
| GiGPOBackbone=Qwen2.5-3B-Instruct2026.06 | 42.6 | 43 | 60.5 | 46.9 | 36.2 | 35.5 | 12.1 | 64.1 | — | — | |
| Skill1Backbone=Qwen3-1.7B2026.06 | 42.3 | 42.7 | 59.8 | 46 | 35.4 | 34.8 | 12 | 65.7 | — | — | |
| GRPO+OPSDBackbone=Qwen3-1.7B-Instruct2026.05 | 42.2 | 40.7 | 58.9 | 45 | 37 | 34.6 | 13.3 | 65.7 | — | — | |
| GRPO+OPSDBackbone=Qwen3-1.7B2026.05 | 42.2 | 40.7 | 58.9 | 45 | 37 | 34.6 | 13.3 | 65.7 | — | — | |
| GiGPOType=RL Training, Model=Qwen2.5-3B-Instruct2025.10 | 42.1 | — | — | — | — | — | — | — | — | — | |
| UCOBBackbone=Qwen3-1.7B2026.06 | 42.1 | 44.1 | 59.6 | 45.7 | 36.8 | 31.9 | 12.2 | 64.5 | — | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 42 | 45.1 | 63.7 | 44 | 43.6 | 43.2 | 16.8 | 37.6 | — | — | |
| StepOPSDBackbone=Qwen3-1.7B, lambda_mix=0.22026.05 | 42 | 40.6 | 59.4 | 44.4 | 37.1 | 32 | 11.6 | 64.1 | — | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | 42 | 45.1 | 63.7 | 44 | 43.6 | 43.2 | 16.8 | 37.6 | — | — | |
| GRPOBackbone=Qwen2.5-(VL)-7B-Instruct2026.04 | 41.9 | 45.1 | 63.7 | 44 | 43.6 | 43.2 | 16.8 | 37.6 | 0.73 | — | |
| SDARBackbone=Qwen3-1.7B-Instruct2026.05 | 41.9 | 39.7 | 58.9 | 45.3 | 35.9 | 35.5 | 12.6 | 65.3 | — | — | |
| SDARBackbone=Qwen3-1.7B2026.05 | 41.9 | 39.7 | 58.9 | 45.3 | 35.9 | 35.5 | 12.6 | 65.3 | — | — | |
| SDARBackbone=Qwen3-1.7B2026.06 | 41.9 | 39.7 | 58.9 | 45.3 | 35.9 | 35.5 | 12.6 | 65.3 | — | — | |
| StepOPSDBackbone=Qwen3-1.7B, lambda_mix=0.052026.05 | 41.4 | 40.5 | 58.6 | 45.6 | 34.9 | 29.8 | 10.8 | 64.5 | — | — | |
| StepOPSDBackbone=Qwen3-1.7B2026.06 | 41.3 | 40.5 | 59.4 | 44.4 | 37.1 | 32 | 11.6 | 64.1 | — | — | |
| SLIMMethod Category=RL-based, Retrieved external skills=false2026.05 | 41 | 38.6 | 62.2 | 40 | 37.2 | 31.7 | 12.8 | 37.6 | — | — | |
| SLIMMethod Category=RL-based, Retrieved external skills=true2026.05 | 41 | 38.4 | 62.1 | 40.4 | 36.9 | 31.5 | 12.7 | 36 | — | — | |
| SLIMretrieved external skills=true2026.05 | 41 | 38.4 | 62.1 | 40.4 | 36.9 | 31.5 | 12.7 | 36 | — | — | |
| GiGPOBackbone=Qwen3-1.7B2026.06 | 41 | 41.1 | 59.3 | 45.1 | 34.1 | 32.7 | 10.5 | 64.5 | — | — | |
| SKILL0Backbone=Qwen2.5-(VL)-3B-Instruct2026.04 | 40.8 | 39.8 | 57.5 | 42.3 | 35.1 | 33.7 | 13.3 | 63.7 | — | — | |
| SKILL0Backbone=Qwen2.5-(VL)-3B-Instruct, Reduced Token Overhead=true2026.04 | 40.8 | 39.8 | 57.5 | 42.3 | 35.1 | 33.7 | 13.3 | 63.7 | 0.18 | — | |
| GRPOBackbone=Qwen3-1.7B-Instruct2026.05 | 40.8 | 40 | 58.9 | 43.5 | 35.4 | 30.3 | 12 | 65.7 | — | — | |
| Skill-SDBackbone=Qwen3-1.7B-Instruct2026.05 | 40.8 | 39.1 | 57.5 | 45.4 | 34.8 | 34.1 | 10.7 | 64.1 | — | — | |
| GRPOBackbone=Qwen3-1.7B2026.05 | 40.8 | 40 | 58.9 | 43.5 | 35.4 | 30.3 | 12 | 65.7 | — | — | |
| Skill-SDBackbone=Qwen3-1.7B2026.05 | 40.8 | 39.1 | 57.5 | 45.4 | 34.8 | 34.1 | 10.7 | 64.1 | — | — | |
| GRPOBackbone=Qwen3-1.7B2026.06 | 40.8 | 40 | 58.9 | 43.5 | 35.4 | 30.3 | 12 | 65.7 | — | — | |
| Skill-SDBackbone=Qwen3-1.7B2026.06 | 40.8 | 39.1 | 57.5 | 45.4 | 34.8 | 34.1 | 10.7 | 64.1 | — | — | |
| Skill-GRPO*Backbone=Qwen3-1.7B-Instruct2026.05 | 40.7 | 38 | 58.4 | 43.9 | 36.3 | 29 | 12.5 | 66.9 | — | — | |
| Skill-GRPO*Backbone=Qwen3-1.7B2026.05 | 40.7 | 38 | 58.4 | 43.9 | 36.3 | 29 | 12.5 | 66.9 | — | — | |
| RLSDBackbone=Qwen3-1.7B-Instruct2026.05 | 40.6 | 38.6 | 57.3 | 43 | 34.5 | 34.1 | 11.5 | 65.3 | — | — | |
| RLSDBackbone=Qwen3-1.7B2026.05 | 40.6 | 38.6 | 57.3 | 43 | 34.5 | 34.1 | 11.5 | 65.3 | — | — | |
| RLSDBackbone=Qwen3-1.7B2026.06 | 40.6 | 38.6 | 57.3 | 43 | 34.5 | 34.1 | 11.5 | 65.3 | — | — | |
| Skill-GRPOBackbone=Qwen3-1.7B-Instruct2026.05 | 40.4 | 39.2 | 58.6 | 43.9 | 35.2 | 28.2 | 11.5 | 66.1 | — | — | |
| Skill-GRPOBackbone=Qwen3-1.7B2026.05 | 40.4 | 39.2 | 58.6 | 43.9 | 35.2 | 28.2 | 11.5 | 66.1 | — | — | |
| Skill-GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 40.3 | 45.2 | 63.7 | 45.7 | 43.1 | 43.3 | 19.6 | 21.4 | — | — | |
| AgentOCRBackbone=Qwen2.5-(VL)-7B-Instruct, Reduced Token Overhead=true2026.04 | 40.1 | 43.1 | 61 | 45.4 | 40.8 | 38.3 | 15.7 | 36.8 | 0.36 | — | |
| Skill0Method Category=RL-based, Retrieved external skills=false2026.05 | 39.3 | 37.9 | 59.5 | 38.6 | 32.7 | 31.9 | 10.3 | 32.8 | — | — | |
| ZeroSearchBackbone=Qwen2.5-(VL)-7B-Instruct2026.04 | 39.1 | 43.6 | 61.8 | 51.5 | 34.6 | 35.2 | 18.4 | 27.8 | — | — | |
| ZeroSearchType=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 39.1 | — | — | — | — | — | — | — | — | — | |
| SkillRLBackbone=Qwen2.5-(VL)-3B-Instruct, Skill Augmentation=true2026.04 | 38.9 | 38.6 | 57.6 | 40.3 | 33.6 | 31.1 | 13.3 | 58.1 | 0.87 | — | |
| Qwen3-14BStudent Model=N/A, Teacher Model=Qwen3-14B, Method=Base Inference2026.06 | 38.6 | 35 | 55.8 | 15.6 | 41.2 | 43 | 30 | 49.6 | — | — | |
| Search-R1Backbone=Qwen2.5-(VL)-7B-Instruct2026.04 | 38.5 | 39.3 | 61 | 39.7 | 37 | — | 14.6 | 36.8 | — | — | |
| Search-R1Type=RL Training, Model=Qwen2.5-7B-Instruct2025.10 | 38.5 | — | — | — | — | — | — | — | — | — | |
| EvolveRBackbone=Qwen2.5-(VL)-3B-Instruct2026.04 | 38.2 | 43.4 | 58.4 | 43.4 | 37.3 | 38.1 | 13.7 | 32.8 | — | — | |
| EvolveRBackbone=Qwen2.5-(VL)-3B-Instruct2026.04 | 38.2 | 43.4 | 58.4 | 43.4 | 37.3 | 38.1 | 13.7 | 32.8 | — | — | |
| SkillRLMethod Category=RL-based, Retrieved external skills=true2026.05 | 38.1 | 36.8 | 59.8 | 36.9 | 31.5 | 29.7 | 10.3 | 31.2 | — | — | |
| GRPOMethod Category=RL-based, Retrieved external skills=true2026.05 | 37.9 | 36.4 | 58.2 | 37 | 31.2 | 30.4 | 9.6 | 31.2 | — | — | |
| RAG2026.05 | 37.6 | 42.1 | 65.7 | 46.4 | 37.1 | 30.7 | 8.4 | 28 | — | — | |
| GRPOMethod Category=RL-based, Retrieved external skills=false2026.05 | 37.5 | 35.9 | 57.8 | 36.5 | 30.8 | 30.1 | 9.2 | 30.4 | — | — | |
| EvolveRMethod Category=RL-based, Retrieved external skills=false2026.05 | 37.4 | 36 | 57.5 | 36.8 | 30.6 | 30 | 9.5 | 29.6 | — | — | |
| Search-R12026.05 | 37.2 | 38 | 59.7 | 38.4 | 35.7 | 40.1 | 13.2 | 35.2 | — | — | |
| Reject Sampling2026.05 | 36.8 | 38 | 61.2 | 40 | 35.1 | 31.6 | 14.3 | 37.6 | — | — | |
| GRPOBackbone=Qwen2.5-(VL)-3B-Instruct2026.04 | 36.4 | 39.3 | 60.6 | 41.1 | 37.4 | 34.6 | 15.4 | 26.4 | 0.61 | — | |
| ReActMethod Category=Agent- or memory-based, Retrieved external skills=false2026.05 | 36.4 | 33.2 | 54.5 | 36.5 | 28.8 | 30.8 | 7.7 | 33.6 | — | — | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.05 | 36.4 | 39.3 | 60.6 | 41.1 | 37.4 | 34.6 | 15.4 | 26.4 | — | — | |
| Skill-Prompt*Backbone=Qwen2.5-7B-Instruct2026.05 | 36.4 | 30.9 | 52.1 | 32.7 | 32.7 | 27.9 | 12.7 | 66.1 | — | — | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.06 | 36.4 | 39.3 | 60.6 | 41.1 | 37.4 | 34.6 | 15.4 | 26.4 | — | — | |
| Skill-GRPO*Backbone=Qwen2.5-3B-Instruct2026.05 | 36.1 | 44.3 | 59.6 | 44.3 | 39 | 36.1 | 14.5 | 14.9 | — | — | |
| Skill-GRPO*Backbone=Qwen2.5-3B-Instruct2026.05 | 36.1 | 44.3 | 59.6 | 44.3 | 39 | 36.1 | 14.5 | 14.9 | — | — |