Safety Evaluation on RRB, StrongR., and WildTeam Aggregate
66.7Average H ScoreSearch-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| Search-R1Evaluated Model=Qwen2.5-7B-Instruct, Judge=Qwen3-max2026.05 | 66.7 | |
| Naive RAGEvaluated Model=Qwen2.5-7B-Instruct, Judge=Qwen3-max2026.05 | 59.5 | |
| Base AgentEvaluated Model=Qwen2.5-7B-Instruct, Judge=Qwen3-max2026.05 | 59.3 | |
| BaseEvaluated Model=Qwen2.5-7B-Instruct, Judge=Qwen3-max2026.05 | 41.5 | |
| SafesearchEvaluated Model=Qwen2.5-7B-Instruct, Judge=Qwen3-max2026.05 | 29.2 | |
| COMPASSEvaluated Model=Qwen2.5-7B-Instruct, Judge=Qwen3-max2026.05 | 24.9 |