Robustness Evaluation on MATH
0FPR (%)AdvJudge-Zero
Evaluation Results
| Method | Links | |
|---|---|---|
| AdvJudge-ZeroTarget Judge=General Verifier2025.12 | 0 | |
| Master-RMTarget Judge=General Verifier2025.12 | 0 | |
| Master-RMTarget Judge=Master-RM Judge2025.12 | 0 | |
| Master-RMTarget Judge=Omni-Judge2025.12 | 0.01 | |
| Master-RMTarget Judge=Qwen2.5-RLVR2025.12 | 0.55 | |
| AdvJudge-ZeroTarget Judge=Master-RM Judge2025.12 | 9.63 | |
| AdvJudge-ZeroTarget Judge=Qwen2.5-RLVR2025.12 | 10.77 | |
| Master-RMTarget Model=Qwen2.5-7B2025.12 | 55.14 | |
| Master-RMTarget Model=gemma-3-4b2025.12 | 60.7 | |
| Master-RMTarget Model=Llama-3.3-70B2025.12 | 67.99 | |
| Master-RMTarget Model=Llama-3.2-3B2025.12 | 75.18 | |
| Master-RMTarget Model=Qwen3-30B2025.12 | 82.88 | |
| Master-RMTarget Model=Qwen3-4B2025.12 | 89.25 | |
| AdvJudge-ZeroTarget Judge=Omni-Judge2025.12 | 99.41 | |
| AdvJudge-ZeroTarget Model=Llama-3.2-3B2025.12 | 99.8 | |
| AdvJudge-ZeroTarget Model=Llama-3.3-70B2025.12 | 99.85 | |
| AdvJudge-ZeroTarget Model=Qwen2.5-7B2025.12 | 99.88 | |
| AdvJudge-ZeroTarget Model=gemma-3-4b2025.12 | 99.92 | |
| AdvJudge-ZeroTarget Model=Qwen3-4B2025.12 | 100 | |
| AdvJudge-ZeroTarget Model=Qwen3-30B2025.12 | 100 |