Robustness Evaluation on AIME
0FPRMaster-RM
Evaluation Results
| Method | Links | |
|---|---|---|
| Master-RMTarget Judge=Omni-Judge2025.12 | 0 | |
| AdvJudge-ZeroTarget Judge=General Verifier2025.12 | 0 | |
| Master-RMTarget Judge=General Verifier2025.12 | 0 | |
| Master-RMTarget Judge=Qwen2.5-RLVR2025.12 | 0 | |
| Master-RMTarget Judge=Master-RM Judge2025.12 | 0 | |
| AdvJudge-ZeroTarget Judge=Qwen2.5-RLVR2025.12 | 2.25 | |
| AdvJudge-ZeroTarget Judge=Master-RM Judge2025.12 | 2.25 | |
| Master-RMTarget Model=Llama-3.3-70B2025.12 | 32.69 | |
| Master-RMTarget Model=Qwen2.5-7B2025.12 | 37.41 | |
| Master-RMTarget Model=gemma-3-4b2025.12 | 41.59 | |
| Master-RMTarget Model=Qwen3-30B2025.12 | 81.78 | |
| Master-RMTarget Model=Llama-3.2-3B2025.12 | 86.07 | |
| Master-RMTarget Model=Qwen3-4B2025.12 | 87.25 | |
| AdvJudge-ZeroTarget Model=Llama-3.3-70B2025.12 | 93.35 | |
| AdvJudge-ZeroTarget Judge=Omni-Judge2025.12 | 96.46 | |
| AdvJudge-ZeroTarget Model=Qwen2.5-7B2025.12 | 99.25 | |
| AdvJudge-ZeroTarget Model=gemma-3-4b2025.12 | 99.25 | |
| AdvJudge-ZeroTarget Model=Qwen3-4B2025.12 | 100 | |
| AdvJudge-ZeroTarget Model=Qwen3-30B2025.12 | 100 | |
| AdvJudge-ZeroTarget Model=Llama-3.2-3B2025.12 | 100 |