Safety Evaluation on MEMEVOBENCH QA Style 1.0 (test)
16ASR (Rd.1)GPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5Prompting Strategy=+ModTool, User Feedback=None2026.04 | 16 | 22 | 22 | |
| GPT-5Prompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 16 | 44 | 46 | |
| Gemini-2.5-ProPrompting Strategy=+ModTool, User Feedback=None2026.04 | 19 | 13 | 14 | |
| Gemini-2.5-ProPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 19 | 23 | 30 | |
| Qwen3-235B-A22BPrompting Strategy=+ModTool, User Feedback=None2026.04 | 20.4 | 18.5 | 16.7 | |
| Qwen3-235B-A22BPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 21.6 | 28.7 | 26.9 | |
| Claude-3.7-SonnetPrompting Strategy=+ModTool, User Feedback=None2026.04 | 27 | 26 | 26 | |
| Claude-3.7-SonnetPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 27 | 32 | 35 | |
| GPT-5Prompting Strategy=+SafePrompt, User Feedback=None2026.04 | 29 | 35 | 46 | |
| GPT-5Prompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 29 | 60 | 65 | |
| Llama-3.3-70BPrompting Strategy=+ModTool, User Feedback=None2026.04 | 41 | 40 | 34 | |
| Llama-3.3-70BPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 41 | 42 | 49 | |
| Gemini-2.5-ProPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 42 | 49 | 66 | |
| Qwen3-Next-80BPrompting Strategy=+ModTool, User Feedback=None2026.04 | 43.5 | 25.9 | 25.9 | |
| Qwen3-Next-80BPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 45.3 | 32.4 | 41.7 | |
| Gemini-2.5-ProPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 46 | 33 | 32 | |
| GPT-5Prompting Strategy=Vanilla, User Feedback=None2026.04 | 49 | 67 | 59 | |
| GPT-5Prompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 49 | 73 | 78 | |
| Qwen3-235B-A22BPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 49.1 | 42.4 | 45.4 | |
| Qwen3-235B-A22BPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 49.1 | 50 | 53.7 | |
| DeepSeek-V3.2Prompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 52 | 55 | 61 | |
| DeepSeek-V3.2Prompting Strategy=+ModTool, User Feedback=None2026.04 | 53 | 45 | 43 | |
| Llama-3.3-70BPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 54 | 62 | 65 | |
| Llama-3.3-70BPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 55 | 55 | 52 | |
| Claude-3.7-SonnetPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 55 | 51 | 43 | |
| Claude-3.7-SonnetPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 55 | 57 | 64 | |
| DeepSeek-V3.2Prompting Strategy=+SafePrompt, User Feedback=None2026.04 | 56 | 50 | 50 | |
| DeepSeek-V3.2Prompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 56 | 58 | 62 | |
| GPT-4oPrompting Strategy=+ModTool, User Feedback=None2026.04 | 58.9 | 58.3 | 61.1 | |
| GPT-4oPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 61.1 | 70.4 | 76.9 | |
| Qwen3-Next-80BPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 64.8 | 63.8 | 61.1 | |
| Qwen3-32BPrompting Strategy=+ModTool, User Feedback=None2026.04 | 65.7 | 74.1 | 76 | |
| Qwen3-32BPrompting Strategy=+ModTool, User Feedback=w/feedback2026.04 | 65.7 | 83.3 | 82.4 | |
| Qwen3-Next-80BPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 65.7 | 71.3 | 72.3 | |
| Gemini-2.5-ProPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 66 | 72 | 80 | |
| Gemini-2.5-ProPrompting Strategy=Vanilla, User Feedback=None2026.04 | 67 | 55 | 55 | |
| Claude-3.7-SonnetPrompting Strategy=Vanilla, User Feedback=None2026.04 | 69 | 69 | 63 | |
| Claude-3.7-SonnetPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 69 | 75 | 77 | |
| GPT-4oPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 72.2 | 79.6 | 79 | |
| GPT-4oPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 72.2 | 84.3 | 84.3 | |
| Qwen3-32BPrompting Strategy=+SafePrompt, User Feedback=None2026.04 | 72.3 | 84.3 | 82.4 | |
| Qwen3-32BPrompting Strategy=+SafePrompt, User Feedback=w/feedback2026.04 | 72.3 | 93.5 | 94.3 | |
| Qwen3-235B-A22BPrompting Strategy=Vanilla, User Feedback=None2026.04 | 76.9 | 77.8 | 76.9 | |
| Qwen3-235B-A22BPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 76.9 | 86.1 | 83.1 | |
| Llama-3.3-70BPrompting Strategy=Vanilla, User Feedback=None2026.04 | 82 | 84 | 81 | |
| Llama-3.3-70BPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 83 | 87 | 90 | |
| DeepSeek-V3.2Prompting Strategy=Vanilla, User Feedback=None2026.04 | 84 | 83 | 81 | |
| Qwen3-Next-80BPrompting Strategy=Vanilla, User Feedback=None2026.04 | 84.2 | 80.5 | 79.6 | |
| Qwen3-Next-80BPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 84.2 | 88.9 | 84.4 | |
| DeepSeek-V3.2Prompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 85 | 86 | 89 | |
| Qwen3-32BPrompting Strategy=Vanilla, User Feedback=None2026.04 | 85.2 | 91.7 | 89.8 | |
| Qwen3-32BPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 86.1 | 96.3 | 94.4 | |
| GPT-4oPrompting Strategy=Vanilla, User Feedback=w/feedback2026.04 | 87 | 93.5 | 94 | |
| GPT-4oPrompting Strategy=Vanilla, User Feedback=None2026.04 | 88.9 | 89.8 | 91.7 |