Moderation Detection of Reasoning Chains on HotpotQA
100Moderation Guard Rate (OpenAI)Naive
Evaluation Results
| Method | Links | |
|---|---|---|
| NaiveAgent Framework=ReAct, LLM Backbone=Qwen2026.07 | 100 | |
| IgnoreAgent Framework=ReAct, LLM Backbone=Qwen2026.07 | 100 | |
| CombinedAgent Framework=ReAct, LLM Backbone=Qwen2026.07 | 100 | |
| PARADOXAgent Framework=ReAct, LLM Backbone=Qwen2026.07 | 93 | |
| PoisonedRAGAgent Framework=ReAct, LLM Backbone=Qwen2026.07 | 91.9 | |
| PARADOXAgent Framework=WebThinker, LLM Backbone=QwQ2026.07 | 72.8 | |
| PoisonedRAGAgent Framework=WebThinker, LLM Backbone=QwQ2026.07 | 45.2 | |
| NaiveAgent Framework=WebThinker, LLM Backbone=QwQ2026.07 | 30.2 | |
| CombinedAgent Framework=WebThinker, LLM Backbone=QwQ2026.07 | 18.3 | |
| IgnoreAgent Framework=WebThinker, LLM Backbone=QwQ2026.07 | 12.5 | |
| KidnapRAGAgent Framework=WebThinker, LLM Backbone=QwQ2026.07 | 4.2 | |
| KidnapRAGAgent Framework=ReAct, LLM Backbone=Qwen2026.07 | 0 |