Machine-Text Detection on Blogs (evaluation)
1AUROCBaseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineSample Size (N)=10, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 1 | |
| BaselineSample Size (N)=25, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 1 | |
| BaselineSample Size (N)=50, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 1 | |
| Style-aware ParaphraserSample Size (N)=25, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 1 | |
| Style-aware ParaphraserSample Size (N)=50, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 1 | |
| BaselineSample Size (N)=5, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 0.9998 | |
| Style-aware ParaphraserSample Size (N)=10, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 0.9764 | |
| BaselineSample Size (N)=1, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 0.9074 | |
| Style-aware ParaphraserSample Size (N)=5, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 0.8675 | |
| Style-aware ParaphraserSample Size (N)=1, Target Models=Qwen3-8B, Qwen3-14B, and Mistral-Nemo2025.05 | 0.5904 |