Out-of-Distribution Detection on OOD datasets
94.2pAUROC@20Claude Opus 4.6
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude Opus 4.6n_m=6,395, Mean input tokens (I_m)=14,470.3, Mean output tokens (O_m)=897.7, Input $/M=5.00, Output $/M=25.00, Cost per 1k evaluations=94.7942026.05 | 94.2 | 97.9 | |
| Gemini 3.1 Pron_m=6,395, Mean input tokens (I_m)=13,995.1, Mean output tokens (O_m)=3,769.0, Input $/M=2.00, Output $/M=12.00, Cost per 1k evaluations=73.2182026.05 | 94 | 97.3 | |
| Claude Sonnet 4.6n_m=6,395, Mean input tokens (I_m)=14,470.3, Mean output tokens (O_m)=1,029.3, Input $/M=3.00, Output $/M=15.00, Cost per 1k evaluations=58.8502026.05 | 92.9 | 97.6 | |
| GPT-5.4n_m=6,395, Mean input tokens (I_m)=12,525.9, Mean output tokens (O_m)=870.7, Input $/M=2.50, Output $/M=15.00, Cost per 1k evaluations=44.3762026.05 | 89.9 | 97.3 | |
| Kimi-K2.6Training Protocol=SFT, n_m=6,395, Mean input tokens (I_m)=7,422.7, Mean output tokens (O_m)=780.9, Input $/M=0.95, Output $/M=4.00, Cost per 1k evaluations=10.1752026.05 | 84.1 | 94.3 | |
| Qwen3.5-27BTraining Protocol=SFT+RL, n_m=6,395, Mean input tokens (I_m)=8,411.0, Mean output tokens (O_m)=727.5, Input $/M=0.195, Output $/M=1.56, Cost per 1k evaluations=2.7752026.05 | 83.1 | 94.8 | |
| Gemini 3.1 Flash-Liten_m=6,395, Mean input tokens (I_m)=14,103.2, Mean output tokens (O_m)=421.1, Input $/M=0.25, Output $/M=1.50, Cost per 1k evaluations=4.1572026.05 | 81.5 | 90.1 | |
| Gemini 2.5 Pron_m=6,395, Mean input tokens (I_m)=13,955.8, Mean output tokens (O_m)=2,780.9, Input $/M=1.25, Output $/M=10.00, Cost per 1k evaluations=45.2542026.05 | 80.2 | 94.9 | |
| Claude Haiku 4.5n_m=6,395, Mean input tokens (I_m)=14,469.3, Mean output tokens (O_m)=1,055.4, Input $/M=1.00, Output $/M=5.00, Cost per 1k evaluations=19.7462026.05 | 79.4 | 92.7 | |
| Nemotron-120BTraining Protocol=SFT, n_m=6,395, Mean input tokens (I_m)=8,441.2, Mean output tokens (O_m)=814.0, Input $/M=0.10, Output $/M=0.50, Cost per 1k evaluations=1.2512026.05 | 78 | 92.4 | |
| GPT-5.4 nanon_m=6,395, Mean input tokens (I_m)=12,525.9, Mean output tokens (O_m)=705.6, Input $/M=0.20, Output $/M=1.25, Cost per 1k evaluations=3.3872026.05 | 75.2 | 91.1 | |
| GPT-OSS-120BTraining Protocol=SFT, n_m=6,395, Mean input tokens (I_m)=7,495.6, Mean output tokens (O_m)=1,217.3, Input $/M=0.039, Output $/M=0.18, Cost per 1k evaluations=0.5112026.05 | 71.8 | 89.5 | |
| Qwen3-32BTraining Protocol=SFT+RL, n_m=6,395, Mean input tokens (I_m)=8,288.8, Mean output tokens (O_m)=858.9, Input $/M=0.08, Output $/M=0.24, Cost per 1k evaluations=0.8692026.05 | 70.3 | 89.1 | |
| Qwen3.5-4BTraining Protocol=SFT+RL, n_m=6,395, Mean input tokens (I_m)=8,411.0, Mean output tokens (O_m)=705.6, Input $/M=0.03, Output $/M=0.15, Cost per 1k evaluations=0.3582026.05 | 68.4 | 88.4 | |
| GPT-OSS-20BTraining Protocol=SFT, n_m=6,395, Mean input tokens (I_m)=7,495.6, Mean output tokens (O_m)=870.5, Input $/M=0.03, Output $/M=0.14, Cost per 1k evaluations=0.3472026.05 | 65.6 | 86.2 | |
| Qwen3-8BTraining Protocol=SFT+RL, n_m=6,395, Mean input tokens (I_m)=8,288.8, Mean output tokens (O_m)=834.3, Input $/M=0.05, Output $/M=0.40, Cost per 1k evaluations=0.7482026.05 | 62.8 | 83.4 | |
| Nemotron-30BTraining Protocol=SFT, n_m=6,395, Mean input tokens (I_m)=8,441.2, Mean output tokens (O_m)=841.3, Input $/M=0.05, Output $/M=0.20, Cost per 1k evaluations=0.5902026.05 | 57.8 | 82.4 |