Instruction following verification on VIFBENCH 1.0 (test)
94.8F1 ScoreNSVIF
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| NSVIFVerifier type=Neuro-Symbolic Verifier, Backbone=GPT-4.12026.01 | 94.8 | 94.2 | 95.4 | 95 | |
| NSVIFVerifier type=Neuro-Symbolic Verifier, Backbone=Qwen3-Max2026.01 | 94.8 | 98.4 | 91.6 | 95.2 | |
| NSVIFVerifier type=Neuro-Symbolic Verifier, Backbone=DeepSeek-V3.12026.01 | 93.2 | 97 | 89.8 | 93.8 | |
| NSVIFVerifier type=Neuro-Symbolic Verifier, Backbone=DeepSeek-R12026.01 | 83.9 | 94.6 | 75.4 | 86 | |
| NSVIFVerifier type=Neuro-Symbolic Verifier, Backbone=GPT-4o2026.01 | 82 | 91.2 | 74.4 | 84.4 | |
| Baseline (LLM-as-a-judge)Verifier type=LLM-as-a-judge, Backbone=DeepSeek-R12026.01 | 76.9 | 84.2 | 70.8 | 79.6 | |
| Baseline (LLM-as-a-judge)Verifier type=LLM-as-a-judge, Backbone=Qwen3-Max2026.01 | 71.6 | 59 | 91 | 65.6 | |
| Baseline (LLM-as-a-judge)Verifier type=LLM-as-a-judge, Backbone=DeepSeek-V3.12026.01 | 71.2 | 70.6 | 71.9 | 72.2 | |
| Baseline (LLM-as-a-judge)Verifier type=LLM-as-a-judge, Backbone=GPT-4.12026.01 | 69.1 | 52.9 | 99.5 | 57.4 | |
| Baseline (LLM-as-a-judge)Verifier type=LLM-as-a-judge, Backbone=GPT-4o-mini2026.01 | 66.6 | 51 | 95.9 | 54.1 | |
| Baseline (LLM-as-a-judge)Verifier type=LLM-as-a-judge, Backbone=GPT-4o2026.01 | 66.2 | 51.3 | 93.3 | 54.6 | |
| NSVIFVerifier type=Neuro-Symbolic Verifier, Backbone=GPT-4o-mini2026.01 | 37.3 | 77.2 | 24.5 | 60.4 |