Contradiction detection on RGM-Contradictions 2024
90AccuracyDS V3.2
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DS V3.2Evaluation Framework=LLM-as-Judge2025.10 | 90 | 90 | 90 | 90 | |
| GPT-5 (LR)Evaluation Framework=LLM-as-Judge2025.10 | 89.4 | 91.56 | 86.8 | 89.12 | |
| GPT-4oEvaluation Framework=LLM-as-Judge2025.10 | 78.2 | 89.83 | 63.6 | 74.47 | |
| DS V3.2Evaluation Framework=VISTA2025.10 | 78 | 86.84 | 66 | 75 | |
| GPT-4oEvaluation Framework=VISTA2025.10 | 76.6 | 87.15 | 62.4 | 72.73 | |
| DS-V3Evaluation Framework=LLM-as-Judge2025.10 | 72 | 86.67 | 52 | 65 | |
| Qwen3-32BEvaluation Framework=LLM-as-Judge2025.10 | 69.8 | 68 | 74.8 | 71.24 | |
| Qwen3-32BEvaluation Framework=VISTA2025.10 | 65.6 | 70.97 | 52.8 | 60.55 | |
| DS-V3Evaluation Framework=VISTA2025.10 | 60 | 94.64 | 21.2 | 34.64 | |
| GPT-5 (LR)Evaluation Framework=VISTA2025.10 | 54.2 | 69.09 | 15.2 | 24.92 | |
| Llama3.1-8BEvaluation Framework=LLM-as-Judge2025.10 | 53.4 | 51.87 | 94.4 | 66.95 | |
| Llama3.1-8BEvaluation Framework=VISTA2025.10 | 50.2 | 66.67 | 0.8 | 1.58 | |
| Random Baseline2025.10 | 50 | — | — | — |