Attribute Verification on human-annotated attribute verification dataset
74.8AccuracyRoBERTa (Trained)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| RoBERTa (Trained)Training=Supervised training on human annotations2026.06 | 74.8 | 59.1 | 92.6 | 72.6 | |
| Llama-3.3-70BPrompt strategy=optimized prompt2026.06 | 68.1 | 56.4 | 42.5 | 48.4 | |
| GPT-5.4Prompt strategy=zero-shot2026.06 | 67.6 | 54.7 | 47.9 | 51.1 | |
| Claude-Sonnet-4.6Prompt strategy=zero-shot2026.06 | 66.7 | 52.5 | 57.5 | 54.9 | |
| Llama-3.3-70BPrompt strategy=zero-shot2026.06 | 65.5 | 53.1 | 23.3 | 32.4 | |
| Gemma-4-31BPrompt strategy=zero-shot2026.06 | 65.2 | 50.6 | 56.2 | 53.2 | |
| Gemma-4-31BPrompt strategy=optimized prompt2026.06 | 64.3 | 49.6 | 87.7 | 63.4 | |
| Qwen3.5-27BPrompt strategy=zero-shot2026.06 | 64.2 | 47.8 | 47.1 | 47.5 | |
| Qwen3.5-27BPrompt strategy=optimized prompt2026.06 | 62.8 | 47.6 | 75.8 | 58.5 | |
| Claude-Sonnet-4.6Prompt strategy=optimized prompt2026.06 | 61.4 | 47.6 | 93.2 | 63 | |
| GPT-5.4Prompt strategy=optimized prompt2026.06 | 58.9 | 46.1 | 97.3 | 62.6 |