Legal issue relevance classification on LIC L (test)
63.7Macro F1 ScoreGen_qwen
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Gen_qwenFramework=Generative verifier, Backbone=Qwen3-14B2026.04 | 63.7 | 68.59 | 63.84 | 63.92 | |
| GPT4oModel=GPT-4o, Protocol=LLM-as-judge2026.04 | 57.8 | 70.91 | 64.46 | 58.07 | |
| Qwen3Model=Qwen3-14B, Protocol=LLM-as-judge2026.04 | 55.33 | 71.63 | 68.73 | 56.91 | |
| ClaudeModel=Claude 3.5, Protocol=LLM-as-judge2026.04 | 54.55 | 70.91 | 66 | 56.19 | |
| Phi-4Model=Microsoft Phi-4, Protocol=LLM-as-judge2026.04 | 54.03 | 58.59 | 54.12 | 54.5 | |
| Gen_phiFramework=Generative verifier, Backbone=Microsoft Phi-42026.04 | 54.03 | 58.59 | 54.12 | 54.5 | |
| LBERTType=Legal-specialized pre-trained LM, Architecture=BERT with binary classifier head2026.04 | 52.31 | 41.28 | 52.1 | 50.79 | |
| PromModel=Prometheus, Mode=Absolute rewarding mode2026.04 | 48.63 | 62.76 | 50.05 | 44.96 | |
| Gen_ossFramework=Generative verifier, Backbone=GPT-oss-20B2026.04 | 45.15 | 51.96 | 44.73 | 50.03 | |
| GPT-OSSModel=GPT-oss-20B, Protocol=LLM-as-judge2026.04 | 40.51 | 68.1 | 34.37 | 49.33 |