Reranking on PD Dataset (test)
87PrecisionFinetuned-qwen3-reranker
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Finetuned-qwen3-rerankerEvaluation Protocol=Fine-tuned2026.01 | 87 | 89.9 | 88.4 | 85.1 | |
| jina-reranker-v2-base-multilingualEvaluation Protocol=Zero-shot2026.01 | 81.1 | 67.4 | 73.6 | 69.5 | |
| Zeroshot Llama 3.1Evaluation Protocol=Zero-shot2026.01 | 80.5 | 78.7 | 79.5 | 74.5 | |
| bge-reranker-largeEvaluation Protocol=Zero-shot2026.01 | 78.1 | 56.2 | 65.4 | 62.4 | |
| bge-reranker-baseEvaluation Protocol=Zero-shot2026.01 | 76.5 | 58.4 | 66.2 | 62.4 | |
| bge-reranker-v2-m3Evaluation Protocol=Zero-shot2026.01 | 76.2 | 71.9 | 74 | 68.1 | |
| Zeroshot Qwen3-Reranker-8BEvaluation Protocol=Zero-shot2026.01 | 71.9 | 97.8 | 82.9 | 74.5 | |
| majority baselineEvaluation Protocol=Baseline2026.01 | 67.1 | 1 | 80.3 | 67.1 |