Evidence Ranking (test)
0.92NDCGIncremental LLM (Qwen3-235B-A22B-Instruct)
Evaluation Results
| Method | Links | |
|---|---|---|
| Incremental LLM (Qwen3-235B-A22B-Instruct)Strategy=Incremental, Model=Qwen3-235B-A22B-Instruct2026.01 | 0.92 | |
| One-Shot LLM (GPT-4o)Strategy=One-Shot, Model=GPT-4o2026.01 | 0.91 | |
| One-Shot LLM (Qwen3-235B-A22B-Instruct)Strategy=One-Shot, Model=Qwen3-235B-A22B-Instruct2026.01 | 0.91 | |
| Incremental LLM (GPT-4o)Strategy=Incremental, Model=GPT-4o2026.01 | 0.9 | |
| One-Shot Fine-tuned RerankerStrategy=One-Shot, Backbone=NLI-DeBERTa-v3-large, Algorithm=Retrieve-and-Rerank2026.01 | 0.89 | |
| Incremental SimilarityStrategy=Incremental, Backbone=BAAI/bge-large-en-v12026.01 | 0.79 | |
| One-Shot SimilarityStrategy=One-Shot, Backbone=BAAI/bge-large-en-v12026.01 | 0.77 | |
| One-Shot Fine-tuned NLIStrategy=One-Shot, Backbone=NLI-DeBERTa-v3-large2026.01 | 0.57 |