Document Retrieval on Transformed Query Conditions excluding clean prompts (average)
51.1Recall@10SCORINGMODEL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SCORINGMODELTarget Model=Llama-3.1-8B2026.05 | 51.1 | 26.9 | |
| SCORINGMODELTarget Model=Qwen3-8B2026.05 | 50.4 | 20 | |
| SCORINGMODELTarget Model=Llama-3.2-3B2026.05 | 49.4 | 9.5 | |
| SCORINGMODELTarget Model=Llama-3.2-1B2026.05 | 49.2 | 4.8 | |
| SCORINGMODELTarget Model=Qwen2.5-7B2026.05 | 46.6 | 8.8 | |
| Best baselineTarget Model=Llama-3.2-1B2026.05 | 44.4 | — | |
| SCORINGMODELTarget Model=Qwen2-1.5B2026.05 | 43 | 10.9 | |
| SCORINGMODELTarget Model=Llama-2-7B2026.05 | 42 | 19 | |
| SCORINGMODELTarget Model=Mistral-7B2026.05 | 41.5 | 17 | |
| STEERFUSETarget Model=Qwen3-8B2026.05 | 40.4 | — | |
| SCORINGMODELTarget Model=TinyLlama-1.1B2026.05 | 40.3 | 2.4 | |
| STEERFUSETarget Model=Mistral-7B2026.05 | 40.2 | — | |
| STEERFUSETarget Model=Llama-3.2-1B2026.05 | 40 | — | |
| Best baselineTarget Model=Llama-3.2-3B2026.05 | 39.9 | — | |
| STEERFUSETarget Model=TinyLlama-1.1B2026.05 | 38.2 | — | |
| Best baselineTarget Model=Qwen2.5-7B2026.05 | 37.9 | — | |
| Best baselineTarget Model=TinyLlama-1.1B2026.05 | 37.9 | — | |
| STEERFUSETarget Model=Llama-2-7B2026.05 | 37.3 | — | |
| STEERFUSETarget Model=Llama-3.2-3B2026.05 | 34.6 | — | |
| STEERFUSETarget Model=Llama-3.1-8B2026.05 | 32.2 | — | |
| Best baselineTarget Model=Qwen2-1.5B2026.05 | 32.1 | — | |
| Best baselineTarget Model=Qwen3-8B2026.05 | 30.3 | — | |
| STEERFUSETarget Model=Qwen2.5-7B2026.05 | 29.4 | — | |
| STEERFUSETarget Model=Qwen2-1.5B2026.05 | 27.6 | — | |
| Best baselineTarget Model=Mistral-7B2026.05 | 24.6 | — | |
| Best baselineTarget Model=Llama-3.1-8B2026.05 | 24.2 | — | |
| Best baselineTarget Model=Llama-2-7B2026.05 | 23 | — |