Listwise ranking on Baby_Products (val)
100Parse Rate (N=10)Constrained-decoding Base
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Constrained-decoding BaseTraining=Prompt-engineering / no extra training, Decoding=Constrained2026.06 | 100 | 100 | 100 | 100 | 91 | 85.8 | 78.9 | 75.7 | |
| Constrained-decodingTraining=Trained on teacher data, Decoding=Constrained2026.06 | 100 | 100 | 100 | — | 96.3 | 94.7 | 91.6 | — | |
| PRISMR (β-mode)Synthesis Mode=mean-pool synthesis, Condition=N > 502026.06 | 100 | 100 | 100 | 100 | 95.6 | 92.5 | 90.6 | 88.2 | |
| PRISMR (α-mode)Synthesis Mode=Default, Condition=N ≤ 502026.06 | 100 | 100 | 99.9 | 85.1 | 97.4 | 95.8 | 94.7 | 33.5 | |
| RankGPTTraining=Prompt-engineering / no extra training2026.06 | 90 | 93.8 | 92.6 | 91 | 79.9 | 66.8 | 59.7 | 53.8 | |
| RankGPT-SFTTraining=Trained on teacher data2026.06 | 88.7 | 97.5 | 98.7 | — | 88.6 | 69.6 | 78 | — | |
| Standard SFT (LoRA r=16)Training=Trained on teacher data, LoRA Rank=162026.06 | 67 | 39.3 | 37.9 | — | 84.7 | 65.1 | 58.7 | — | |
| Qwen3-VLTraining=Prompt-engineering / no extra training2026.06 | 11.3 | 8.2 | 2 | 1 | 76.7 | 55.3 | 41.8 | 34.1 | |
| LLMLinguaTraining=Prompt-engineering / no extra training2026.06 | 10 | 5 | 2 | — | 73.4 | 51.3 | 39.9 | — |