Recommendation on MovieLens
97.9AccuracyTALLRec
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TALLRecInference Setting=Direct Full-history Sequence Models w/o Preference Inference2026.01 | 97.9 | — | — | — | |
| Qwen3-8Bnon-thinkingInference Setting=Direct Full-history Sequence Models w/o Preference Inference2026.01 | 88.57 | — | — | — | |
| DeepSeek-R1-671BInference Setting=Streaming Preference Inference2026.01 | 83.63 | — | — | — | |
| DeepSeek-R1-671BInference Setting=Full-history Preference Inference2026.01 | 82.76 | — | — | — | |
| Qwen3-32BthinkingInference Setting=Streaming Preference Inference2026.01 | 77.78 | — | — | — | |
| ALIGNXPLORE+Inference Setting=Streaming Preference Inference2026.01 | 77.23 | — | — | — | |
| Qwen3-8BthinkingInference Setting=Streaming Preference Inference2026.01 | 75.97 | — | — | — | |
| ALIGNXPLORE+Inference Setting=Full-history Preference Inference2026.01 | 75.8 | — | — | — | |
| Qwen3-32BthinkingInference Setting=Full-history Preference Inference2026.01 | 75.43 | — | — | — | |
| Qwen3-8BthinkingInference Setting=Full-history Preference Inference2026.01 | 75.13 | — | — | — | |
| GPT-OSS-20BInference Setting=Full-history Preference Inference2026.01 | 74.46 | — | — | — | |
| GPT-OSS-20BInference Setting=Streaming Preference Inference2026.01 | 73.66 | — | — | — | |
| DS-R1-Distill-Qwen-7BInference Setting=Full-history Preference Inference2026.01 | 70.3 | — | — | — | |
| ALIGNXPLOREInference Setting=Full-history Preference Inference2026.01 | 69.93 | — | — | — | |
| DS-R1-Distill-Qwen-7BInference Setting=Streaming Preference Inference2026.01 | 69.63 | — | — | — | |
| ALIGNXPLOREInference Setting=Streaming Preference Inference2026.01 | 67.96 | — | — | — | |
| S-DPOModel=SmolLM32026.05 | 55.7 | — | — | — | |
| MASS-DPOModel=SmolLM32026.05 | 54.03 | — | — | — | |
| Full contextModel=GPT-4o-mini, Token Count=10000, Evaluation Protocol=Zero-Shot2026.02 | 52.4 | — | — | — | |
| DPO-kModel=SmolLM32026.05 | 51.36 | — | — | — | |
| Attn-GModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 50.6 | — | — | — | |
| MASS-DPOModel=Llama32026.05 | 49.7 | — | — | — | |
| Attn-GModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 49.6 | — | — | — | |
| S-DPOModel=Llama32026.05 | 49.55 | — | — | — | |
| Full contextModel=Llama-3, Token Count=10000, Evaluation Protocol=Zero-Shot2026.02 | 48.7 | — | — | — | |
| S-DPOModel=Qwen32026.05 | 48.19 | — | — | — | |
| Attn-GModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 48 | — | — | — | |
| Attn-GModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 47.7 | — | — | — | |
| MASS-DPOModel=Qwen32026.05 | 47.58 | — | — | — | |
| Attn-GModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 47.1 | — | — | — | |
| Prompt-GModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 46.1 | — | — | — | |
| Prompt-GModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 46 | — | — | — | |
| CoTModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 46 | — | — | — | |
| Attn-GModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 46 | — | — | — | |
| Mark AllModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 45.9 | — | — | — | |
| TruncateModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 45.8 | — | — | — | |
| Mark AllModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 45.8 | — | — | — | |
| CoTModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 45.8 | — | — | — | |
| Self-ReflectionModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 45.8 | — | — | — | |
| Direct SummaryModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 45.7 | — | — | — | |
| Self-ReflectionModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 45.7 | — | — | — | |
| Direct SummaryModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 45.6 | — | — | — | |
| Mark AllModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 45.6 | — | — | — | |
| Prompt-GModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 45.5 | — | — | — | |
| Direct SummaryModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 45.4 | — | — | — | |
| Random MarkModel=GPT-4o-mini, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 45.3 | — | — | — | |
| Self-ReflectionModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 45.3 | — | — | — | |
| Attn-GModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 45.3 | — | — | — | |
| Random MarkModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 45.2 | — | — | — | |
| CoTModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 45.2 | — | — | — | |
| Random MarkModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 44.9 | — | — | — | |
| Attn-GModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 44.7 | — | — | — | |
| DPO-kModel=Qwen32026.05 | 44.56 | — | — | — | |
| DPO-kModel=Llama32026.05 | 44.46 | — | — | — | |
| Prompt-GModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 44.4 | — | — | — | |
| Mark AllModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 44.3 | — | — | — | |
| CoTModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 44.2 | — | — | — | |
| Direct SummaryModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 44.1 | — | — | — | |
| Self-ReflectionModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 44 | — | — | — | |
| Prompt-GModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.8 | — | — | — | |
| Random MarkModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 43.7 | — | — | — | |
| Mark AllModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.7 | — | — | — | |
| CoTModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.6 | — | — | — | |
| Direct SummaryModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.5 | — | — | — | |
| Mark AllModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 43.5 | — | — | — | |
| Prompt-GModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 43.4 | — | — | — | |
| Self-ReflectionModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.4 | — | — | — | |
| Self-ReflectionModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 43.3 | — | — | — | |
| TruncateModel=GPT-4o-mini, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.2 | — | — | — | |
| Direct SummaryModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 43.2 | — | — | — | |
| Mark AllModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 43.2 | — | — | — | |
| Random MarkModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 43.1 | — | — | — | |
| Prompt-GModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 43.1 | — | — | — | |
| CoTModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 43.1 | — | — | — | |
| Direct SummaryModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 43 | — | — | — | |
| Self-ReflectionModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 43 | — | — | — | |
| Random MarkModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 42.8 | — | — | — | |
| CoTModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 42.8 | — | — | — | |
| TruncateModel=GPT-4o-mini, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 42.6 | — | — | — | |
| Random MarkModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 42.6 | — | — | — | |
| TruncateModel=Llama-3, Token Count=200, Evaluation Protocol=Zero-Shot2026.02 | 42.5 | — | — | — | |
| TruncateModel=Llama-3, Token Count=150, Evaluation Protocol=Zero-Shot2026.02 | 42.3 | — | — | — | |
| TruncateModel=Llama-3, Token Count=100, Evaluation Protocol=Zero-Shot2026.02 | 41.9 | — | — | — | |
| Mark AllModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41.8 | — | — | — | |
| Prompt-GModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41.6 | — | — | — | |
| Random MarkModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41.5 | — | — | — | |
| CoTModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41.4 | — | — | — | |
| Self-ReflectionModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41.3 | — | — | — | |
| Direct SummaryModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41.2 | — | — | — | |
| TruncateModel=GPT-4o-mini, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 41 | — | — | — | |
| TruncateModel=Llama-3, Token Count=50, Evaluation Protocol=Zero-Shot2026.02 | 40.9 | — | — | — | |
| DPOModel=SmolLM32026.05 | 37.6 | — | — | — | |
| DPOModel=Llama32026.05 | 33.52 | — | — | — | |
| DPOModel=Qwen32026.05 | 31.96 | — | — | — | |
| DMPOModel=SmolLM32026.05 | 28.68 | — | — | — | |
| DMPOModel=Llama32026.05 | 28.18 | — | — | — | |
| DMPOModel=Qwen32026.05 | 25.66 | — | — | — | |
| No contextModel=GPT-4o-mini, Token Count=0, Evaluation Protocol=Zero-Shot2026.02 | 21.1 | — | — | — | |
| No contextModel=Llama-3, Token Count=0, Evaluation Protocol=Zero-Shot2026.02 | 19.8 | — | — | — | |
| AMOSAUserID=34112026.04 | — | 4 | 60 | 32 |