Recommendation on Netflix w/o history
2.13Performance MetricLLAMA 3.1-8B-INSTRUCT
Evaluation Results
| Method | Links | |
|---|---|---|
| LLAMA 3.1-8B-INSTRUCTBackbone=LLAMA 3.1-8B-INSTRUCT, Training Algorithm=Pretrained2026.03 | 2.13 | |
| WTAbackbone=QWEN3-8B2026.03 | 2.497 | |
| QWEN3-8Bstatus=pretrained2026.03 | 3.395 | |
| GRPObackbone=QWEN3-8B2026.03 | 3.627 | |
| GRPOBackbone=LLAMA 3.1-8B-INSTRUCT, Training Algorithm=GRPO2026.03 | 3.783 | |
| ShapE-GRPObackbone=QWEN3-8B2026.03 | 3.821 | |
| ShapE-GRPOBackbone=LLAMA 3.1-8B-INSTRUCT, Training Algorithm=ShapE-GRPO2026.03 | 4.071 |