Recommendation on Amazon Fashion (test)
14.09CTRDeepFM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DeepFMEvaluation Framework=A/B Agent, Backbone=Gemini-2.5-flash2026.01 | 14.09 | 3.85 | 4.6 | — | — | |
| AFNEvaluation Framework=A/B Agent, Backbone=Gemini-2.5-flash2026.01 | 13.37 | 3.41 | 4.52 | — | — | |
| FMEvaluation Framework=A/B Agent, Backbone=Gemini-2.5-flash2026.01 | 10.52 | 2.85 | 4.5 | — | — | |
| PopEvaluation Framework=A/B Agent, Backbone=Gemini-2.5-flash2026.01 | 9.37 | 1.58 | 4.44 | — | — | |
| DeepFMEvaluation Framework=A/B Agent, Backbone=GPT-4o2026.01 | 7.72 | 1.65 | 4.53 | — | — | |
| AFNEvaluation Framework=A/B Agent, Backbone=GPT-4o2026.01 | 7.54 | 1.58 | 4.5 | — | — | |
| FMEvaluation Framework=A/B Agent, Backbone=GPT-4o2026.01 | 6.12 | 1.08 | 4.5 | — | — | |
| PopEvaluation Framework=A/B Agent, Backbone=GPT-4o2026.01 | 5.61 | 0.98 | 4.46 | — | — | |
| RandomEvaluation Framework=A/B Agent, Backbone=Gemini-2.5-flash2026.01 | 4.26 | 0.93 | 4.4 | — | — | |
| DeepFMEvaluation Framework=A/B Agent, Backbone=GPT-4o-mini2026.01 | 4.14 | 0.89 | 4.51 | — | — | |
| AFNEvaluation Framework=A/B Agent, Backbone=GPT-4o-mini2026.01 | 4.07 | 0.81 | 4.5 | — | — | |
| FMEvaluation Framework=A/B Agent, Backbone=GPT-4o-mini2026.01 | 3.11 | 0.67 | 4.5 | — | — | |
| PopEvaluation Framework=A/B Agent, Backbone=GPT-4o-mini2026.01 | 2.12 | 0.08 | 4.32 | — | — | |
| RandomEvaluation Framework=A/B Agent, Backbone=GPT-4o2026.01 | 1.58 | 0.73 | 4.42 | — | — | |
| RandomEvaluation Framework=A/B Agent, Backbone=GPT-4o-mini2026.01 | 0.31 | 0.08 | 4.12 | — | — | |
| AFNEvaluation Framework=Real-World2026.01 | — | — | — | 0.0748 | 0.0259 | |
| DeepFMEvaluation Framework=Real-World2026.01 | — | — | — | 0.0787 | 0.0281 | |
| FMEvaluation Framework=Real-World2026.01 | — | — | — | 0.0591 | 0.0212 | |
| PopEvaluation Framework=Real-World2026.01 | — | — | — | 0.0157 | 0.0059 | |
| RandomEvaluation Framework=Real-World2026.01 | — | — | — | 0.0079 | 0.0028 |