Multi-Armed Bandit on Text-based Game
0.531Average RewardUCB
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| UCBStrategy Category=Classic Strategies, Model=Meta Llama 3.1 8B2026.04 | 0.531 | 2 | 66 | 13.68 | 0 | |
| DORA (λ-sched)Strategy Category=Learned Policies, Mode=λ-sched, Model=Meta Llama 3.1 8B2026.04 | 0.514 | 0 | 58.5 | 16.61 | 0 | |
| TSStrategy Category=Classic Strategies, Model=Meta Llama 3.1 8B2026.04 | 0.512 | 0 | 57 | 17.16 | 0 | |
| GreedyStrategy Category=Classic Strategies, Model=Meta Llama 3.1 8B2026.04 | 0.506 | 42 | 53 | 18.9 | 0 | |
| ε-GreedyStrategy Category=Classic Strategies, Model=Meta Llama 3.1 8B2026.04 | 0.49 | 30 | 45.5 | 21.8 | 0 | |
| DORA (auto)Strategy Category=Learned Policies, Mode=auto, Model=Meta Llama 3.1 8B2026.04 | 0.462 | 60 | 35.6 | 25.77 | 0 | |
| Temperature SamplingStrategy Category=Temperature (τ), τ=1.5, Model=Meta Llama 3.1 8B2026.04 | 0.44 | 25 | 30.1 | 28.45 | 6.15 | |
| τ PolicyStrategy Category=Temperature (τ), Model=Meta Llama 3.1 8B2026.04 | 0.433 | 10 | 43.4 | 24.41 | 21.2 | |
| Temperature SamplingStrategy Category=Temperature (τ), τ=0, Model=Meta Llama 3.1 8B2026.04 | 0.41 | 90 | 10 | 36 | 0 | |
| Temperature SamplingStrategy Category=Temperature (τ), τ=0.3, Model=Meta Llama 3.1 8B2026.04 | 0.41 | 90 | 10 | 36 | 0 | |
| Temperature SamplingStrategy Category=Temperature (τ), τ=0.7, Model=Meta Llama 3.1 8B2026.04 | 0.41 | 90 | 10 | 36 | 0 | |
| Temperature SamplingStrategy Category=Temperature (τ), τ=1, Model=Meta Llama 3.1 8B2026.04 | 0.401 | 95 | 4 | 38.39 | 0 | |
| Temperature SamplingStrategy Category=Temperature (τ), τ=2, Model=Meta Llama 3.1 8B2026.04 | 0.393 | 0 | 44.2 | 25.7 | 38.35 |