Competitive Pokémon Play on Pokémon OU against GPT-4o Gen 1 (test)
0.7Win RateGRPO (ISO)
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO (ISO)Model Variant=GRPO (ISO), Backbone=Qwen3-1.7B, Strategy=Implicit Strategic Optimization2026.02 | 0.7 | |
| SFTModel Variant=SFT, Backbone=Qwen3-1.7B, Fine-tuning=Supervised2026.02 | 0.61 | |
| OriginModel Variant=Origin (No FT), Backbone=Qwen3-1.7B, Fine-tuning=None2026.02 | 0.4 |