Proactive Agent Task on Function-Gym
50Pass@U-1GPT-5-0807
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-5-0807Model Source=Commercial2026.02 | 50 | 69.23 | 74.36 | 13.65 | |
| Gemini-3-flashModel Source=Commercial2026.02 | 41.03 | 42.31 | 42.31 | 4.4 | |
| BAO w/o BR-4BModel Source=Fine-tuned, Scale=4B, Behavior Enhancement=true, Reward Regularization=false2026.02 | 33.33 | 46.15 | 71.79 | 37.55 | |
| Gemini-2.5-ProModel Source=Commercial2026.02 | 32.05 | 43.59 | 43.59 | 10.03 | |
| BAO-4BModel Source=Fine-tuned, Scale=4B, Behavior Enhancement=true, Reward Regularization=true2026.02 | 26.92 | 53.54 | 69.23 | 21.48 | |
| UserRL-4BModel Source=Fine-tuned, Scale=4B2026.02 | 24.36 | 41.03 | 52.56 | 37.58 | |
| BAO w/o BE-4BModel Source=Fine-tuned, Scale=4B, Behavior Enhancement=false, Reward Regularization=true2026.02 | 24.36 | 37.18 | 47.44 | 24.83 | |
| Gemini-2.5-FlashModel Source=Commercial2026.02 | 23.08 | 33.33 | 37.18 | 12.9 | |
| BAO w/o BR-1.7BModel Source=Fine-tuned, Scale=1.7B, Behavior Enhancement=true, Reward Regularization=false2026.02 | 23.08 | 29.49 | 39.74 | 42.84 | |
| BAO-1.7BModel Source=Fine-tuned, Scale=1.7B, Behavior Enhancement=true, Reward Regularization=true2026.02 | 19.23 | 32.05 | 35.9 | 21.33 | |
| Qwen3-32BModel Source=Raw, Scale=32B2026.02 | 16.67 | 17.95 | 17.95 | 3.79 | |
| UserRL-1.7BModel Source=Fine-tuned, Scale=1.7B2026.02 | 15.38 | 26.92 | 29.49 | 31.93 | |
| BAO w/o BE-1.7BModel Source=Fine-tuned, Scale=1.7B, Behavior Enhancement=false, Reward Regularization=true2026.02 | 14.1 | 21.79 | 24.36 | 24.04 | |
| GPT-4oModel Source=Commercial2026.02 | 12.82 | 12.82 | 14.1 | 22.48 | |
| Qwen3-14BModel Source=Raw, Scale=14B2026.02 | 11.54 | 11.54 | 12.82 | 3.89 | |
| Qwen3-8BModel Source=Raw, Scale=8B2026.02 | 5.13 | 5.13 | 5.13 | 5.59 | |
| GPT-4o-miniModel Source=Commercial2026.02 | 2.56 | 2.56 | 3.85 | 17.67 |