Tactical Deconfliction on BlueSky Simulation Scenario B
1.9NMACs (All)SFT-LoRA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SFT-LoRAAlignment Strategy=SFT, Base Model=Qwen-Math-7B2026.03 | 1.9 | 0.9 | 1 | 62 | 8.1 | |
| GRPO-LoRAAlignment Strategy=GRPO, Base Model=Qwen-Math-7B2026.03 | 3 | 1.3 | 1.7 | 27 | 6.9 | |
| Qwen-Math-7BAlignment Strategy=Base2026.03 | 3.4 | 1.8 | 1.6 | 20 | 3.3 |