Tactical Deconfliction on BlueSky Simulation Scenario A
1NMACs (All)SFT-LoRA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SFT-LoRAAlignment Strategy=SFT, Base Model=Qwen-Math-7B2026.03 | 1 | 0.7 | 0.3 | 77 | 5.7 | |
| GRPO-LoRAAlignment Strategy=GRPO, Base Model=Qwen-Math-7B2026.03 | 1.7 | 1.1 | 0.6 | 57 | 5.2 | |
| Qwen-Math-7BAlignment Strategy=Base2026.03 | 3.5 | 2.7 | 0.8 | 12 | 3.7 |