Free-language reasoning on RoboFAC Simulation
32.6ROUGE-L (TI)KITE+Qwen2.5-7B+QLoRA
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| KITE+Qwen2.5-7B+QLoRAEvidence Representation=KITE, Finetuned=true, Adaptation=QLoRA2026.04 | 32.6 | 31.4 | 30.2 | 29.6 | 69.8 | 84.5 | 80.6 | 80.3 | |
| RoboFAC-7BFinetuned=true2026.04 | 32.3 | 29.9 | 30.1 | 24.5 | 70.1 | 84.2 | 80.8 | 79.4 | |
| KITE + Qwen2.5-VL-7BEvidence Representation=KITE2026.04 | 29.5 | 24.8 | 24.1 | 19 | 68 | 82.9 | 79.8 | 77.9 | |
| Qwen2.5-VL-7B2026.04 | 20.6 | 19.4 | 23 | 15.7 | 54.6 | 44.8 | 68.3 | 65.7 |