Free-language reasoning on RoboFAC (Real-world)
33.8ROUGE-L (TI)KITE+Qwen2.5-7B+QLoRA
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| KITE+Qwen2.5-7B+QLoRAEvidence Representation=KITE, Finetuned=true, Adaptation=QLoRA2026.04 | 33.8 | 36.5 | 22.9 | 31.3 | 0.724 | 0.86 | 0.798 | 0.815 | |
| RoboFAC-7BFinetuned=true2026.04 | 33.7 | 36.1 | 22.8 | 30.5 | 0.722 | 0.856 | 0.798 | 0.813 | |
| KITE + Qwen2.5-VL-7BEvidence Representation=KITE2026.04 | 30 | 25.2 | 22.3 | 23.2 | 0.696 | 0.832 | 0.791 | 0.804 | |
| Qwen2.5-VL-7B2026.04 | 26.4 | 23.3 | 21.9 | 19.7 | 0.689 | 0.786 | 0.792 | 0.785 |