Business Rule Modeling on RAIR General subset (test)
93.3Accuracy@2LORE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LOREModel Category=Proposed Method2025.12 | 93.3 | 89.7 | 72.4 | |
| vanilla SFTModel Category=Supervised Fine-Tuning2025.12 | 92.9 | 89.1 | 72.2 | |
| GPT-5Model Category=prompting-based models2025.12 | 84.5 | 71.4 | 43.3 | |
| Qwen3-235B-InstructModel Category=prompting-based models2025.12 | 83 | 67.6 | 41.7 | |
| Qwen3-4B-ThinkingModel Category=prompting-based models2025.12 | 80.5 | 72 | 45.3 | |
| Gemini 2.5 ProModel Category=prompting-based models2025.12 | 79.5 | 70.1 | 48.3 | |
| Llama3.1-8B-InstructModel Category=prompting-based models2025.12 | 78.8 | 41.6 | 22.4 | |
| Qwen3-30B-ThinkingModel Category=prompting-based models2025.12 | 78.4 | 71.8 | 45.7 | |
| Qwen3-235B-ThinkingModel Category=prompting-based models2025.12 | 77.9 | 70.2 | 47 | |
| Qwen2.5-7B(base)Model Category=prompting-based models2025.12 | 77.5 | 68.9 | 39.5 | |
| Llama3.1-70B-InstructModel Category=prompting-based models2025.12 | 77.4 | 66.8 | 36.9 | |
| Qwen3-30B-InstructModel Category=prompting-based models2025.12 | 76.3 | 68.3 | 39.1 |