Scenario-based Filter Generation Benchmark
18.98ROUGE-1llama 3.2 3B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| llama 3.2 3BModel=llama 3.2 3B2025.11 | 18.98 | 7.6 | 13.98 | 88.38 | 61.03 | 3.49 | |
| phi-4-mini 3.8BModel=phi-4-mini 3.8B2025.11 | 18.67 | 7.87 | 13.54 | 88.97 | 66.63 | 4.07 | |
| gpt-4o-miniModel=gpt-4o-mini2025.11 | 17.87 | 7.46 | 12.73 | 89.5 | 73.53 | 3.28 | |
| Gemma3 4BModel=Gemma3 4B2025.11 | 10.19 | 3.67 | 7.15 | 87.63 | 61.53 | 1.33 |