Workflow Execution (Average) on T1–T4 Average
100TSR8 models (Gemma4:e4b/26b/31b, GPT-OSS:20b/120b, MSmall3.2:24b, GPT-5.2)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| 8 models (Gemma4:e4b/26b/31b, GPT-OSS:20b/120b, MSmall3.2:24b, GPT-5.2)2026.05 | 100 | 100 | 100 | |
| Qwen2.5:32b2026.05 | 100 | 100 | 100 | |
| GPT-4.12026.05 | 100 | 100 | 99.99 | |
| Qwen3:32b2026.05 | 99.98 | 99.99 | 99.97 | |
| Qwen3:14b2026.05 | 99.92 | 99.96 | 99.91 | |
| Qwen3:8b2026.05 | 99.9 | 99.95 | 99.89 | |
| Llama3.1:70b2026.05 | 99.72 | 99.69 | 99.7 | |
| Qwen2.5:14b2026.05 | 99.32 | 99.64 | 99.56 | |
| Llama3.1:8b2026.05 | 98.02 | 98.81 | 98.03 | |
| Magistral:24b2026.05 | 95.6 | 97.65 | 95.52 | |
| Qwen2.5:7b2026.05 | 77.54 | 85.12 | 77.09 |