General Classification on Banking77 (test)
79.62Macro F1EvoPool
Evaluation Results
| Method | Links | |
|---|---|---|
| EvoPoolDownstream Model=Llama, CFT=true2026.06 | 79.62 | |
| EvoPoolBackbone=Llama-3.1-8B2026.06 | 79.62 | |
| LLM-AnnotationBackbone=Llama-3.1-8B2026.06 | 79.15 | |
| EvoPoolDownstream Model=Qwen, CFT=true2026.06 | 76.61 | |
| EvoPoolBackbone=Qwen2-1.5B2026.06 | 76.61 | |
| Self-TrainDownstream Model=RoBERTa-large2026.06 | 76.07 | |
| EvoPoolDownstream Model=RoB, CFT=true2026.06 | 75.2 | |
| EvoPoolBackbone=RoBERTa-large2026.06 | 75.2 | |
| LLM-AnnotationBackbone=Qwen2-1.5B2026.06 | 73.98 | |
| LLM-AnnotationBackbone=RoBERTa-large2026.06 | 73.76 | |
| EvoPoolDownstream Model=RoB, CFT=false2026.06 | 73.32 | |
| EvoPoolDownstream Model=RoBERTa-large2026.06 | 73.32 | |
| EvoPoolDownstream Model=Llama, CFT=false2026.06 | 72.41 | |
| EvoPoolDownstream Model=Llama-3.1-8B2026.06 | 72.41 | |
| EvoPoolDownstream Model=Qwen, CFT=false2026.06 | 71.5 | |
| EvoPoolDownstream Model=Qwen3-1.7B2026.06 | 71.5 | |
| EvoPoolBackbone=gpt-4o-mini2026.06 | 70.23 | |
| LLM-AnnotationDownstream Model=RoBERTa-large2026.06 | 65.5 | |
| HumanDownstream Model=Llama, CFT=true2026.06 | 64.71 | |
| LLM-AnnotationDownstream Model=Llama-3.1-8B2026.06 | 64.1 | |
| Self-TrainDownstream Model=Llama-3.1-8B2026.06 | 63.71 | |
| LLM-AnnotationDownstream Model=Qwen3-1.7B2026.06 | 63.61 | |
| LLM annotationBackbone=gpt-4o-mini2026.06 | 62.61 | |
| LLM-EvalDownstream Model=RoBERTa-large2026.06 | 62.61 | |
| LLM-EvalDownstream Model=Qwen3-1.7B2026.06 | 62.61 | |
| LLM-EvalDownstream Model=Llama-3.1-8B2026.06 | 62.61 | |
| HumanDownstream Model=RoB, CFT=true2026.06 | 56.96 | |
| GoldenDownstream Model=Llama-3.1-8B2026.06 | 51.17 | |
| HumanDownstream Model=Qwen, CFT=true2026.06 | 48.31 | |
| GoldenDownstream Model=RoBERTa-large2026.06 | 43.3 | |
| HumanDownstream Model=RoB, CFT=false2026.06 | 39.86 | |
| HumanDownstream Model=Llama, CFT=false2026.06 | 39.41 | |
| DataSculptBackbone=Llama-3.1-8B2026.06 | 37.15 | |
| HumanDownstream Model=Qwen, CFT=false2026.06 | 35.2 | |
| DataSculptBackbone=RoBERTa-large2026.06 | 35.15 | |
| AlchemistBackbone=RoBERTa-large2026.06 | 27.59 | |
| AlchemistBackbone=Llama-3.1-8B2026.06 | 26.78 | |
| Self-TrainDownstream Model=Qwen3-1.7B2026.06 | 12.2 | |
| DataSculptDownstream Model=RoBERTa-large2026.06 | 9.29 | |
| DataSculptBackbone=gpt-4o-mini2026.06 | 8.24 | |
| DataSculptBackbone=Qwen2-1.5B2026.06 | 7.87 | |
| DataSculptDownstream Model=Llama-3.1-8B2026.06 | 7.13 | |
| AlchemistBackbone=Qwen2-1.5B2026.06 | 6.82 | |
| GoldenDownstream Model=Qwen3-1.7B2026.06 | 6.79 | |
| DataSculptDownstream Model=Qwen3-1.7B2026.06 | 5.4 | |
| AlchemistDownstream Model=RoBERTa-large2026.06 | 4.91 | |
| AlchemistDownstream Model=Llama-3.1-8B2026.06 | 4.76 | |
| AlchemistDownstream Model=Qwen3-1.7B2026.06 | 4.43 | |
| AlchemistBackbone=gpt-4o-mini2026.06 | 3.82 |