Multi-label biomedical classification on Ohsumed (test)
63.75Macro F1EvoPool
Evaluation Results
| Method | Links | |
|---|---|---|
| EvoPoolBackbone=Llama-3.1-8B2026.06 | 63.75 | |
| EvoPoolBackbone=RoBERTa-large2026.06 | 61.31 | |
| EvoPoolBackbone=Qwen2-1.5B2026.06 | 61.11 | |
| LLM-AnnotationBackbone=Llama-3.1-8B2026.06 | 56.36 | |
| EvoPoolDownstream Model=Llama-3.1-8B2026.06 | 55.66 | |
| EvoPoolDownstream Model=RoBERTa-large2026.06 | 55.65 | |
| EvoPoolDownstream Model=Qwen3-1.7B2026.06 | 54.73 | |
| LLM-AnnotationBackbone=RoBERTa-large2026.06 | 54.42 | |
| EvoPoolBackbone=gpt-4o-mini2026.06 | 54.2 | |
| LLM-AnnotationBackbone=Qwen2-1.5B2026.06 | 53.16 | |
| LLM-AnnotationDownstream Model=Llama-3.1-8B2026.06 | 47.26 | |
| LLM-AnnotationDownstream Model=Qwen3-1.7B2026.06 | 46.34 | |
| LLM-AnnotationDownstream Model=RoBERTa-large2026.06 | 45.66 | |
| LLM annotationBackbone=gpt-4o-mini2026.06 | 44.33 | |
| LLM-EvalDownstream Model=RoBERTa-large2026.06 | 44.33 | |
| LLM-EvalDownstream Model=Qwen3-1.7B2026.06 | 44.33 | |
| LLM-EvalDownstream Model=Llama-3.1-8B2026.06 | 44.33 | |
| DataSculptBackbone=Llama-3.1-8B2026.06 | 26.61 | |
| Self-TrainDownstream Model=RoBERTa-large2026.06 | 25.26 | |
| AlchemistBackbone=Llama-3.1-8B2026.06 | 23.35 | |
| AlchemistBackbone=Qwen2-1.5B2026.06 | 20.71 | |
| DataSculptBackbone=Qwen2-1.5B2026.06 | 20.51 | |
| AlchemistBackbone=RoBERTa-large2026.06 | 20.12 | |
| AlchemistDownstream Model=Qwen3-1.7B2026.06 | 20.12 | |
| AlchemistDownstream Model=Llama-3.1-8B2026.06 | 20.06 | |
| DataSculptBackbone=RoBERTa-large2026.06 | 20.02 | |
| AlchemistDownstream Model=RoBERTa-large2026.06 | 19.4 | |
| AlchemistBackbone=gpt-4o-mini2026.06 | 19.01 | |
| Self-TrainDownstream Model=Llama-3.1-8B2026.06 | 18.69 | |
| DataSculptBackbone=gpt-4o-mini2026.06 | 7.38 | |
| DataSculptDownstream Model=RoBERTa-large2026.06 | 7.13 | |
| DataSculptDownstream Model=Llama-3.1-8B2026.06 | 6.92 | |
| DataSculptDownstream Model=Qwen3-1.7B2026.06 | 6.85 | |
| GoldenDownstream Model=RoBERTa-large2026.06 | 6.71 | |
| Self-TrainDownstream Model=Qwen3-1.7B2026.06 | 6.52 | |
| GoldenDownstream Model=Llama-3.1-8B2026.06 | 5.3 | |
| GoldenDownstream Model=Qwen3-1.7B2026.06 | 0.42 |