High-stakes specialized classification on ChemProt (test)
59.09Macro F1EvoPool
Evaluation Results
| Method | Links | |
|---|---|---|
| EvoPoolDownstream Model=Llama, CFT=false2026.06 | 59.09 | |
| EvoPoolDownstream Model=Llama-3.1-8B2026.06 | 59.09 | |
| EvoPoolBackbone=gpt-4o-mini2026.06 | 58.26 | |
| EvoPoolDownstream Model=RoB, CFT=true2026.06 | 55.57 | |
| EvoPoolBackbone=RoBERTa-large2026.06 | 55.57 | |
| Self-TrainDownstream Model=RoBERTa-large2026.06 | 55.35 | |
| EvoPoolDownstream Model=Llama, CFT=true2026.06 | 54.32 | |
| EvoPoolBackbone=Llama-3.1-8B2026.06 | 54.32 | |
| EvoPoolDownstream Model=RoB, CFT=false2026.06 | 53.96 | |
| EvoPoolDownstream Model=RoBERTa-large2026.06 | 53.96 | |
| EvoPoolDownstream Model=Qwen, CFT=true2026.06 | 53.94 | |
| EvoPoolBackbone=Qwen2-1.5B2026.06 | 53.94 | |
| EvoPoolDownstream Model=Qwen, CFT=false2026.06 | 53.83 | |
| EvoPoolDownstream Model=Qwen3-1.7B2026.06 | 53.83 | |
| GoldenDownstream Model=RoBERTa-large2026.06 | 51.94 | |
| HumanDownstream Model=Qwen, CFT=true2026.06 | 51.92 | |
| HumanDownstream Model=RoB, CFT=true2026.06 | 51.7 | |
| HumanDownstream Model=Llama, CFT=true2026.06 | 51.7 | |
| HumanDownstream Model=Qwen, CFT=false2026.06 | 47.18 | |
| HumanDownstream Model=RoB, CFT=false2026.06 | 46.79 | |
| HumanDownstream Model=Llama, CFT=false2026.06 | 46.79 | |
| LLM-AnnotationBackbone=RoBERTa-large2026.06 | 43.66 | |
| DataSculptBackbone=Llama-3.1-8B2026.06 | 40.82 | |
| LLM-AnnotationBackbone=Llama-3.1-8B2026.06 | 39.93 | |
| DataSculptBackbone=RoBERTa-large2026.06 | 38.77 | |
| AlchemistBackbone=Llama-3.1-8B2026.06 | 38.03 | |
| LLM-AnnotationBackbone=Qwen2-1.5B2026.06 | 37.25 | |
| AlchemistBackbone=Qwen2-1.5B2026.06 | 32.62 | |
| Self-TrainDownstream Model=Llama-3.1-8B2026.06 | 32.53 | |
| GoldenDownstream Model=Llama-3.1-8B2026.06 | 31.78 | |
| DataSculptBackbone=Qwen2-1.5B2026.06 | 31.77 | |
| Self-TrainDownstream Model=Qwen3-1.7B2026.06 | 30.49 | |
| LLM-AnnotationDownstream Model=Qwen3-1.7B2026.06 | 29.45 | |
| LLM-AnnotationDownstream Model=RoBERTa-large2026.06 | 28.4 | |
| LLM annotationBackbone=gpt-4o-mini2026.06 | 28.17 | |
| LLM-EvalDownstream Model=RoBERTa-large2026.06 | 28.17 | |
| LLM-EvalDownstream Model=Qwen3-1.7B2026.06 | 28.17 | |
| LLM-EvalDownstream Model=Llama-3.1-8B2026.06 | 28.17 | |
| LLM-AnnotationDownstream Model=Llama-3.1-8B2026.06 | 28.09 | |
| GoldenDownstream Model=Qwen3-1.7B2026.06 | 27.75 | |
| AlchemistBackbone=RoBERTa-large2026.06 | 25.76 | |
| DataSculptDownstream Model=RoBERTa-large2026.06 | 22.67 | |
| AlchemistBackbone=gpt-4o-mini2026.06 | 22.04 | |
| AlchemistDownstream Model=Qwen3-1.7B2026.06 | 21.94 | |
| AlchemistDownstream Model=RoBERTa-large2026.06 | 21.93 | |
| AlchemistDownstream Model=Llama-3.1-8B2026.06 | 21.29 | |
| DataSculptDownstream Model=Qwen3-1.7B2026.06 | 20.84 | |
| DataSculptDownstream Model=Llama-3.1-8B2026.06 | 19.94 | |
| DataSculptBackbone=gpt-4o-mini2026.06 | 19.65 |