High-stakes specialized classification on Claude9 (test)
50.31Macro F1LLM-Annotation
Evaluation Results
| Method | Links | |
|---|---|---|
| LLM-AnnotationBackbone=RoBERTa-large2026.06 | 50.31 | |
| LLM-AnnotationBackbone=Qwen2-1.5B2026.06 | 48.9 | |
| LLM-AnnotationBackbone=Llama-3.1-8B2026.06 | 46.6 | |
| EvoPoolBackbone=Qwen2-1.5B2026.06 | 45 | |
| EvoPoolBackbone=Llama-3.1-8B2026.06 | 42.59 | |
| EvoPoolDownstream Model=Llama-3.1-8B2026.06 | 39.08 | |
| EvoPoolDownstream Model=Qwen3-1.7B2026.06 | 38.27 | |
| EvoPoolBackbone=gpt-4o-mini2026.06 | 36.45 | |
| LLM-AnnotationDownstream Model=Llama-3.1-8B2026.06 | 36.39 | |
| LLM-AnnotationDownstream Model=Qwen3-1.7B2026.06 | 35.79 | |
| EvoPoolBackbone=RoBERTa-large2026.06 | 35.28 | |
| LLM-AnnotationDownstream Model=RoBERTa-large2026.06 | 34.69 | |
| EvoPoolDownstream Model=RoBERTa-large2026.06 | 34.13 | |
| LLM annotationBackbone=gpt-4o-mini2026.06 | 33.2 | |
| LLM-EvalDownstream Model=RoBERTa-large2026.06 | 33.2 | |
| LLM-EvalDownstream Model=Qwen3-1.7B2026.06 | 33.2 | |
| LLM-EvalDownstream Model=Llama-3.1-8B2026.06 | 33.2 | |
| AlchemistBackbone=Qwen2-1.5B2026.06 | 32.4 | |
| AlchemistBackbone=Llama-3.1-8B2026.06 | 25.26 | |
| AlchemistDownstream Model=Qwen3-1.7B2026.06 | 22.07 | |
| AlchemistBackbone=RoBERTa-large2026.06 | 21.6 | |
| GoldenDownstream Model=Llama-3.1-8B2026.06 | 21.11 | |
| AlchemistDownstream Model=Llama-3.1-8B2026.06 | 19.41 | |
| DataSculptDownstream Model=Qwen3-1.7B2026.06 | 19.09 | |
| AlchemistDownstream Model=RoBERTa-large2026.06 | 18.67 | |
| AlchemistBackbone=gpt-4o-mini2026.06 | 16.33 | |
| DataSculptBackbone=Llama-3.1-8B2026.06 | 16.1 | |
| DataSculptDownstream Model=Llama-3.1-8B2026.06 | 15 | |
| DataSculptBackbone=gpt-4o-mini2026.06 | 14.58 | |
| DataSculptBackbone=Qwen2-1.5B2026.06 | 12.03 | |
| Self-TrainDownstream Model=Llama-3.1-8B2026.06 | 11.31 | |
| DataSculptBackbone=RoBERTa-large2026.06 | 10.57 | |
| GoldenDownstream Model=RoBERTa-large2026.06 | 10.57 | |
| DataSculptDownstream Model=RoBERTa-large2026.06 | 10.57 | |
| Self-TrainDownstream Model=RoBERTa-large2026.06 | 10.57 | |
| GoldenDownstream Model=Qwen3-1.7B2026.06 | 10.53 | |
| Self-TrainDownstream Model=Qwen3-1.7B2026.06 | 7.65 |