Relation Extraction on CoNLL04 (test)
75.8F1 ScoreTable-Sequence Encoders
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Table-Sequence EncodersAveraging=macro-averaged2020.10 | 75.8 | — | — | 75.4 | — | |
| E2H-largeModel Category=Unified Models, Model Scale=large, Large-scale continued pre-training=false2023.05 | 75.31 | — | — | — | — | |
| LasUIE*Model Category=Unified Models, Large-scale continued pre-training=true2023.05 | 75.3 | — | — | — | — | |
| UIE*Model Category=Unified Models, Large-scale continued pre-training=true2023.05 | 75 | — | — | — | — | |
| Table-Sequence EncodersAveraging=micro-averaged2020.10 | 73.8 | — | — | 73.6 | — | |
| TablERT2020.10 | 72.6 | 75 | 70.3 | — | — | |
| TriMFEvaluation protocol=strict2021.01 | 72.35 | 73.01 | 71.63 | — | — | |
| E2H-baseModel Category=Unified Models, Model Scale=base, Large-scale continued pre-training=false2023.05 | 72.23 | — | — | — | — | |
| MRC4ERE++Evaluation protocol=strict2021.01 | 71.9 | 72.2 | 71.5 | — | — | |
| T5-largeModel Category=Unified Models, Model Scale=large, Large-scale continued pre-training=false2023.05 | 71.72 | — | — | — | — | |
| SpERT (Eberts and Ulges, 2020)2020.10 | 71.5 | 73 | 70 | — | — | |
| SpERTEvaluation protocol=strict2021.01 | 71.47 | 73.04 | 70 | — | — | |
| TANLModel Category=Unified Models, Large-scale continued pre-training=false2023.05 | 71.4 | — | — | — | — | |
| T5-baseModel Category=Unified Models, Model Scale=base, Large-scale continued pre-training=false2023.05 | 69.58 | — | — | — | — | |
| Multi-turn QAquestion type=Natural2019.05 | 68.9 | 69.2 | 68.2 | — | — | |
| Multi-turn QAEvaluation protocol=strict2021.01 | 68.9 | 69.2 | 68.2 | — | — | |
| Multi-turn QA (Li et al., 2019)2020.10 | 68.9 | 69.2 | 68.2 | — | — | |
| Zhang et al. (2017)2019.05 | 67.8 | — | — | — | — | |
| Zhang et al. (2017)2020.10 | 67.8 | — | — | — | — | |
| Relation-MetricAvg. Epoch Train Time=101 sec, Avg. Test Time=4.5 sec2019.05 | 62.68 | 67.97 | 58.18 | — | — | |
| Multihead2019.05 | 62.04 | 63.75 | 60.43 | — | — | |
| Multi-head + ATEvaluation protocol=strict2021.01 | 62.04 | — | — | — | — | |
| Bekoulis et al. (2018)2019.05 | 62 | — | — | — | — | |
| Multihead with AT2019.05 | 61.95 | — | — | — | — | |
| Replicating Multihead with ATAvg. Epoch Train Time=614 sec, Avg. Test Time=34 sec2019.05 | 61.38 | 65.81 | 57.59 | — | — | |
| Table Representation2019.05 | 61 | 76 | 50.9 | — | — | |
| Miwa and Sasaki (2014)2019.05 | 61 | — | — | — | — | |
| Miwa and Sasaki (2014)2020.10 | 61 | 76 | 50.9 | — | — | |
| Bekoulis et al.Averaging=macro-averaged2020.10 | — | — | — | 62 | — | |
| Bekoulis et al.Averaging=macro-averaged2020.10 | — | — | — | 62 | — | |
| Best SLMPrompting=schema-enumerated, Selection=strongest tuned SLM per benchmark2026.06 | — | — | — | — | 99.5 | |
| ClaudeInference mode=zero-shot2026.06 | — | — | — | — | 91.9 | |
| Claude Sonnet 4.6Shots=0-shot2026.06 | — | — | — | — | 91.9 | |
| Eberts and UlgesAveraging=micro-averaged2020.10 | — | — | — | 71.5 | — | |
| Eberts and UlgesAveraging=macro-averaged2020.10 | — | — | — | 72.9 | — | |
| GPT-5.4Shots=0-shot2026.06 | — | — | — | — | 92.6 | |
| GPT-5.4Inference mode=zero-shot2026.06 | — | — | — | — | 92.6 | |
| Li et al.2020.10 | — | — | — | 68.9 | — | |
| Llama-3.2-3B GenTuneModel=Llama-3.2-3B, Shots=2s2026.06 | — | — | — | — | 99.5 | |
| Llama-3.2-3B GenTuneModel=Llama-3.2-3B, Shots=0s2026.06 | — | — | — | — | 98.8 | |
| Miwa and SasakiAveraging=micro-averaged2020.10 | — | — | — | 61 | — | |
| Nguyen and VerspoorAveraging=macro-averaged2020.10 | — | — | — | 64.4 | — | |
| Qwen2.5-0.5B GenTuneModel=Qwen2.5-0.5B, Shots=2s2026.06 | — | — | — | — | 99.3 | |
| RoB-baseBackbone=RoBERTa, Parameters=125M, Inference mode=fine-tuned per benchmark2026.06 | — | — | — | — | 100 | |
| RoB-largeBackbone=RoBERTa, Parameters=355M, Inference mode=fine-tuned per benchmark2026.06 | — | — | — | — | 100 | |
| Tran and KavuluruAveraging=macro-averaged2020.10 | — | — | — | 62.3 | — | |
| Zhang et al.Averaging=micro-averaged2020.10 | — | — | — | 67.8 | — |