Coreference Resolution on CoNLL 2012
83.1Average F1CorefQA+SpanBERT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CorefQA+SpanBERTBackbone=BERT-large2021.01 | 83.1 | 88 | 82.2 | 79.1 | |
| CorefQA+SpanBERTBackbone=BERT-base2021.01 | 79.9 | 86.3 | 77.6 | 75.8 | |
| Wu et al., 20202022.05 | 79.9 | 86.3 | 77.6 | 75.8 | |
| SpanBERTBackbone=BERT-large2021.01 | 79.6 | — | 85.3 | 78.1 | |
| BERT+c2f-corefBackbone=BERT-large2021.01 | 76.9 | 83.5 | 75.3 | 71.9 | |
| BERT+c2f-corefBackbone=BERT-base2021.01 | 73.9 | 81.4 | 71.7 | 68.8 | |
| DEEPSTRUCTmode=w/ finetune2022.05 | 73.1 | 74.9 | 71.3 | 73.1 | |
| Higher-order c2f-corefBackbone=BERT-base2021.01 | 73 | 80.4 | 70.8 | 67.6 | |
| TANLTraining Setting=standard2021.01 | 72.8 | 81 | 69 | 68.4 | |
| TANL2022.05 | 72.8 | 81 | 69 | 68.4 | |
| Hierarchical Multi-task ModelSetup=A-RS-GM, Training Context=CoNLL-20032018.11 | 70.14 | — | — | — | |
| TANLTraining Setting=multi-task2021.01 | 69.4 | 78.7 | 65.7 | 63.8 | |
| Lee et al. (2017)Variant=ensemble2018.11 | 68.8 | — | — | — | |
| Lee et al. (2017)Variant=single2018.11 | 67.2 | — | — | — | |
| Hierarchical Multi-task ModelSetup=A, Training Context=CoNLL-20122018.11 | 62.48 | — | — | — | |
| Durrett and Klein (2014)2018.11 | 61.71 | — | — | — | |
| DEEPSTRUCTmode=multi-task2022.05 | 60.6 | 63.9 | 57.7 | 60.2 |