Grammatical Error Correction on BEA 2019 (test)
75.9F0.5T5-XXL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| T5-XXLModel Size=11B, Training Data=rule-based synthetic (1B word)2024.06 | 75.9 | — | — | |
| BART Baseline + CDA w/ denoisingModel Size=400M, Training Data=model-based synthetic (C4 200M), Contextual Data Augmentation=with denoising2024.06 | 75.4 | 77.7 | 67.5 | |
| MultiTaskBARTModel Size=400M, Training Data=rule-based synthetic (1B word), cleaned Lang82024.06 | 75.3 | 78.2 | 65.5 | |
| EPO (Llama2-7b-chat)Decoding=Proposal (edit-level majority voting), Training=Fine-tuned, Threshold (τ)=52026.05 | 74.6 | 78.8 | 61.6 | |
| TemplateGECModel Size=770M, Training Data=cleaned Lang8, model-based synthetic (300M)2024.06 | 74.1 | 76.8 | 64.8 | |
| BART Baseline + CDA w/o denoisingModel Size=400M, Training Data=model-based synthetic (C4 200M), Contextual Data Augmentation=without denoising2024.06 | 74.1 | 76.1 | 67.3 | |
| T5-XLModel Size=3B, Training Data=rule-based synthetic (1B word)2024.06 | 73.9 | — | — | |
| GECToR (deberta-v3-large)Parameters=0.4B, Training=Fine-tuned2026.05 | 73.9 | 79.3 | 58 | |
| BART BaselineModel Size=400M, Training Data=model-based synthetic (C4 200M)2024.06 | 73.5 | 74.5 | 68.9 | |
| T5 (t5-v1_1-large)Parameters=0.8B, Training=Fine-tuned2026.05 | 73.4 | 76.9 | 62.3 | |
| EPO (Llama2-7b-chat)Decoding=Greedy, Training=Fine-tuned2026.05 | 73.3 | 75.8 | 64.9 | |
| MixEditModel Size=400M, Training Data=rule-based synthetic (1B word)2024.06 | 73.2 | 76.4 | 62.7 | |
| ShallowADModel Size=~240M, Training Data=model-based synthetic (300M)2024.06 | 72.9 | — | — | |
| SynGECModel Size=400M, Training Data=rule-based synthetic (1B word), cleaned Lang82024.06 | 72.9 | 75.1 | 65.5 | |
| GECToRModel Size=350M, Training Data=rule-based synthetic (1B word)2024.06 | 72.4 | 79.2 | 53.9 | |
| T5-largeModel Size=770M, Training Data=rule-based synthetic (1B word)2024.06 | 72.1 | — | — | |
| GECToR (bert-base-cased)Parameters=0.1B, Training=Fine-tuned2026.05 | 70 | 77.3 | 50.9 | |
| EPO (Llama2-7b-chat)Decoding=MBR, Training=Fine-tuned2026.05 | 68.9 | 70.6 | 61.7 | |
| Qwen3-8BDecoding=Proposal (edit-level majority voting), Training=Zero-shot (4-shot), Threshold (τ)=72026.05 | 68.7 | 73.8 | 53.7 | |
| Qwen3-8BDecoding=MBR, Training=Zero-shot (4-shot)2026.05 | 66.2 | 69.3 | 56.3 | |
| gemma-2-9b-itDecoding=Proposal (edit-level majority voting), Training=Zero-shot (4-shot), Threshold (τ)=82026.05 | 64 | 65 | 60.3 | |
| Llama-3.1-8B-InstructDecoding=Proposal (edit-level majority voting), Training=Zero-shot (4-shot), Threshold (τ)=62026.05 | 63.1 | 66.9 | 51.5 | |
| gemma-2-9b-itDecoding=Greedy, Training=Zero-shot (4-shot)2026.05 | 59.5 | 58.4 | 64.4 | |
| gemma-2-9b-itDecoding=MBR, Training=Zero-shot (4-shot)2026.05 | 59.2 | 58.3 | 62.8 | |
| Qwen3-8BDecoding=Greedy, Training=Zero-shot (4-shot)2026.05 | 56.3 | 54.8 | 62.9 | |
| Llama-3.1-8B-InstructDecoding=Greedy, Training=Zero-shot (4-shot)2026.05 | 54 | 52.3 | 61.6 | |
| Llama-3.1-8B-InstructDecoding=MBR, Training=Zero-shot (4-shot)2026.05 | 52.1 | 50.5 | 59.3 | |
| Qwen3-8B + COCOGECBackbone=Qwen3-8B, Data Size=25K2026.06 | 38.22 | 36.63 | 46.12 | |
| Qwen3-235BBackbone=Qwen3-235B2026.06 | 38.2 | 37.01 | 43.82 | |
| GPT-4oBackbone=GPT-4o2026.06 | 36.6 | 34.43 | 48.89 | |
| T5-large + COCOGECBackbone=T5-large, Data Size=25K2026.06 | 32.64 | 32.93 | 31.52 | |
| GECToR-large + COCOGECBackbone=GECToR-large, Data Size=25K2026.06 | 30.07 | 51.55 | 11.27 | |
| T5-large + TypeDABackbone=T5-large, Data Size=30K2026.06 | 29.9 | 27.96 | 41.42 | |
| T5-large + DISCOBackbone=T5-large, Data Size=42K2026.06 | 29.43 | 27.7 | 39.28 | |
| Qwen3-8B + CPR methodBackbone=Qwen3-8B, Data Size=36K2026.06 | 29.38 | 27.48 | 40.64 | |
| T5-large + CPR methodBackbone=T5-large, Data Size=36K2026.06 | 28.99 | 27.29 | 38.7 | |
| T5-largeBackbone=T5-large2026.06 | 28.92 | 27.27 | 38.22 | |
| Qwen3-14BBackbone=Qwen3-14B2026.06 | 28.7 | 26.86 | 39.57 | |
| GECToR-large + DISCOBackbone=GECToR-large, Data Size=42K2026.06 | 28.65 | 31.49 | 21.05 | |
| Qwen3-8B + TypeDABackbone=Qwen3-8B, Data Size=30K2026.06 | 28.59 | 25.94 | 48.4 | |
| Qwen3-8BBackbone=Qwen3-8B2026.06 | 28.29 | 26.68 | 37.34 | |
| GECToR-large + CPR methodBackbone=GECToR-large, Data Size=36K2026.06 | 28.16 | 28.32 | 27.55 | |
| Qwen3-8B + DISCOBackbone=Qwen3-8B, Data Size=42K2026.06 | 27.93 | 26.2 | 38.01 | |
| GECToR-large + TypeDABackbone=GECToR-large, Data Size=30K2026.06 | 26.63 | 26.87 | 25.64 | |
| GECToR-largeBackbone=GECToR-large2026.06 | 26.36 | 26.86 | 24.54 | |
| LLaMA3-8BBackbone=LLaMA3-8B2026.06 | 25.55 | 23.09 | 44.52 | |
| Qwen3-4BBackbone=Qwen3-4B2026.06 | 22.13 | 22.14 | 22.11 |