Long-form Text Generation on FactScore
68.1FactScoreDHI
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DHIStrategy=DHI (ours), Model Used=7B-Chat vs. 7B-Finetuned2026.01 | 68.1 | 41.2 | 49.9 | |
| ICDStrategy=ICD, Model Used=7B-Chat vs. 7B-Finetuned2026.01 | 66.3 | 36.1 | 46.6 | |
| Greedy (Baseline)Strategy=Greedy (Baseline), Model Used=70B-Chat2026.01 | 64.4 | 50.5 | 42.8 | |
| Greedy (Baseline)Strategy=Greedy (Baseline), Model Used=7B-Chat2026.01 | 63.8 | 37.5 | 45.7 | |
| ITIStrategy=ITI, Model Used=7B-Chat2026.01 | 62.4 | 41.9 | 40.8 | |
| DoLaStrategy=DoLa, Model Used=7B-Chat2026.01 | 61.3 | 40.7 | 48.7 | |
| CDStrategy=CD, Model Used=70B-Chat vs. 7B-Chat2026.01 | 60.3 | 62.2 | 48.7 | |
| CDStrategy=CD, Model Used=13B-Chat vs. 7B-Chat2026.01 | 53.5 | 74.2 | 39.8 | |
| CO-LMLM-135MModel Size=135M2026.07 | 35 | — | — | |
| CO-LMLM-360MModel Size=360M2026.07 | 34.2 | — | — | |
| CO-LMLM-360M-FWModel Size=360M, Training Corpus=FW2026.07 | 33.3 | — | — | |
| Greedy (Baseline)Strategy=Greedy (Baseline), Model Used=7B-Base2026.01 | 23.6 | 100 | 28.6 | |
| REL-LMLM-135MModel Size=135M2026.07 | 23.1 | — | — | |
| REL-LMLM-360MModel Size=360M2026.07 | 22.9 | — | — | |
| HF/SMOLLM2-1.7B*Model Size=1.7B, Training Token Count=11T2026.07 | 17.5 | — | — | |
| HF/SMOLLM2-360M*Model Size=360M, Training Token Count=4T2026.07 | 12.5 | — | — | |
| STANDARD-360M-FWModel Size=360M, Training Corpus=FW2026.07 | 11.9 | — | — | |
| STANDARD-135MModel Size=135M2026.07 | 10.4 | — | — | |
| STANDARD-360MModel Size=360M2026.07 | 10 | — | — | |
| HF/SMOLLM2-135M*Model Size=135M, Training Token Count=2T2026.07 | 9 | — | — |