Long-form QA
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Long-form QA benchmark factuality target
17.3PR-AUC
48
Long-form QA 3K generations corpus
100Detection Accuracy (1% FPR)
42
Long-form QA 46K ShareGPT-augmented corpus
100Detection Accuracy (1% FPR)
18
Long-form QA 9K pooled generations corpus
100Detection Accuracy (at 1% FPR)
18
Long-form QA Short Q, Long A (test)
6.182GPT4 Score
15
Long-form QA (test)
61.7Win Rate vs. Holistic Reward
13
Long-form QA events
82.62Coverage
2
Long-form QA landmarks
80.39Coverage
2
Long-form QA movies
87.71Coverage
2
Long-form QA cities
86.35Coverage
2
Long-form QA books
85.73Coverage
2
Long-form QA artworks
76.9Coverage
2
Long-form QA persons
79.82Coverage
2
Long-form QA inventions
85.12Coverage
2
Long-Form QA
0.795Correlation (Human Judgment)
2
Long-form QA 46K ShareGPT-augmented corpus 1.0 (test)
—Detection Accuracy (1% FPR)
0
Long-form QA 9K pooled generations corpus 1.0 (test)
—Accuracy (1% FPR)
0
Long-form QA 3K generations corpus 1.0 (test)
—Detection Acc (1% FPR)
0