Patient-level Information Extraction on Clinical NLP Gold Standard Dataset n=1125 (hold-out cohort)
94.1PrecisionHARMON-E (full)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| HARMON-E (full)prompt size=6.1 k tokens, latency=8.4 s (median), collator=enabled2025.12 | 94.1 | 92.4 | 93.2 | |
| HARMON-E (w/o collator)consolidation=disabled, validation=disabled, dependency-resolution=disabled2025.12 | 82.1 | 90.7 | 86.2 | |
| GPT-4o Single-Stepsnapshot=June-2024, prompt size=29.4 k tokens, latency=94 s (median), retrieval=none, self-reflection=none, collator=none2025.12 | 78.2 | 70.7 | 74.3 |