Semantic Scoring on Study 4 + Study 5 model outputs from Studies 1, 3, and 5 (pooled)
0.762F semGPT-4o
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4on=1002026.06 | 0.762 | 0.69 | 0.799 | 0.328 | |
| Mistral 7Bn=1002026.06 | 0.754 | 0.679 | 0.828 | 0.304 | |
| Haiku 4.5n=1002026.06 | 0.748 | 0.667 | 0.825 | 0.324 | |
| Sonnet 4.6n=1002026.06 | 0.745 | 0.648 | 0.831 | 0.386 | |
| Opus 4.7n=1002026.06 | 0.71 | 0.629 | 0.841 | 0.396 | |
| Llama 3.2n=1002026.06 | 0.348 | 0.38 | 0.463 | 0.722 |