Foundation Model Selection on 100 diverse natural language user queries (test)
75.76Average Top-1REMSA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| REMSALLM Backbone=GPT-4.12025.11 | 75.76 | 75.03 | 21.33 | 40 | 0.34 | |
| REMSA-NaiveLLM Backbone=GPT-4.12025.11 | 72.67 | 72 | 20 | 37.33 | 0.29 | |
| UNSTR.-RAGLLM Backbone=GPT-4.12025.11 | 71.23 | 68.39 | 13.33 | 30.67 | 0.24 | |
| DB-RetrievalLLM Backbone=GPT-4.12025.11 | 67.37 | 68.87 | 12 | 17.33 | 0.23 |