Question Answering on Medical Question Answering Benchmarks Aggregate (test)
701Prompt TokensRAG (w/ Training Set)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RAG (w/ Training Set)Backbone=Llama 3.12025.11 | 701 | 404 | 4.73 | |
| RAG (w/ Web Search)Backbone=Llama 3.12025.11 | 1,172 | 385 | 36.16 | |
| KPPOBackbone=Llama 3.12025.11 | 2,782 | 377 | 3.88 | |
| VE (w/ Web Search)Backbone=Llama 3.12025.11 | 2,803 | 770 | 37.98 |