API Question Answering on APIBench Torch Hub (test)
93.55AccuracyAccurateRAG
Evaluation Results
| Method | Links | |
|---|---|---|
| AccurateRAGLLM Backbone=CodeGemma1.1-7b-it, Fine-tuning=true2025.10 | 93.55 | |
| AccurateRAGLLM Backbone=Llama-2-7B, Fine-tuning=true2025.10 | 88.71 | |
| RAFTLLM Backbone=Llama-2-7B, Fine-tuning=true, Chain-of-Thought (CoT)=false2025.10 | 86.56 | |
| RAFTLLM Backbone=Llama-2-7B, Fine-tuning=true, Chain-of-Thought (CoT)=GPT-4 CoT2025.10 | 84.95 |