Question Answering on CRUD Two-hop (test)
23.82BLEU-1Qwen2.5-72B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-72BChunking Method=Direct LLM Inference, Backbone=Qwen2.5-72B2025.03 | 23.82 | 11.85 | 26.77 | |
| Meta-chunker-1.5BChunking Method=Meta-chunker, Backbone=Qwen2.5-1.5B2025.03 | 23.54 | 11.55 | 26.41 | |
| OriginalChunking Method=Rule-based/Original2025.03 | 23.22 | 11.33 | 26.13 | |
| Llama_indexChunking Method=LlamaIndex default2025.03 | 23.15 | 11.33 | 25.85 | |
| Qwen2.5-14BChunking Method=Direct LLM Inference, Backbone=Qwen2.5-14B2025.03 | 23.04 | 11.29 | 25.87 | |
| Semantic ChunkingChunking Method=Semantic-based2025.03 | 22.23 | 10.75 | 25.07 | |
| LumberChunkerChunking Method=Model-based (Qwen2.5-14B)2025.03 | 22.04 | 10.83 | 25.21 |