Question Answering on Biomedical Benchmarks Scaled 10,183-example set
60.79AccuracyQwen2.5-7B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-7BPrompting=Chain-of-Thought (CoT), Configuration=Baseline2026.05 | 60.79 | — | — | — | — | |
| Qwen2.5-7BPipeline=Proposed Fusion Pipeline2026.05 | 59.53 | -0.0126 | 100 | 100 | 11.46 | |
| Phi-4-miniPipeline=Proposed Fusion Pipeline2026.05 | 51.92 | 0.0896 | 99.28 | 99.05 | 32.71 | |
| Phi-4-miniPrompting=Chain-of-Thought (CoT), Configuration=Baseline2026.05 | 42.96 | — | — | — | — |