Medical Dialogue on Chinese-medical-dialogue
89.37Win RateLLM-AutoDP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLM-AutoDPBackbone=Qwen2.5-7B, Baseline Comparison=No-Process, Judge=GPT-42026.01 | 89.37 | 0.57 | 10.05 | |
| LLM-AutoDPBackbone=Gemma-2-9B, Baseline Comparison=No-Process, Judge=GPT-42026.01 | 87.18 | 2.47 | 10.35 | |
| LLM-AutoDPBackbone=Llama3.1-8B, Baseline Comparison=No-Process, Judge=GPT-42026.01 | 85.49 | 0 | 14.51 | |
| LLM-AutoDPBackbone=Gemma-2-9B, Baseline Comparison=RS, Judge=GPT-42026.01 | 72.28 | 2.88 | 24.84 | |
| LLM-AutoDPBackbone=Gemma-2-9B, Baseline Comparison=SELA, Judge=GPT-42026.01 | 71.25 | 4.04 | 24.71 | |
| LLM-AutoDPBackbone=Qwen2.5-7B, Baseline Comparison=RS, Judge=GPT-42026.01 | 70.89 | 4.61 | 24.5 | |
| LLM-AutoDPBackbone=Qwen2.5-7B, Baseline Comparison=SELA, Judge=GPT-42026.01 | 69.45 | 4.04 | 26.51 | |
| LLM-AutoDPBackbone=Llama3.1-8B, Baseline Comparison=RS, Judge=GPT-42026.01 | 69.31 | 3.95 | 26.74 | |
| LLM-AutoDPBackbone=Llama3.1-8B, Baseline Comparison=SELA, Judge=GPT-42026.01 | 65.87 | 6.06 | 28.07 | |
| LLM-AutoDPBackbone=Gemma-2-9B, Baseline Comparison=All-Process, Judge=GPT-42026.01 | 55.43 | 12.17 | 32.4 | |
| LLM-AutoDPBackbone=Llama3.1-8B, Baseline Comparison=All-Process, Judge=GPT-42026.01 | 50.62 | 9.17 | 40.21 | |
| LLM-AutoDPBackbone=Qwen2.5-7B, Baseline Comparison=All-Process, Judge=GPT-42026.01 | 50.15 | 9.22 | 40.63 |