Open-domain question answering on RJUA (test)
33Rouge-LEAPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| EAPOBackbone=Qwen3-8B, Evaluator=DeepSeek-V3.2, Evaluation Protocol=LLM-as-a-Judge2026.05 | 33 | 97.3 | 36 | 99.5 | 66.4 | |
| NSRBackbone=Qwen3-8B, Evaluator=DeepSeek-V3.2, Evaluation Protocol=LLM-as-a-Judge2026.05 | 32.7 | 97.1 | 36.1 | 99 | 66.2 | |
| W-REINFORCEBackbone=Qwen3-8B, Evaluator=DeepSeek-V3.2, Evaluation Protocol=LLM-as-a-Judge2026.05 | 32.2 | 95.8 | 36.6 | 99.8 | 66.1 | |
| GRPOBackbone=Qwen3-8B, Evaluator=DeepSeek-V3.2, Evaluation Protocol=LLM-as-a-Judge2026.05 | 31.2 | 97.6 | 34.4 | 98.7 | 65.5 | |
| PSRBackbone=Qwen3-8B, Evaluator=DeepSeek-V3.2, Evaluation Protocol=LLM-as-a-Judge2026.05 | 29.3 | 94 | 32.7 | 97.9 | 63.5 |