Knowledge-intensive Question Answering on OpenScience
53.8Pass@1P-POTS+Mirror
Evaluation Results
| Method | Links | |
|---|---|---|
| P-POTS+MirrorBackbone=LLaDA-8B-Instruct, Seed=731, Decoding=Greedy, Mode=Supervised fine-tuning2025.11 | 53.8 | |
| P-POTS+MirrorBackbone=LLaDA-8B-Instruct, Seed=20231, Decoding=Greedy, Mode=Supervised fine-tuning2025.11 | 53 | |
| P-POTS+MirrorBackbone=LLaDA-8B-Instruct, Seed=Avg, Decoding=Greedy, Mode=Supervised fine-tuning2025.11 | 52.53 | |
| Qwen3-8B-BaseSeed=Avg2025.11 | 51.62 | |
| P-POTS+MirrorBackbone=LLaDA-8B-Instruct, Seed=42, Decoding=Greedy, Mode=Supervised fine-tuning2025.11 | 50.8 | |
| ClippedBackbone=LLaDA-8B-Instruct, Seed=Avg2025.11 | 49.33 | |
| P-POTSBackbone=LLaDA-8B-Instruct, Seed=731, Decoding=Greedy2025.11 | 47.6 | |
| P-POTSBackbone=LLaDA-8B-Instruct, Seed=20231, Decoding=Greedy2025.11 | 47.47 | |
| EMABackbone=LLaDA-8B-Instruct, Seed=422025.11 | 47.08 | |
| P-POTSBackbone=LLaDA-8B-Instruct, Seed=Avg, Decoding=Greedy2025.11 | 46.8 | |
| Llama3.1-8B-InstructSeed=Avg2025.11 | 46.59 | |
| Qwen2.5-7B-InstructSeed=Avg, Type=Auto-Regressive LLM2025.11 | 46.42 | |
| MIRRORBackbone=LLaDA-8B-Instruct, Seed=Avg2025.11 | 46.38 | |
| StandardBackbone=LLaDA-8B-Instruct, Seed=Avg2025.11 | 45.52 | |
| ISADBackbone=LLaDA-8B-Instruct, Seed=Avg2025.11 | 45.4 | |
| P-POTSBackbone=LLaDA-8B-Instruct, Seed=42, Decoding=Greedy2025.11 | 45.34 |