Prompt Extraction on IHEval Prompt Extraction - Conflict 1.0
59.6AccuracyQwen3-4B-it-NSHA-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-4B-it-NSHA-SFTBackbone=Qwen3-4B, Methodology=NSHA-SFT2026.04 | 59.6 | |
| Llama3.1-8B-NSHA-SFTBackbone=Llama3.1-8B, Methodology=NSHA-SFT2026.04 | 36.3 | |
| Qwen3-4B-itBackbone=Qwen3-4B, Methodology=Instruct2026.04 | 25.6 | |
| Qwen3-4B-it-NSBackbone=Qwen3-4B, Methodology=Neuro-Symbolic2026.04 | 25.5 | |
| Qwen3-4B-it-NSHA-HCALBackbone=Qwen3-4B, Methodology=NSHA-HCAL2026.04 | 24 | |
| Qwen3-4B-it-NSHA-DPOBackbone=Qwen3-4B, Methodology=NSHA-DPO2026.04 | 20.3 | |
| Llama3.1-8B-NSHA-DPOBackbone=Llama3.1-8B, Methodology=NSHA-DPO2026.04 | 17.5 | |
| Qwen3-4B-it-CoTBackbone=Qwen3-4B, Methodology=Chain-of-Thought2026.04 | 15.9 | |
| Llama3.1-8B-NSHA-HCALBackbone=Llama3.1-8B, Methodology=NSHA-HCAL2026.04 | 12.1 | |
| Llama3.1-8BBackbone=Llama3.1-8B, Methodology=Instruct2026.04 | 11.3 | |
| Llama3.1-8B-NSBackbone=Llama3.1-8B, Methodology=Neuro-Symbolic2026.04 | 11.3 | |
| Llama3.1-8B-CoTBackbone=Llama3.1-8B, Methodology=Chain-of-Thought2026.04 | 11 |