Intervention Content Quality on BSDD
33.5ROUGE-1PULI
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PULILLM Backbone (Observer + Presenter)=(LLaMA3.2-1B-Instruct + LLaMA3.1-8B-Instruct)2026.04 | 33.5 | 21.8 | 39.2 | |
| Vanilla SFTLLM Backbone (Observer + Presenter)=(LLaMA3.2-1B-Instruct + LLaMA3.1-8B-Instruct)2026.04 | 32.5 | 20.9 | 26.7 | |
| PULILLM Backbone (Observer + Presenter)=(Qwen3-0.6B + Qwen3-14B)2026.04 | 32.4 | 20.1 | 39.8 | |
| ICLLLM Backbone (Observer + Presenter)=(GPT-4o-mini + GPT-4o)2026.04 | 31.3 | 17.5 | 36.7 | |
| ICLLLM Backbone (Observer + Presenter)=(LLaMA3.2-1B-Instruct + LLaMA3.1-8B-Instruct)2026.04 | 30.9 | 17.7 | 20.8 | |
| Proactive AgentLLM Backbone (Observer + Presenter)=(GPT-4o-mini + GPT-4o)2026.04 | 30.7 | 17.2 | 28.3 | |
| RandomLLM Backbone (Observer + Presenter)=(GPT-4o-mini + GPT-4o)2026.04 | 29.5 | 16.4 | 20.1 | |
| ICLLLM Backbone (Observer + Presenter)=(Qwen3-0.6B + Qwen3-14B)2026.04 | 29.4 | 16.3 | 18.3 | |
| Vanilla SFTLLM Backbone (Observer + Presenter)=(Qwen3-0.6B + Qwen3-14B)2026.04 | 29.2 | 15.8 | 27.1 | |
| Proactive AgentLLM Backbone (Observer + Presenter)=(LLaMA3.2-1B-Instruct + LLaMA3.1-8B-Instruct)2026.04 | 29.1 | 15.4 | 7.5 | |
| RandomLLM Backbone (Observer + Presenter)=(LLaMA3.2-1B-Instruct + LLaMA3.1-8B-Instruct)2026.04 | 28.5 | 15.4 | 5.8 | |
| Proactive AgentLLM Backbone (Observer + Presenter)=(Qwen3-0.6B + Qwen3-14B)2026.04 | 27.6 | 15.5 | 14.8 | |
| RandomLLM Backbone (Observer + Presenter)=(Qwen3-0.6B + Qwen3-14B)2026.04 | 27.2 | 14.9 | 0 | |
| StandardLLM Backbone (Observer + Presenter)=(GPT-4o-mini + GPT-4o)2026.04 | 26.2 | 14.7 | 14.9 | |
| StandardLLM Backbone (Observer + Presenter)=(Qwen3-0.6B + Qwen3-14B)2026.04 | 25.2 | 13.8 | 0 | |
| StandardLLM Backbone (Observer + Presenter)=(LLaMA3.2-1B-Instruct + LLaMA3.1-8B-Instruct)2026.04 | 25.2 | 13.8 | 0 |