ResearchBenchmarksLong-context Question Answering on LongBench IV. Long-dialogue History Understanding v2Follow61.6AccuracyMPLM30.81638.80846.854.792Jul 1, 2026Evaluation ResultsMethodMethodLinksAccuracyLatency (s)MPLMBackbone=Qwen3.6-35B-A3BBackbone=Qwen3.6-35B-A3B2026.0761.694.1RLMBackbone=Qwen3.6-35B-A3BBackbone=Qwen3.6-35B-A3B2026.075972.7MPLMBackbone=Qwen3-30B-A3BBackbone=Qwen3-30B-A3B2026.0751.360.1RLMBackbone=Qwen3-30B-A3BBackbone=Qwen3-30B-A3B2026.073292.6