ResearchBenchmarksSummarization on SummaryBench RomanFollow91.9Structural ScoreAPWA-3.509621.260246.0370.7998May 14, 2026Evaluation ResultsMethodMethodLinksStructural ScoreSemantic ScoreAPWALLM Backend=GPT-5.4 miniLLM Backend=GPT-5.4 mini2026.0591.923.2MegaAgentLLM Backend=GPT-4.1 miniLLM Backend=GPT-4.1 mini2026.05161.6APWAConfig=5.4×miniConfig=5.4×mini2026.050.9830.37APWAConfig=mini×nanoConfig=mini×nano2026.050.9140.295APWAConfig=mini×miniConfig=mini×mini2026.050.9080.23APWAConfig=5.4×nanoConfig=5.4×nano2026.050.8720.395MegaAgent2026.050.160.016