Civic Comment Synthesis on DeliberationBank BinaryQA
0.64RepresentativenessTeamFusion
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TeamFusionModel=GPT-4.12026.04 | 0.64 | 0.634 | 0.602 | 0.603 | |
| TeamFusionModel=GPT-4.1-mini2026.04 | 0.623 | 0.601 | 0.604 | 0.587 | |
| TeamFusionModel=Llama-3.3-70B2026.04 | 0.62 | 0.597 | 0.61 | 0.568 | |
| MADModel=GPT-4.1-mini2026.04 | 0.616 | 0.559 | 0.586 | 0.57 | |
| Self-RefineModel=GPT-4.1-mini2026.04 | 0.61 | 0.553 | 0.58 | 0.566 | |
| MADModel=GPT-4.12026.04 | 0.609 | 0.563 | 0.58 | 0.567 | |
| Self-RefineModel=GPT-4.12026.04 | 0.605 | 0.543 | 0.575 | 0.557 | |
| Self-RefineModel=Llama-3.3-70B2026.04 | 0.599 | 0.545 | 0.587 | 0.547 | |
| MADModel=Llama-3.3-70B2026.04 | 0.596 | 0.554 | 0.585 | 0.549 | |
| DirectModel=Llama-3.3-70B2026.04 | 0.595 | 0.541 | 0.59 | 0.542 | |
| DirectModel=GPT-4.1-mini2026.04 | 0.589 | 0.531 | 0.584 | 0.543 | |
| CoTModel=GPT-4.12026.04 | 0.585 | 0.533 | 0.578 | 0.539 | |
| DirectModel=GPT-4.12026.04 | 0.584 | 0.53 | 0.577 | 0.541 | |
| CoTModel=GPT-4.1-mini2026.04 | 0.58 | 0.523 | 0.575 | 0.538 | |
| CoTModel=Llama-3.3-70B2026.04 | 0.578 | 0.53 | 0.58 | 0.528 |