Classification on Life events
74.1Macro F1 ScoreQwen & Mistral team (CFD: sampling-based) with judge (debate confidence)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen & Mistral team (CFD: sampling-based) with judge (debate confidence)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained (debate), Mechanism=CFD, Judge=Yes2025.12 | 74.1 | 83.1 | |
| Qwen & Mistral team (CFD: sampling-based)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 74 | 82.7 | |
| Qwen & Mistral team (CFD: sampling-based) with judgeArchitecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD, Judge=Yes2025.12 | 74 | 83 | |
| Qwen & Mistral team (CFD: sampling-based) with judge (debate confidence) + swapping positionsArchitecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained (debate), Mechanism=CFD, Judge=Yes, Swapping positions=Yes2025.12 | 74 | 83.1 | |
| Qwen & Mistral team (CFD: sampling-based) with judge + swapping positionsArchitecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD, Judge=Yes, Swapping positions=Yes2025.12 | 73.8 | 82.9 | |
| QwenArchitecture=Single LLM, Prompting=Cat-CoT2025.12 | 73.7 | 82.6 | |
| Qwen (Structured Debate + Aggregated)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 73.7 | 82.6 | |
| QwenArchitecture=Single LLM, Prompting=Cat-CoT, Decoding=Self-consistency2025.12 | 73.5 | 82.6 | |
| Qwen (CFD: sampling-based)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 73.5 | 82.5 | |
| Qwen (CFD: self-verbalized)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 73.3 | 82.2 | |
| Qwen & Mistral team (Structured Debate + Aggregated)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 73.3 | 82.5 | |
| Qwen (Structured Debate + Self-verbalized)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 73.1 | 82.3 | |
| Mistral (CFD: sampling-based)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 72.5 | 82.1 | |
| Qwen (Debunc)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 72.4 | 81.7 | |
| MistralArchitecture=Single LLM, Prompting=Cat-CoT, Decoding=Self-consistency2025.12 | 71.9 | 80.8 | |
| Qwen (Standard Debate)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=None2025.12 | 71.7 | 81.1 | |
| Qwen & Mistral team (Standard)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=None2025.12 | 71.6 | 81.7 | |
| MistralArchitecture=Single LLM, Prompting=Cat-CoT2025.12 | 71.5 | 81.2 | |
| LlamaArchitecture=Single LLM, Prompting=Cat-CoT2025.12 | 70.4 | 80.5 |