Classification on Sharenting
81.4Macro F1 ScoreQwen
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QwenArchitecture=Single LLM, Prompting=Cat-CoT, Decoding=Self-consistency2025.12 | 81.4 | 83.5 | |
| Qwen & Mistral team (CFD: sampling-based)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 81.4 | 83.4 | |
| Qwen & Mistral team (CFD: sampling-based) with judge + swapping positionsArchitecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD, Judge=Yes, Swapping positions=Yes2025.12 | 81.2 | 83.3 | |
| Qwen (Standard Debate)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=None2025.12 | 81.1 | 83.2 | |
| Qwen (CFD: sampling-based)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 81 | 83 | |
| Qwen & Mistral team (CFD: sampling-based) with judge (debate confidence) + swapping positionsArchitecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained (debate), Mechanism=CFD, Judge=Yes, Swapping positions=Yes2025.12 | 81 | 83.1 | |
| Qwen (Structured Debate + Self-verbalized)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 80.9 | 83.1 | |
| Qwen (Structured Debate + Aggregated)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 80.9 | 82.8 | |
| Qwen & Mistral team (CFD: sampling-based) with judgeArchitecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD, Judge=Yes2025.12 | 80.9 | 83.1 | |
| QwenArchitecture=Single LLM, Prompting=Cat-CoT2025.12 | 80.8 | 82.9 | |
| Qwen (Debunc)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 80.8 | 82.9 | |
| Qwen & Mistral team (CFD: sampling-based) with judge (debate confidence)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained (debate), Mechanism=CFD, Judge=Yes2025.12 | 80.7 | 82.8 | |
| Qwen (CFD: self-verbalized)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 80.6 | 83.1 | |
| MistralArchitecture=Single LLM, Prompting=Cat-CoT, Decoding=Self-consistency2025.12 | 80.5 | 82.4 | |
| Mistral (CFD: sampling-based)Architecture=Single-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Fine-grained, Mechanism=CFD2025.12 | 80.5 | 82.3 | |
| Qwen & Mistral team (Structured Debate + Aggregated)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=Coarse-grained2025.12 | 80.5 | 82.6 | |
| Qwen & Mistral team (Standard)Architecture=Multi-LLM Multi-agent, Prompting=Cat-CoT, Confidence=None2025.12 | 80.4 | 82.5 | |
| MistralArchitecture=Single LLM, Prompting=Cat-CoT2025.12 | 79.9 | 81.7 | |
| LlamaArchitecture=Single LLM, Prompting=Cat-CoT2025.12 | 79.2 | 81.2 |