Accuracy Evaluation on TruthfulQA
91.5AccuracyPEAR
Evaluation Results
| Method | Links | |
|---|---|---|
| PEARBackbone=GPT-5.4-nano2026.05 | 91.5 | |
| PEARBackbone=Qwen-3-30B-A3B2026.05 | 90.5 | |
| PEARBackbone=Claude-Haiku-4.52026.05 | 90.5 | |
| PEARBackbone=Qwen-2.5-14B2026.05 | 89 | |
| CliqueBackbone=Qwen-2.5-14B2026.05 | 87.5 | |
| RingBackbone=Qwen-2.5-14B2026.05 | 85.5 | |
| CliqueBackbone=Claude-Haiku-4.52026.05 | 85.5 | |
| RandomBackbone=Qwen-2.5-14B2026.05 | 84.5 | |
| CliqueBackbone=Qwen-3-30B-A3B2026.05 | 84.5 | |
| CliqueBackbone=GPT-5.4-nano2026.05 | 84.5 | |
| RandomBackbone=Claude-Haiku-4.52026.05 | 84.5 | |
| RandomBackbone=Qwen-3-30B-A3B2026.05 | 83.5 | |
| RandomBackbone=GPT-5.4-nano2026.05 | 83.5 | |
| RingBackbone=Claude-Haiku-4.52026.05 | 83.5 | |
| Sparse MADBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 83.41 | |
| RingBackbone=GPT-5.4-nano2026.05 | 83 | |
| PEARBackbone=Gemma-3-12B2026.05 | 82.5 | |
| ChainBackbone=Qwen-2.5-14B2026.05 | 82.5 | |
| StarBackbone=Qwen-2.5-14B2026.05 | 82 | |
| ChainBackbone=Qwen-3-30B-A3B2026.05 | 82 | |
| PEARBackbone=Llama-3.1-8B2026.05 | 81.5 | |
| BaseZero-shot=true2026.03 | 81 | |
| StarBackbone=Qwen-3-30B-A3B2026.05 | 80 | |
| CoT-SCBackbone=Qwen-3-30B-A3B2026.05 | 79.5 | |
| StarBackbone=GPT-5.4-nano2026.05 | 79 | |
| CliqueBackbone=Llama-3.1-8B2026.05 | 78.5 | |
| ChainBackbone=GPT-5.4-nano2026.05 | 78.5 | |
| ChainBackbone=Claude-Haiku-4.52026.05 | 78.5 | |
| AceMADBase Model=Qwen3-235B-A22B-Instruct, Iteration Rounds (T)=3, Number of Agents (N)=52026.03 | 78.03 | |
| CoT-SCBackbone=Qwen-2.5-14B2026.05 | 78 | |
| RingBackbone=Qwen-3-30B-A3B2026.05 | 78 | |
| ChainBackbone=Gemma-3-12B2026.05 | 77.5 | |
| StarBackbone=Claude-Haiku-4.52026.05 | 77.5 | |
| RandomBackbone=Gemma-3-12B2026.05 | 77 | |
| RandomBackbone=Llama-3.1-8B2026.05 | 76.5 | |
| StarBackbone=Gemma-3-12B2026.05 | 76 | |
| RingBackbone=Gemma-3-12B2026.05 | 76 | |
| CliqueBackbone=Gemma-3-12B2026.05 | 75.5 | |
| ChainBackbone=Llama-3.1-8B2026.05 | 75 | |
| Single AgentBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 74.89 | |
| StarBackbone=Llama-3.1-8B2026.05 | 74.5 | |
| RingBackbone=Llama-3.1-8B2026.05 | 74 | |
| CoTBackbone=Qwen-3-30B-A3B2026.05 | 74 | |
| CoTBackbone=Qwen-2.5-14B2026.05 | 72.5 | |
| Decentralized MADBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 71.75 | |
| Centralized MADBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 71.75 | |
| CoT-SCBackbone=Gemma-3-12B2026.05 | 71 | |
| CoTBackbone=Gemma-3-12B2026.05 | 70.5 | |
| CoT-SCBackbone=Claude-Haiku-4.52026.05 | 69.5 | |
| CoT-SCBackbone=Llama-3.1-8B2026.05 | 68.5 | |
| CoTBackbone=Llama-3.1-8B2026.05 | 64.5 | |
| CoTBackbone=GPT-5.4-nano2026.05 | 63.5 | |
| Majority VotingBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 62.78 | |
| CoT-SCBackbone=GPT-5.4-nano2026.05 | 62 | |
| CoTBackbone=Claude-Haiku-4.52026.05 | 61.5 | |
| AceMADBase Model=Qwen3-235B-A22B-Instruct, Iteration Rounds (T)=2, Number of Agents (N)=52026.03 | 60.49 | |
| SFTZero-shot=true2026.03 | 59 | |
| GRPOZero-shot=true2026.03 | 57 | |
| GANPOBackbone Model=Gemma2-2B-it2026.01 | 55.67 | |
| DPOBackbone Model=Gemma2-2B-it2026.01 | 55.28 | |
| BaseBackbone Model=Gemma2-2B-it2026.01 | 53.11 | |
| S³Backbone=LLaDA-8B-Instruct, Decoding Strategy=S³, N (S³)=4, b (S³)=2, K (Best-of-K)=642026.04 | 49.57 | |
| Best-of-KBackbone=LLaDA-8B-Instruct, Decoding Strategy=Best-of-K, K (Best-of-K)=82026.04 | 49.36 | |
| LMNetBackbone=Qwen2.5-0.5B2025.05 | 47.9 | |
| Dr.LLMModel=Qwen2.5, Router=Enabled2025.10 | 47.9 | |
| Qwen7BModel=Qwen2.5, Router=None2025.10 | 47.7 | |
| Baseline DiffusionBackbone=LLaDA-8B-Instruct, Decoding Strategy=Standard Diffusion2026.04 | 46.49 | |
| Qwen3BModel=Qwen2.5, Router=None2025.10 | 41.9 | |
| Dr.LLMModel=Qwen2.5, Router=Enabled2025.10 | 41.9 | |
| Self-ConsistencyBackbone=Qwen2.5-0.5B, Samples=162025.05 | 41.3 | |
| AceMADBase Model=GPT-4o-mini, Iteration Rounds (T)=5, Number of Agents (N)=52026.03 | 40.81 | |
| AceMADBase Model=Qwen3-235B-A22B-Instruct, Iteration Rounds (T)=5, Number of Agents (N)=52026.03 | 40.81 | |
| SFTBackbone=Qwen2.5-0.5B2025.05 | 40.5 | |
| PromptBackbone=Qwen2.5-0.5B2025.05 | 40.2 | |
| AceMADBase Model=GPT-4o-mini, Iteration Rounds (T)=3, Number of Agents (N)=52026.03 | 39.91 | |
| Centralized MADBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 39.51 | |
| Self-RefineBackbone=Qwen2.5-0.5B, Passes=162025.05 | 38.9 | |
| AceMADBase Model=GPT-4o-mini, Iteration Rounds (T)=2, Number of Agents (N)=52026.03 | 37.67 | |
| LLaMA8BModel=LLaMA-3.1, Router=None2025.10 | 36.9 | |
| Dr.LLMModel=LLaMA-3.1, Router=Enabled2025.10 | 36.6 | |
| Decentralized MADBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 33.63 | |
| Sparse MADBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 32.74 | |
| ReMiTModel Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 31.95 | |
| Single AgentBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 31.88 | |
| LLaMA3BModel=LLaMA-3.2, Router=None2025.10 | 31.3 | |
| Dr.LLMModel=LLaMA-3.2, Router=Enabled2025.10 | 30.4 | |
| Pre-TrainedModel Family=SmolLM3-3B, Mid-Training=Standard Checkpoint, Few-shot=True2026.02 | 30.23 | |
| Vanilla NTPModel Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 29.74 | |
| PerSynStudent Model=Qwen2.5-14B2025.10 | 29.5 | |
| MiniPLMModel Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 29.13 | |
| CARStudent Model=Qwen2.5-14B2025.10 | 28.8 | |
| RHO-1Model Family=SmolLM3-3B, Mid-Training=True, Few-shot=True2026.02 | 28.52 | |
| Family-StrongStudent Model=Qwen2.5-14B2025.10 | 28.4 | |
| Pre-TrainedModel Family=Youtu-LLM-2B, Mid-Training=Standard Checkpoint, Few-shot=True2026.02 | 27.54 | |
| ReMiTModel Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 27.42 | |
| MixStudent Model=Qwen2.5-14B2025.10 | 27.1 | |
| RHO-1Model Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 26.68 | |
| Vanilla NTPModel Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 26.56 | |
| MiniPLMModel Family=Youtu-LLM-2B, Mid-Training=True, Few-shot=True2026.02 | 26.56 | |
| PerSynStudent Model=Qwen2.5-7B2025.10 | 26.2 |