Question Answering on BBH-3 296
86.5AccuracySC-MoA
Evaluation Results
| Method | Links | |
|---|---|---|
| SC-MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 86.5 | |
| TextGradBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 83.8 | |
| GoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Variant=GoAMean (3-model pool)2026.05 | 82.8 | |
| SCBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 80.4 | |
| MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Proposers=4 heterogeneous proposers2026.05 | 69.9 | |
| MoA (para)Backbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Proposers=SPUQ paraphrases with a single model2026.05 | 68.2 | |
| Self-MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 67.6 | |
| Zero-shot CoTBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 32.8 |