Question Answering on GPQA (198)
73.2AccuracySC-MoA
Evaluation Results
| Method | Links | |
|---|---|---|
| SC-MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 73.2 | |
| GoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Variant=GoAMean (3-model pool)2026.05 | 72.7 | |
| SCBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 70.7 | |
| TextGradBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 69.7 | |
| MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Proposers=4 heterogeneous proposers2026.05 | 67.7 | |
| Zero-shot CoTBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 66.7 | |
| MoA (para)Backbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Proposers=SPUQ paraphrases with a single model2026.05 | 65.2 | |
| Self-MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 64.1 |