Code Generation on LCB-Hard (171)
62.6AccuracySC-MoA
Evaluation Results
| Method | Links | |
|---|---|---|
| SC-MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 62.6 | |
| SCBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 57.3 | |
| MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Proposers=4 heterogeneous proposers2026.05 | 57.3 | |
| Self-MoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 57.3 | |
| TextGradBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 52 | |
| MoA (para)Backbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Proposers=SPUQ paraphrases with a single model2026.05 | 50.9 | |
| Zero-shot CoTBackbone=gpt-oss-120b, N=5, k=2, LLM calls=112026.05 | 42.1 | |
| GoABackbone=gpt-oss-120b, N=5, k=2, LLM calls=11, Variant=GoAMean (3-model pool)2026.05 | 24.6 |