Scientific Reasoning on GPQA-D (Accuracy (%))
66.2Accuracy (%)RecursiveMAS
Evaluation Results
| Method | Links | |
|---|---|---|
| RecursiveMASrecursion round=32026.04 | 66.2 | |
| Single Agenttraining protocol=Full-SFT2026.04 | 62.8 | |
| TextGradrecursion round=32026.04 | 62.5 | |
| Single Agenttraining protocol=LoRA2026.04 | 62 | |
| Recursive-TextMASrecursion round=32026.04 | 61.6 | |
| DGO (TTS)Model=Qwen3-8B-Base, Inference Mode=Test-Time Scaling2026.03 | 54.99 | |
| FOREVERModel Scale=14B, Training Protocol=Capability-continual2026.05 | 54 | |
| DGO (TTS)Model=Qwen3-4B-Base, Inference Mode=Test-Time Scaling2026.03 | 52.53 | |
| DGO (TTS)Model=Qwen3-14B-Base, Inference Mode=Test-Time Scaling2026.03 | 51.64 | |
| DGO (zero)Model=Qwen3-14B-Base, Inference Mode=Intrinsic Inference2026.03 | 50.13 | |
| DGO (zero)Model=Qwen3-8B-Base, Inference Mode=Intrinsic Inference2026.03 | 49.75 | |
| DAPOModel=Qwen3-14B-Base2026.03 | 49.37 | |
| LoopLMrecursion round=32026.04 | 48.1 | |
| Mixture-of-Agents (MoA)recursion round=32026.04 | 47.6 | |
| FOREVERModel Scale=8B, Training Protocol=Capability-continual2026.05 | 47 | |
| DAPOModel=Qwen3-8B-Base2026.03 | 45.83 | |
| GRPOModel=Qwen3-14B-Base2026.03 | 45.01 | |
| GRPOModel=Qwen3-8B-Base2026.03 | 44.32 | |
| DGO (zero)Model=Qwen3-4B-Base, Inference Mode=Intrinsic Inference2026.03 | 43.56 | |
| Seq. SFTModel Scale=14B, Training Protocol=Capability-continual2026.05 | 43.4 | |
| EWCModel Scale=14B, Training Protocol=Capability-continual2026.05 | 43.4 | |
| GRPOModel=Qwen3-4B-Base2026.03 | 42.55 | |
| FOREVERModel Scale=4B, Training Protocol=Capability-continual2026.05 | 42.4 | |
| DAPOModel=Qwen3-4B-Base2026.03 | 41.79 | |
| Seq. SFTModel Scale=4B, Training Protocol=Capability-continual2026.05 | 41.4 | |
| EWCModel Scale=8B, Training Protocol=Capability-continual2026.05 | 41.3 | |
| GCWMModel Scale=14B, Training Protocol=Capability-continual2026.05 | 39.9 | |
| GCWMModel Scale=8B, Training Protocol=Capability-continual2026.05 | 38.8 | |
| AIMMergingModel Scale=14B, Training Protocol=Capability-continual2026.05 | 38.8 | |
| DEPTBackbone=Qwen3-8B-Base2026.05 | 38.72 | |
| L&SModel Scale=14B, Training Protocol=Capability-continual2026.05 | 38.4 | |
| OPCMModel Scale=14B, Training Protocol=Capability-continual2026.05 | 38 | |
| OPCMModel Scale=8B, Training Protocol=Capability-continual2026.05 | 37.8 | |
| OPCMModel Scale=4B, Training Protocol=Capability-continual2026.05 | 37.4 | |
| MARSBackbone=Qwen3-8B-Base2026.05 | 37.37 | |
| EWCModel Scale=4B, Training Protocol=Capability-continual2026.05 | 37.2 | |
| SFTModel=Qwen3-14B-Base2026.03 | 37.12 | |
| DEPTBackbone=Qwen3-4B-Base2026.05 | 37.04 | |
| SFTModel=Qwen3-8B-Base2026.03 | 36.3 | |
| MTLModel Scale=8B, Training Protocol=Joint-training2026.05 | 35.9 | |
| Seq. SFTModel Scale=8B, Training Protocol=Capability-continual2026.05 | 35.9 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 35.86 | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 35.69 | |
| SPIRALBackbone=Qwen3-8B-Base2026.05 | 35.69 | |
| GCWMModel Scale=4B, Training Protocol=Capability-continual2026.05 | 35.4 | |
| SPIRALBackbone=Qwen3-4B-Base2026.05 | 34.18 | |
| MARSBackbone=Qwen3-4B-Base2026.05 | 34.01 | |
| SPAGBackbone=Qwen3-4B-Base2026.05 | 33.33 | |
| AIMMergingModel Scale=4B, Training Protocol=Capability-continual2026.05 | 33.3 | |
| MTLModel Scale=14B, Training Protocol=Joint-training2026.05 | 33.3 | |
| L&SModel Scale=4B, Training Protocol=Capability-continual2026.05 | 32.9 | |
| MTLModel Scale=4B, Training Protocol=Joint-training2026.05 | 32.8 | |
| AIMMergingModel Scale=8B, Training Protocol=Capability-continual2026.05 | 32.3 | |
| L&SModel Scale=8B, Training Protocol=Capability-continual2026.05 | 32.1 | |
| SPAGBackbone=Qwen3-8B-Base2026.05 | 31.14 | |
| VANILLABackbone=Qwen3-8B-Base2026.05 | 29.8 | |
| EGIModel=Qwen3-14B-Base2026.03 | 28.91 | |
| VANILLABackbone=Qwen3-4B-Base2026.05 | 28.79 | |
| FOREVERModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 27.3 | |
| MTLModel Scale=1.7B, Training Protocol=Joint-training2026.05 | 26.7 | |
| GCWMModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 26.3 | |
| MTLModel Scale=0.6B, Training Protocol=Joint-training2026.05 | 24.8 | |
| EWCModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 24.8 | |
| EWCModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 23.7 | |
| AIMMergingModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 23.7 | |
| L&SModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 23.5 | |
| GCWMModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 23.2 | |
| OPCMModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 23.2 | |
| SFTModel=Qwen3-4B-Base2026.03 | 22.92 | |
| OPCMModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 22.3 | |
| EGIModel=Qwen3-8B-Base2026.03 | 22.22 | |
| AIMMergingModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 21.7 | |
| L&SModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 21.3 | |
| Seq. SFTModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 19.7 | |
| FOREVERModel Scale=0.6B, Training Protocol=Capability-continual2026.05 | 18.2 | |
| Seq. SFTModel Scale=1.7B, Training Protocol=Capability-continual2026.05 | 18.2 | |
| EGIModel=Qwen3-4B-Base2026.03 | 12.12 |