Collaborative Group Problem Solving on CGPST 10 Scenarios
144CGPST Scenario 1 Scoregpt-5
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| gpt-5Framework=TeamLLM2026.04 | 144 | 139.5 | 139.5 | 138 | 156 | 143 | 156 | 150 | 130 | 132 | 142.8 | |
| gpt-4oFramework=TeamLLM2026.04 | 137 | 134.5 | 118 | 121 | 136.5 | 138.5 | 124 | 135 | 118 | 123 | 128.55 | |
| qwen3-instructFramework=TeamLLM2026.04 | 135.5 | 142 | 127 | 123.5 | 120.5 | 142 | 156 | 135.5 | 137 | 134.5 | 135.35 | |
| kimi-k2Framework=TeamLLM2026.04 | 134 | 134 | 133 | 120 | 122 | 129 | 107.5 | 117 | 127 | 116.5 | 124 | |
| claude-4-opusFramework=TeamLLM2026.04 | 133.5 | 134.5 | 140.5 | 132 | 138.5 | 144.5 | 150.5 | 147.5 | 116.5 | 129 | 136.7 | |
| gpt-5Framework=baseline2026.04 | 133 | 126 | 130.5 | 127 | 130 | 126.5 | 142 | 139 | 119 | 127.5 | 130.05 | |
| gemini-2.5-proFramework=TeamLLM2026.04 | 130.5 | 123 | 121.5 | 117.5 | 143 | 142.5 | 117.5 | 143 | 116 | 120 | 127.45 | |
| deepseek-v3Framework=TeamLLM2026.04 | 129 | 137 | 130.5 | 116.5 | 124.5 | 114 | 121.5 | 102.5 | 124.5 | 130 | 123 | |
| deepseek-r1Framework=TeamLLM2026.04 | 126.5 | 132.5 | 114.5 | 131 | 135.5 | 120.5 | 126 | 116 | 119 | 107 | 122.85 | |
| qwen3-instructFramework=baseline2026.04 | 116 | 113 | 110 | 122.5 | 107.5 | 127.5 | 125.5 | 113 | 117 | 110 | 116.2 | |
| gemini-2.5-proFramework=baseline2026.04 | 115.5 | 111 | 124.5 | 124.5 | 115 | 121.5 | 123.5 | 118 | 116 | 118 | 118.75 | |
| qwen3-thinkingFramework=TeamLLM2026.04 | 115 | 133.5 | 135 | 124 | 117.5 | 140.5 | 146.5 | 111 | 116 | 112 | 125.1 | |
| deepseek-v3Framework=baseline2026.04 | 114.5 | 104.5 | 91 | 104.5 | 110 | 110 | 116 | 105.5 | 104 | 109.5 | 106.95 | |
| deepseek-r1Framework=baseline2026.04 | 109.5 | 99 | 109.5 | 104 | 97.5 | 110 | 119 | 106.5 | 103 | 112 | 107 | |
| claude-4-opusFramework=baseline2026.04 | 108.5 | 100 | 123.5 | 128 | 118.5 | 127.5 | 133 | 123.5 | 109 | 114.5 | 118.6 | |
| kimi-k2Framework=baseline2026.04 | 108 | 113.5 | 119 | 124.5 | 110 | 127.5 | 129 | 124.5 | 116.5 | 115 | 118.75 | |
| gpt-4oFramework=baseline2026.04 | 102 | 91 | 104.5 | 109.5 | 96 | 118 | 124 | 109 | 94.5 | 110 | 105.85 | |
| llama-4-scoutFramework=baseline2026.04 | 101.5 | 86 | 105.5 | 105.5 | 91.5 | 101 | 110 | 106 | 71 | 104.5 | 98.25 | |
| llama-4-scoutFramework=TeamLLM2026.04 | 101 | 120.5 | 129 | 91 | 111 | 116 | 105.5 | 93 | 107.5 | 120 | 109.45 | |
| qwen3-thinkingFramework=baseline2026.04 | 100.5 | 108.5 | 121 | 120.5 | 115 | 126.5 | 130.5 | 111.5 | 103.5 | 108 | 114.55 |