Reasoning Efficiency Evaluation on Qwen3 Reasoning Tasks Five-component aggregate Base
0.71Token-based AESRollout-level |Ai| replay
Evaluation Results
| Method | Links | |
|---|---|---|
| Rollout-level |Ai| replayReference Baseline=Untrained base model, Backbone=Qwen3-Base, Scale=1.7B2026.06 | 0.71 | |
| Rollout-level |Ai| replayReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=4B2026.06 | 0.579 | |
| Rollout-level |Ai| replayReference Baseline=Untrained base model, Backbone=Qwen3-Base, Scale=4B2026.06 | 0.56 | |
| GRPOReference Baseline=Untrained base model, Backbone=Qwen3-Base, Scale=1.7B2026.06 | 0.409 | |
| uniformReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=4B, Priority Signal=query-level, Composition Mode=pool composition2026.06 | 0.3 | |
| Rollout-level |Ai| replayReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=1.7B2026.06 | 0.266 | |
| σgReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=4B, Priority Signal=query-level, Composition Mode=pool composition2026.06 | 0.241 | |
| σgReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=1.7B, Priority Signal=query-level, Composition Mode=pool composition2026.06 | 0.194 | |
| Rollout-level |Ai| replayReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=0.6B2026.06 | 0.18 | |
| uniformReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=1.7B, Priority Signal=query-level, Composition Mode=pool composition2026.06 | 0.148 | |
| Rollout-level |Ai| replayReference Baseline=Untrained base model, Backbone=Qwen3-Base, Scale=0.6B2026.06 | -0.009 | |
| σgReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=0.6B, Priority Signal=query-level, Composition Mode=pool composition2026.06 | -0.154 | |
| uniformReference Baseline=GRPO no-replay baseline, Backbone=Qwen3-Base, Scale=0.6B, Priority Signal=query-level, Composition Mode=pool composition2026.06 | -0.16 | |
| GRPOReference Baseline=Untrained base model, Backbone=Qwen3-Base, Scale=0.6B2026.06 | -0.269 | |
| GRPOReference Baseline=Untrained base model, Backbone=Qwen3-Base, Scale=4B2026.06 | -0.472 |