Mathematical Reasoning on AMC23 (Accuracy Statistics)
70.4Mean AccuracyFlowTracer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FlowTracerBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 70.4 | — | — | |
| RandomBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 67.2 | — | — | |
| GRPOBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 66.3 | — | — | |
| AttentionBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 66.1 | — | — | |
| GradientBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 65.7 | — | — | |
| FlowTracerBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 65.6 | — | — | |
| CorrelationBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 64.4 | — | — | |
| High-entropyBackbone=Qwen3-8B-Base, Context Length=8K2026.06 | 63.7 | — | — | |
| AttentionBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 62.9 | — | — | |
| FlowTracerBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 62.4 | — | — | |
| High-entropyBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 61.5 | — | — | |
| RandomBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 60.1 | — | — | |
| GradientBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 60 | — | — | |
| AttentionBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 59.3 | — | — | |
| GRPOBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 59.1 | — | — | |
| FlowTracerBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 59 | — | — | |
| CorrelationBackbone=Qwen3-8B-Base, Context Length=1K2026.06 | 58.8 | — | — | |
| AttentionBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 58.4 | — | — | |
| High-entropyBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 57.8 | — | — | |
| GradientBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 57.8 | — | — | |
| CorrelationBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 57.8 | — | — | |
| GRPOBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 57.6 | — | — | |
| RandomBackbone=Qwen3-4B-Base, Context Length=8K2026.06 | 57.1 | — | — | |
| High-entropyBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 55.8 | — | — | |
| RandomBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 55.2 | — | — | |
| CorrelationBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 55.2 | — | — | |
| GRPOBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 55.1 | — | — | |
| GradientBackbone=Qwen3-4B-Base, Context Length=1K2026.06 | 53.2 | — | — | |
| RePO_detModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 45 | 7.71 | 35.43 | |
| KTOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 43.5 | 6.75 | 35.11 | |
| TDPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 42 | 3.26 | 37.95 | |
| RPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 41.5 | 4.18 | 36.31 | |
| RePOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 38 | 8.55 | 27.38 | |
| DPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 35.5 | 5.7 | 28.42 | |
| IPOModel (Backbone)=Qwen3-4B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 35 | 5 | 28.79 | |
| RePOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 33 | 4.81 | 27.03 | |
| RePO_detModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 30.5 | 3.26 | 26.45 | |
| KTOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 30 | 3.06 | 26.2 | |
| TDPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 26 | 8.4 | 15.57 | |
| DPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 25 | 3.95 | 20.09 | |
| IPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 24 | 3.35 | 19.84 | |
| RPOModel (Backbone)=Qwen3-1.7B, Decoding Strategy=sampling-based inference, Temperature=0.7, Top-p=0.952026.06 | 22.5 | 3.06 | 18.7 |