Comparative empirical forecasting on In-Domain (ID) (test)
90.71Overall Consistency RateQwen3 Direct-SFT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3 Direct-SFTBackbone=Qwen32026.04 | 90.71 | 44.76 | 1.22 | |
| Qwen3 Reason-SFT-DrGRPOBackbone=Qwen32026.04 | 87.72 | 50.48 | 1.12 | |
| GPT-5 MediumBackbone=GPT-5, Variant=Medium2026.04 | 86.88 | 36.19 | 1.41 | |
| GPT-5 LowBackbone=GPT-5, Variant=Low2026.04 | 85.82 | 38.1 | 1.48 | |
| GPT-5 HighBackbone=GPT-5, Variant=High2026.04 | 85.77 | 35.24 | 1.41 | |
| Qwen3 Synthetic-Reason-SFT-DAPOBackbone=Qwen32026.04 | 85.27 | 43.81 | 1.32 | |
| Qwen3 Reason-DAPOBackbone=Qwen32026.04 | 84.85 | 51.43 | 1.29 | |
| Qwen3 Reason-SFT-DAPOBackbone=Qwen32026.04 | 83.96 | 42.86 | 1.12 | |
| Qwen3 Base (Reason)Backbone=Qwen32026.04 | 40.09 | 31.43 | 1.73 | |
| Qwen3 BaseBackbone=Qwen32026.04 | 29.55 | 40 | 1.87 |