Comparative empirical forecasting on Cross-Domain CD (test)
82.99Overall Consistency RateGPT-5 High
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5 HighBackbone=GPT-5, Variant=High2026.04 | 82.99 | 43.48 | 1.77 | |
| GPT-5 MediumBackbone=GPT-5, Variant=Medium2026.04 | 81.48 | 34.78 | 1.78 | |
| Qwen3 Reason-SFT-DrGRPOBackbone=Qwen32026.04 | 80.25 | 41.3 | 1.65 | |
| Qwen3 Direct-SFTBackbone=Qwen32026.04 | 79.84 | 31.82 | 1.96 | |
| GPT-5 LowBackbone=GPT-5, Variant=Low2026.04 | 77.5 | 36.96 | 1.76 | |
| Qwen3 Reason-SFT-DAPOBackbone=Qwen32026.04 | 77.37 | 28.89 | 1.73 | |
| Qwen3 Reason-DAPOBackbone=Qwen32026.04 | 76.95 | 33.33 | 1.83 | |
| Qwen3 Synthetic-Reason-SFT-DAPOBackbone=Qwen32026.04 | 71.74 | 36.36 | 1.8 | |
| Qwen3 Base (Reason)Backbone=Qwen32026.04 | 19.34 | 28.21 | 1.87 | |
| Qwen3 BaseBackbone=Qwen32026.04 | 5.35 | 38.46 | 2.45 |