Regression on california (RMSE)
0.3964RMSETabR
Evaluation Results
| Method | Links | |
|---|---|---|
| TabREnsemble=true2026.05 | 0.3964 | |
| TabREnsemble=false2026.05 | 0.403 | |
| MNCAEnsemble=true2026.05 | 0.4231 | |
| MNCAEnsemble=false2026.05 | 0.4239 | |
| CatBoostEnsemble=true2026.05 | 0.4265 | |
| CatBoostEnsemble=false2026.05 | 0.4294 | |
| XGBoostEnsemble=true2026.05 | 0.4316 | |
| XGBoostEnsemble=false2026.05 | 0.4327 | |
| LightGBMEnsemble=true2026.05 | 0.4339 | |
| Excel∗Ensemble=true2026.05 | 0.435 | |
| LoMETabEnsemble=true2026.05 | 0.4351 | |
| LightGBMEnsemble=false2026.05 | 0.4352 | |
| TabMEnsemble=true2026.05 | 0.4402 | |
| LoMETabEnsemble=false2026.05 | 0.4411 | |
| TabMEnsemble=false2026.05 | 0.4414 | |
| T2GEnsemble=true2026.05 | 0.4462 | |
| MLP‡Ensemble=true2026.05 | 0.4482 | |
| AutoIntEnsemble=true2026.05 | 0.449 | |
| MLP†Ensemble=true2026.05 | 0.4491 | |
| MLP-MixerEnsemble=true2026.05 | 0.4509 | |
| FT-TEnsemble=true2026.05 | 0.4515 | |
| MLP†Ensemble=false2026.05 | 0.453 | |
| Excel∗Ensemble=false2026.05 | 0.4544 | |
| MLP‡−liteEnsemble=true2026.05 | 0.4549 | |
| TromptEnsemble=false2026.05 | 0.4579 | |
| MLP‡Ensemble=false2026.05 | 0.4597 | |
| FT-TEnsemble=false2026.05 | 0.4635 | |
| T2GEnsemble=false2026.05 | 0.464 | |
| MLP‡−liteEnsemble=false2026.05 | 0.4652 | |
| SAINTEnsemble=false2026.05 | 0.468 | |
| AutoIntEnsemble=false2026.05 | 0.4682 | |
| MLP-MixerEnsemble=false2026.05 | 0.4746 | |
| DCN2Ensemble=true2026.05 | 0.4779 | |
| ResNetEnsemble=true2026.05 | 0.4862 | |
| MLPEnsemble=true2026.05 | 0.488 | |
| ResNetEnsemble=false2026.05 | 0.4915 | |
| SNNEnsemble=true2026.05 | 0.4933 | |
| MLPEnsemble=false2026.05 | 0.4948 | |
| DCN2Ensemble=false2026.05 | 0.4971 | |
| SNNEnsemble=false2026.05 | 0.5033 | |
| Llama 3.1-8BEvaluation Protocol=Tri-level Reasoning2026.06 | 1.12 | |
| Llama 3.1-8BEvaluation Protocol=Zero-shot2026.06 | 3.02 | |
| TabPFN(v2.0)2026.06 | 39,434.4 | |
| TabPFN(v2.5)2026.06 | 40,231 | |
| CatBoost2026.06 | 42,654.1 | |
| XGBoost2026.06 | 43,253.8 | |
| TabM2026.06 | 48,855.8 | |
| GPT-OSS-120BEvaluation Protocol=Tri-level Reasoning2026.06 | 62,906.6 | |
| Qwen3-8BEvaluation Protocol=Tri-level Reasoning2026.06 | 65,660.6 | |
| Gemma 3-12BEvaluation Protocol=Tri-level Reasoning2026.06 | 70,633.5 | |
| Qwen3-Next-80BEvaluation Protocol=Tri-level Reasoning2026.06 | 73,383.1 | |
| GPT-OSS-20BEvaluation Protocol=Tri-level Reasoning2026.06 | 75,992.7 | |
| TLRDBackbone=Gemma 3-12B, Teacher Model=GPT-OSS-120B, Evaluation Protocol=Fine-tuned2026.06 | 85,646.6 | |
| TLRDBackbone=Qwen3-8B, Teacher Model=GPT-OSS-120B, Evaluation Protocol=Fine-tuned2026.06 | 86,341.3 | |
| TLRDBackbone=Llama 3.1-8B, Teacher Model=GPT-OSS-120B, Evaluation Protocol=Fine-tuned2026.06 | 86,572.7 | |
| TLRDBackbone=Qwen3-8B, Teacher Model=Qwen3-Next-80B, Evaluation Protocol=Fine-tuned2026.06 | 91,877.5 | |
| TLRDBackbone=Gemma 3-12B, Teacher Model=Qwen3-Next-80B, Evaluation Protocol=Fine-tuned2026.06 | 96,473.5 | |
| TLRDBackbone=Llama 3.1-8B, Teacher Model=Qwen3-Next-80B, Evaluation Protocol=Fine-tuned2026.06 | 112,008 | |
| GPT-OSS-120BEvaluation Protocol=Zero-shot2026.06 | 114,749.6 | |
| Qwen3-8BEvaluation Protocol=Zero-shot2026.06 | 175,459.5 | |
| GPT-OSS-20BEvaluation Protocol=Zero-shot2026.06 | 201,829.8 | |
| Qwen3-Next-80BEvaluation Protocol=Zero-shot2026.06 | 333,534.9 | |
| Gemma 3-12BEvaluation Protocol=Zero-shot2026.06 | 568,304.3 |