Tabular Regression on Diamonds
3.64RMSELlama 3.1-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama 3.1-8BEvaluation Protocol=Zero-shot2026.06 | 3.64 | |
| TabPFN(v2.5)2026.06 | 496 | |
| CatBoost2026.06 | 502.6 | |
| TabPFN(v2.0)2026.06 | 505.7 | |
| TabM2026.06 | 519.7 | |
| XGBoost2026.06 | 527.7 | |
| GPT-OSS-120BEvaluation Protocol=Tri-level Reasoning2026.06 | 649.7 | |
| Qwen3-8BEvaluation Protocol=Tri-level Reasoning2026.06 | 691 | |
| Qwen3-Next-80BEvaluation Protocol=Tri-level Reasoning2026.06 | 698.4 | |
| GPT-OSS-20BEvaluation Protocol=Tri-level Reasoning2026.06 | 705.1 | |
| TLRDBackbone=Gemma 3-12B, Teacher Model=GPT-OSS-120B, Evaluation Protocol=Fine-tuned2026.06 | 945.9 | |
| Gemma 3-12BEvaluation Protocol=Tri-level Reasoning2026.06 | 1,044.9 | |
| TLRDBackbone=Gemma 3-12B, Teacher Model=Qwen3-Next-80B, Evaluation Protocol=Fine-tuned2026.06 | 1,060.4 | |
| Qwen3-Next-80BEvaluation Protocol=Zero-shot2026.06 | 1,289.5 | |
| TLRDBackbone=Qwen3-8B, Teacher Model=GPT-OSS-120B, Evaluation Protocol=Fine-tuned2026.06 | 1,316.6 | |
| TLRDBackbone=Qwen3-8B, Teacher Model=Qwen3-Next-80B, Evaluation Protocol=Fine-tuned2026.06 | 1,326.1 | |
| TLRDBackbone=Llama 3.1-8B, Teacher Model=Qwen3-Next-80B, Evaluation Protocol=Fine-tuned2026.06 | 1,453.7 | |
| TLRDBackbone=Llama 3.1-8B, Teacher Model=GPT-OSS-120B, Evaluation Protocol=Fine-tuned2026.06 | 1,531.9 | |
| Llama 3.1-8BEvaluation Protocol=Tri-level Reasoning2026.06 | 2,193.4 | |
| Qwen3-8BEvaluation Protocol=Zero-shot2026.06 | 2,280.9 | |
| GPT-OSS-20BEvaluation Protocol=Zero-shot2026.06 | 2,477.1 | |
| Gemma 3-12BEvaluation Protocol=Zero-shot2026.06 | 2,589.5 | |
| GPT-OSS-120BEvaluation Protocol=Zero-shot2026.06 | 2,632.1 |