Autonomous LLM Fine-tuning on TOMG-Bench
68.1Validation ScoreTREX
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TREXResearcher Backend=Gemini 3 Pro, Base Model Scale=Qwen3-1.7B2026.04 | 68.1 | 68.1 | |
| Qwen3-235B-2507Model Category=Ref Model2026.04 | 64.2 | 64.2 | |
| TREXResearcher Backend=Qwen3-Next-80B-Thinking, Base Model Scale=Qwen3-1.7B2026.04 | 55.7 | 55.7 | |
| Qwen3-1.7BModel Category=Base Model2026.04 | 18.2 | 18.2 |