Autonomous LLM training on PostTrainBench
63.75ScoreInstruct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InstructHarness=Instruct, Base Model=Qwen3-4B2026.06 | 63.75 | — | |
| InstructHarness=Instruct, Base Model=Qwen3-1.7B2026.06 | 49.41 | — | |
| InstructHarness=Instruct, Base Model=Gemma-4B2026.06 | 46.58 | — | |
| InstructHarness=Instruct, Base Model=SmolLM-3B2026.06 | 44.81 | — | |
| AutoTrainess w/ GPT-5.4 (Codex)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=Qwen3-4B2026.06 | 32.6 | — | |
| CLI-only w/ GPT-5.4 (Codex)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=Qwen3-4B2026.06 | 27.09 | — | |
| AutoTrainess w/ GPT-5.4 (OpenCode)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=Qwen3-4B2026.06 | 25.91 | — | |
| AutoTrainess w/ GPT-5.4 (Codex)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=Qwen3-1.7B2026.06 | 25.67 | — | |
| AutoTrainess w/ GPT-5.4 (Codex)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=SmolLM-3B2026.06 | 25.6 | — | |
| CLI-only w/ GPT-5.4 (Codex)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=Gemma-4B2026.06 | 24.88 | — | |
| AutoTrainess w/ GPT-5.4 (OpenCode)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=SmolLM-3B2026.06 | 24.2 | — | |
| AutoTrainess w/ DeepSeek-V4-Flash (OpenCode)Harness=AutoTrainess, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=Gemma-4B2026.06 | 24.01 | — | |
| CLI-only w/ GPT-5.4 (Codex)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=SmolLM-3B2026.06 | 23.96 | — | |
| AutoTrainess w/ GPT-5.4 (Codex)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=Gemma-4B2026.06 | 23.88 | — | |
| CLI-only w/ GPT-5.4 (OpenCode)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=Gemma-4B2026.06 | 22.32 | — | |
| AutoTrainess w/ GPT-5.4 (OpenCode)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=Qwen3-1.7B2026.06 | 22.08 | — | |
| AutoTrainess w/ DeepSeek-V4-Flash (OpenCode)Harness=AutoTrainess, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=Qwen3-4B2026.06 | 21.76 | — | |
| AutoTrainess w/ GPT-5.4 (OpenCode)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=Gemma-4B2026.06 | 21.2 | — | |
| CLI-only w/ GPT-5.4 (OpenCode)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=Qwen3-1.7B2026.06 | 20.01 | — | |
| CLI-only w/ GPT-5.4 (OpenCode)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=SmolLM-3B2026.06 | 19.51 | — | |
| CLI-only w/ GPT-5.4 (OpenCode)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=OpenCode, Base Model=Qwen3-4B2026.06 | 17.01 | — | |
| CLI-only w/ GPT-5.4 (Codex)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=Codex, Base Model=Qwen3-1.7B2026.06 | 16.9 | — | |
| AutoTrainess w/ DeepSeek-V4-Flash (OpenCode)Harness=AutoTrainess, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=Qwen3-1.7B2026.06 | 16.72 | — | |
| AutoTrainess w/ DeepSeek-V4-Flash (OpenCode)Harness=AutoTrainess, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=SmolLM-3B2026.06 | 15.82 | — | |
| CLI-only w/ DeepSeek-V4-Flash (OpenCode)Harness=CLI-only, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=Qwen3-4B2026.06 | 15.18 | — | |
| CLI-only w/ DeepSeek-V4-Flash (OpenCode)Harness=CLI-only, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=SmolLM-3B2026.06 | 14.77 | — | |
| BaseHarness=Base, Base Model=Qwen3-4B2026.06 | 14.34 | — | |
| CLI-only w/ DeepSeek-V4-Flash (OpenCode)Harness=CLI-only, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=Gemma-4B2026.06 | 10.43 | — | |
| CLI-only w/ DeepSeek-V4-Flash (OpenCode)Harness=CLI-only, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode, Base Model=Qwen3-1.7B2026.06 | 8.14 | — | |
| BaseHarness=Base, Base Model=Qwen3-1.7B2026.06 | 6.66 | — | |
| BaseHarness=Base, Base Model=Gemma-4B2026.06 | 4.6 | — | |
| BaseHarness=Base, Base Model=SmolLM-3B2026.06 | 4.52 | — | |
| AutoTrainess w/ DeepSeek-V4-Flash (OpenCode)Harness=AutoTrainess, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode2026.06 | — | 19.58 | |
| AutoTrainess w/ GPT-5.4 (Codex)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=Codex2026.06 | — | 26.94 | |
| AutoTrainess w/ GPT-5.4 (OpenCode)Harness=AutoTrainess, Agent Backbone=GPT-5.4, Scaffold=OpenCode2026.06 | — | 23.35 | |
| BaseHarness=Base2026.06 | — | 7.53 | |
| CLI-only w/ DeepSeek-V4-Flash (OpenCode)Harness=CLI-only, Agent Backbone=DeepSeek-V4-Flash, Scaffold=OpenCode2026.06 | — | 12.13 | |
| CLI-only w/ GPT-5.4 (Codex)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=Codex2026.06 | — | 23.21 | |
| CLI-only w/ GPT-5.4 (OpenCode)Harness=CLI-only, Agent Backbone=GPT-5.4, Scaffold=OpenCode2026.06 | — | 19.71 | |
| InstructHarness=Instruct2026.06 | — | 51.14 |