Best-action selection on Target n=30 (test)
65.9Macro F1Gemini 2.5 Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 2.5 FlashState Conditioning=Oracle2026.06 | 65.9 | |
| PIWM (full)State Conditioning=Oracle2026.06 | 64.1 | |
| GPT-5.5Interface=Codex CLI, Protocol=diagnostic, State Conditioning=Oracle2026.06 | 62.2 | |
| Claude Sonnet 4.6State Conditioning=Oracle2026.06 | 57.9 | |
| GPT-4oState Conditioning=Oracle2026.06 | 44.5 | |
| Random BaselineState Conditioning=Oracle2026.06 | 41.4 | |
| Random BaselineState Conditioning=E2E2026.06 | 41.4 | |
| Small-Scale Action TrainingState Conditioning=Oracle2026.06 | 39 | |
| GPT-4oState Conditioning=E2E2026.06 | 35.4 | |
| Qwen2.5-VL-7BProtocol=zero-shot, State Conditioning=Oracle2026.06 | 31.3 | |
| PIWM (full)State Conditioning=E2E2026.06 | 29.5 | |
| Claude Sonnet 4.6State Conditioning=E2E2026.06 | 29.4 | |
| State-Outcome ModelState Conditioning=Oracle2026.06 | 24 | |
| Gemini 2.5 FlashState Conditioning=E2E2026.06 | 21.6 | |
| Constant-Action BaselinesState Conditioning=Oracle2026.06 | 6.7 |