Tool Use on ToolRL prompts (hold-out)
19Pre-Reconstruction Tool CorrectnessModel A (ToolRL)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Model A (ToolRL)Sample size=n = 48 crosscoders, Evaluation Prompts=100 hold-out prompts each2026.06 | 19 | 50.1 | 31.1 | 0.93 | — | |
| Model B (Base)Sample size=n = 48 crosscoders, Evaluation Prompts=100 hold-out prompts each2026.06 | 0 | 6.8 | 6.8 | 0.14 | 0 |