Tool-use runtime evaluation on Nemotron replay (held-out)
78.6Step AccuracyGPT-OSS
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GPT-OSSModel=GPT-OSS, Episodes=7602026.05 | 78.6 | 34.2 | 7.7 | 90.8 | 75.5 | 62.5 | 0.72 | 66.6 |
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GPT-OSSModel=GPT-OSS, Episodes=7602026.05 | 78.6 | 34.2 | 7.7 | 90.8 | 75.5 | 62.5 | 0.72 | 66.6 |