Agent performance evaluation on Harness-Bench
74.6Combined ScoreFairyClaw
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FairyClawModel=gpt-5.4, Tasks=752026.05 | 74.6 | 3.51 | 46.8 | |
| MoltisModel=gpt-5.4, Tasks=752026.05 | 74.4 | 6.29 | 83.8 | |
| HermesModel=gpt-5.4, Tasks=752026.05 | 74 | 7.28 | 97 | |
| OpenClawModel=gpt-5.4, Tasks=752026.05 | 69.3 | 6.03 | 80.4 | |
| OpenClawModel=gemini-3.1-pro, Tasks=752026.05 | 68.9 | 6.58 | 87.7 | |
| NullClawModel=gpt-5.4, Tasks=752026.05 | 68.5 | 8.16 | 108.9 | |
| NullClawModel=gemini-3.1-pro, Tasks=752026.05 | 64.5 | 12.7 | 169.3 | |
| MoltisModel=gemini-3.1-pro, Tasks=752026.05 | 64.3 | 6.27 | 83.6 | |
| FairyClawModel=gemini-3.1-pro, Tasks=752026.05 | 63.5 | 3.84 | 51.2 | |
| HermesModel=gemini-3.1-pro, Tasks=752026.05 | 62.2 | 6.21 | 82.8 | |
| ZeroClawModel=gpt-5.4, Tasks=752026.05 | 58.7 | 6.09 | 81.2 | |
| ZeroClawModel=gemini-3.1-pro, Tasks=752026.05 | 50.6 | 4.86 | 64.8 |