Agent Monitoring on CUA-SHADE-Arena (test)
89.1AccuracyAgent-ToM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Agent-ToMVariant=external memory, Stage=Stage 1–22026.05 | 89.1 | 83.1 | 71 | 100 | |
| LLM-JudgeArchitecture=Single-Pass Monitoring, Setting=zeroshot2026.05 | 88.3 | 81.5 | 68.8 | 100 | |
| Sequential EnsembleArchitecture=Ensemble-based Monitoring2026.05 | 86.6 | 80.5 | 73.3 | 89.1 | |
| Agent-ToMVariant=Prompt-level learning2026.05 | 84 | 74 | 60 | 96 | |
| ToMArchitecture=Structured Multi-Stage Monitoring, Setting=zeroshot2026.05 | 80.8 | 66.6 | 51 | 95.8 | |
| Agent-ToMVariant=external memory, Stage=Stage 12026.05 | 79.2 | 61.5 | 44.4 | 100 | |
| Async EnsembleArchitecture=Ensemble-based Monitoring, Configuration=Majority Vote2026.05 | 56.3 | 60.6 | 90 | 45.4 |