Real-LLM
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Real-LLM 8 targets × 3 phrasings full stack late 2025/2026 (val)
88ISR (Attack-Induced)
14
Real-LLM 8 targets × 3 phrasings full stack late 2025/2026 (val)
0Attack-Induced ISR
14
combined real-LLM corpus
-10Mean Difference (Delta)
6
Real-LLM pacing benchmark GPT-4.1 (15 episodes (5 × 3 seeds))
100Success Rate
4