Multilingual Understanding on Multilingual A
98.47AccuracyBenchmark Agent
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Benchmark Agentevaluation_type=Human & LLM-as-Judge Quality Eval, backbone=GPT-5.12026.06 | 98.47 | 81.48 | 95.21 | 95.83 | 89.35 | 69.44 | 41.05 | 78.5 | — | — | — | — |