Single Task Processing on VoxMind Agentic Core Capabilities Dataset
98.5Task Success (TS)VoxMind
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VoxMind2026.04 | 98.5 | 72.18 | |
| Qwen3-8B+WhisperModel Category=Open-source models, Architecture=Cascaded models, Inference Mode=direct inference with prompt2026.04 | 94.99 | 68.42 | |
| Gemini-2.5-flashModel Category=Closed-source models, Inference Mode=direct inference with prompt2026.04 | 92.48 | 77.44 | |
| Gemini-2.5-proModel Category=Closed-source models, Inference Mode=direct inference with prompt2026.04 | 90.98 | 75.19 | |
| GPT-4o-audioModel Category=Closed-source models, Inference Mode=direct inference with prompt2026.04 | 85.71 | 70.68 | |
| Qwen2.5-OmniModel Category=Open-source models, Architecture=End-to-end models, Inference Mode=direct inference with prompt2026.04 | 78.7 | 35.84 | |
| StepAudio2Model Category=Open-source models, Architecture=End-to-end models, Inference Mode=direct inference with prompt2026.04 | 78.7 | 48.87 | |
| Kimi-AudioModel Category=Open-source models, Architecture=End-to-end models, Inference Mode=direct inference with prompt2026.04 | 78.45 | 56.89 |