Contextual Planning on VoxMind Agentic Core Capabilities Dataset
86.99TSGemini-2.5-flash
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5-flashModel Category=Closed-source models, Inference Mode=direct inference with prompt2026.04 | 86.99 | 65.75 | |
| Gemini-2.5-proModel Category=Closed-source models, Inference Mode=direct inference with prompt2026.04 | 84.25 | 61.64 | |
| Qwen3-8B+WhisperModel Category=Open-source models, Architecture=Cascaded models, Inference Mode=direct inference with prompt2026.04 | 84.25 | 47.72 | |
| VoxMind2026.04 | 80.82 | 62.33 | |
| Kimi-AudioModel Category=Open-source models, Architecture=End-to-end models, Inference Mode=direct inference with prompt2026.04 | 76.03 | 46.8 | |
| GPT-4o-audioModel Category=Closed-source models, Inference Mode=direct inference with prompt2026.04 | 71.23 | 49.32 | |
| Qwen2.5-OmniModel Category=Open-source models, Architecture=End-to-end models, Inference Mode=direct inference with prompt2026.04 | 65.75 | 26.03 | |
| StepAudio2Model Category=Open-source models, Architecture=End-to-end models, Inference Mode=direct inference with prompt2026.04 | 4.34 | 1.6 |