Audio Preference Evaluation on Audio-HH
66.8AccuracyOmni-RRM
Evaluation Results
| Method | Links | |
|---|---|---|
| Omni-RRMModel Scale=7B, Training Stage=sft+rl, Rationale Supervision=yes2026.01 | 66.8 | |
| Gemini-2.5-Pro2026.01 | 66.5 | |
| Omni-RRMModel Scale=3B, Training Stage=sft+rl, Rationale Supervision=yes2026.01 | 65.1 | |
| Omni-RMModel Scale=7B, Training Stage=sft+rl, Rationale Supervision=no2026.01 | 64.3 | |
| Omni-RMModel Scale=3B, Training Stage=sft+rl, Rationale Supervision=no2026.01 | 63.8 | |
| Omni-RRMModel Scale=7B, Training Stage=sft, Rationale Supervision=yes2026.01 | 62.8 | |
| Qwen2.5-OmniModel Scale=7B2026.01 | 62.4 | |
| Omni-RRMModel Scale=3B, Training Stage=sft, Rationale Supervision=yes2026.01 | 60.3 | |
| Gemini-2.0-Flash2026.01 | 60.1 | |
| Qwen2.5-OmniModel Scale=3B2026.01 | 58.7 | |
| GPT-4o-mini2026.01 | 58.2 |