Decision-level NLL prediction on Two-step task
0.0282Delta NLL (vs Centaur)Llama Maverick
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Llama MaverickFramework=RAG, Backbone=Llama 4 Maverick2026.04 | 0.0282 | 0.0947 | 0.0887 | 10 | 0.0667 | 10 | |
| GPT-4oFramework=RAG, Backbone=GPT-4o2026.04 | 0.0371 | 0.0462 | 0.0799 | 10 | 0.0579 | 10 | |
| GPT-5.1Framework=RAG, Backbone=GPT-5.12026.04 | 0.0378 | 0.0441 | 0.0792 | 10 | 0.0572 | 10 | |
| Gemini-2.5 ProFramework=RAG, Backbone=Gemini-2.5 Pro2026.04 | 0.0415 | 0.0275 | 0.0755 | 10 | 0.0535 | 10 | |
| DeepSeek-R1Framework=RAG, Backbone=DeepSeek-R12026.04 | 0.0583 | 0.0024 | 0.0586 | 2.23 | 0.0366 | 7.61 |