Health Reasoning on LifeAgentBench
57.02AccuracyGPT-4o
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4oPrompting Setting=CP2026.01 | 57.02 | — | — | — | |
| Gemini 2.5 LitePrompting Setting=CP2026.01 | 44.81 | — | — | — | |
| Llama-3.1-70BPrompting Setting=CP2026.01 | 40.51 | — | — | — | |
| Qwen-2.5-7BPrompting Setting=CP2026.01 | 40.45 | — | — | — | |
| Gemini 2.5 LitePrompting Setting=DP2026.01 | 39.04 | 84.84 | 45.97 | 82.92 | |
| Claude-3-haikuPrompting Setting=CP2026.01 | 35.3 | — | — | — | |
| GPT-4oPrompting Setting=DP2026.01 | 34.71 | 63.85 | 35.97 | 95.65 | |
| Mistral-v0.3-7BPrompting Setting=CP2026.01 | 30.97 | — | — | — | |
| Claude-3-haikuPrompting Setting=DP2026.01 | 29.3 | 74.06 | 36.49 | 75.71 | |
| gemma-2-IT-9BPrompting Setting=CP2026.01 | 24.44 | — | — | — | |
| Llama-3.1-8BPrompting Setting=DP2026.01 | 21.53 | 63.33 | 27.25 | 77.73 | |
| Qwen-2.5-7BPrompting Setting=DP2026.01 | 21.45 | 55.83 | 24.71 | 84.78 | |
| Llama-3.1-8BPrompting Setting=CP2026.01 | 20.65 | — | — | — | |
| Phi-3.5-mini-3.8BPrompting Setting=CP2026.01 | 20.57 | — | — | — | |
| Llama-3.2-3BPrompting Setting=CP2026.01 | 20.18 | — | — | — | |
| Phi-3.5-mini-3.8BPrompting Setting=DP2026.01 | 16.16 | 56.67 | 20.23 | 77.34 | |
| gemma-2-IT-9BPrompting Setting=DP2026.01 | 14.54 | 56.24 | 27.85 | 51.15 | |
| Llama-3.1-70BPrompting Setting=DP2026.01 | 13.91 | 45.77 | 22.73 | 58.41 | |
| Llama-3.2-3BPrompting Setting=DP2026.01 | 13.47 | 47.29 | 17.99 | 67.68 | |
| Mistral-v0.3-7BPrompting Setting=DP2026.01 | 9.03 | 28.46 | 11.48 | 75.35 | |
| deepseek-coder-1.3BPrompting Setting=DP2026.01 | 1.26 | 43.83 | 14.62 | 4 | |
| deepseek-coder-1.3BPrompting Setting=CP2026.01 | 1.09 | — | — | — |