Ground Truth Alignment and Conversationality on Curated Agricultural Dataset (test)
58.7RecallGPT-4o FT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-4o FTFine-tuning status=Fine-Tuned, Training samples=130k2026.02 | 58.7 | 54.9 | 56.7 | 90.9 | — | |
| GPT-4o FTFine-tuning status=Fine-Tuned, Training samples=12k2026.02 | 51.1 | 52.2 | 51.7 | 88.8 | 4.58 | |
| GPT-4o Mini FTFine-tuning status=Fine-Tuned, Training samples=12k2026.02 | 50.3 | 53.3 | 51.8 | 87.5 | — | |
| GPT-4o Mini FTFine-tuning status=Fine-Tuned, Training samples=130k2026.02 | 43.8 | 66.2 | 52.7 | 91.6 | 4.62 | |
| Gemini 1.5 ProFine-tuning status=Baseline2026.02 | 42.1 | 56.2 | 48.2 | 92.6 | — | |
| Gemma 2 27BFine-tuning status=Baseline2026.02 | 35.7 | 38.4 | 37 | 93.2 | — | |
| Gemma 2 9BFine-tuning status=Baseline2026.02 | 32.2 | 49.6 | 39.1 | 90.1 | 4.21 | |
| GPT-4oFine-tuning status=Baseline2026.02 | 28.5 | 64.9 | 39.6 | 95.8 | 3.95 | |
| GPT-4Fine-tuning status=Baseline2026.02 | 26.6 | 62.2 | 37.3 | 96.9 | 4.01 | |
| GPT-4o MiniFine-tuning status=Baseline2026.02 | 26.2 | 64.3 | 37.2 | 94.4 | 3.98 | |
| Llama 3.3 70BFine-tuning status=Baseline2026.02 | 24.1 | 58.9 | 34.2 | 90 | — | |
| Qwen 3 235BFine-tuning status=Baseline2026.02 | 19.2 | 31.3 | 23.8 | 55.9 | — | |
| Kimi K2Fine-tuning status=Baseline2026.02 | 18.7 | 27.1 | 22.1 | 50.2 | — | |
| Llama 3 8B FTFine-tuning status=Fine-Tuned, Training samples=12k2026.02 | 15.1 | 84.3 | 25.6 | 91.8 | 3.89 | |
| Llama 3 8BFine-tuning status=Baseline2026.02 | 13.4 | 94.2 | 23.5 | 98.3 | 3.72 |