Crash-severity assessment on CPSRMS
0.746AccuracyTransportAgent
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TransportAgentBackbone=GPT-3.5-turbo, Method Category=Hybrid LLM-ML Agent Framework2026.01 | 0.746 | 0.599 | |
| TransportAgentBackbone LLM=GPT4o-mini, Number of samples=15552026.01 | 0.7267 | 0.686 | |
| AutoGenBackbone LLM=GPT4o-mini, Number of samples=15552026.01 | 0.675 | 0.588 | |
| AutoGenBackbone=GPT-3.5-turbo, Method Category=Augmented LLM-based Reasoning2026.01 | 0.6656 | 0.467 | |
| CoTBackbone LLM=GPT4o-mini, Number of samples=15552026.01 | 0.6592 | 0.6465 | |
| OlogitMethod Category=Traditional Econometric Model2026.01 | 0.646 | 0.419 | |
| OlogitBackbone LLM=N/A, Number of samples=15552026.01 | 0.646 | 0.419 | |
| 1 k-shot (vanilla LLM)Backbone LLM=GPT4o-mini, Number of samples=15552026.01 | 0.643 | 0.6704 | |
| CoTBackbone=GPT-3.5-turbo, Reasoning Strategy=Chain-of-Thought, Method Category=Pure LLM-based Reasoning2026.01 | 0.6238 | 0.5764 | |
| 1 k-shot (vanilla LLM)Backbone=GPT-3.5-turbo, Reasoning Strategy=1 k-shot, Method Category=Pure LLM-based Reasoning2026.01 | 0.5531 | 0.5281 | |
| MLPMethod Category=Traditional ML Models2026.01 | 0.193 | 0.081 | |
| MLP + feature selectionMethod Category=Traditional ML Models, Feature Selection=true2026.01 | 0.193 | 0.081 | |
| MLPBackbone LLM=N/A, Number of samples=15552026.01 | 0.193 | 0.081 | |
| MLP + feature selectionBackbone LLM=N/A, Number of samples=15552026.01 | 0.193 | 0.081 |