Crash-severity assessment on NEISS Subset
73.75AccuracyTransportAgent
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TransportAgentBackbone=Llama-3.3-70B-Instruct, Samples=3972026.01 | 73.75 | 0.594 | |
| TransportAgentBackbone LLM=GPT4o-mini, Number of samples=3972026.01 | 71.25 | 0.544 | |
| TransportAgentBackbone=GPT-3.5-turbo, Method Category=Hybrid LLM-ML Agent Framework2026.01 | 67.5 | 0.504 | |
| OlogitMethod Category=Traditional Econometric Model2026.01 | 66.2 | 0.204 | |
| OlogitSamples=3972026.01 | 66.2 | 0.204 | |
| OlogitBackbone LLM=N/A, Number of samples=3972026.01 | 66.2 | 0.204 | |
| MLPMethod Category=Traditional ML Models2026.01 | 63.7 | 0.46 | |
| MLPSamples=3972026.01 | 63.7 | 0.46 | |
| MLPBackbone LLM=N/A, Number of samples=3972026.01 | 63.7 | 0.46 | |
| MLP + feature selectionMethod Category=Traditional ML Models, Feature Selection=true2026.01 | 61.2 | 0.311 | |
| MLP + feature selectionSamples=3972026.01 | 61.2 | 0.311 | |
| MLP + feature selectionBackbone LLM=N/A, Number of samples=3972026.01 | 61.2 | 0.311 | |
| AutoGenBackbone=GPT-3.5-turbo, Method Category=Augmented LLM-based Reasoning2026.01 | 37.53 | 0.285 | |
| CoTBackbone=GPT-3.5-turbo, Reasoning Strategy=Chain-of-Thought, Method Category=Pure LLM-based Reasoning2026.01 | 36.25 | 0.4358 | |
| AutoGenBackbone LLM=GPT4o-mini, Number of samples=3972026.01 | 34.51 | 0.354 | |
| CoTBackbone LLM=GPT4o-mini, Number of samples=3972026.01 | 32.5 | 0.4298 | |
| CoTBackbone=Llama-3.3-70B-Instruct, Samples=3972026.01 | 25 | 0.3896 | |
| 1 k-shot (vanilla LLM)Backbone=GPT-3.5-turbo, Reasoning Strategy=1 k-shot, Method Category=Pure LLM-based Reasoning2026.01 | 22.5 | 0.3028 | |
| 1 k-shot (vanilla LLM)Backbone LLM=GPT4o-mini, Number of samples=3972026.01 | 22.5 | 0.3705 | |
| k-shot (vanilla LLM)Backbone=Llama-3.3-70B-Instruct, Shots=1-shot, Samples=3972026.01 | 17.5 | 0.3376 |