Deduplication on Simulated CRM Dataset 1000-row (test)
100PrecisionBaseline (String Match)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Baseline (String Match)Algorithm=Levenshtein string similarity (SequenceMatcher), Input Fields=customer_name and customer_city, Similarity Threshold=≥ 0.852026.03 | 100 | 29 | 45 | |
| Late-Fusion Multimodal AI FrameworkSemantic Embedding=DistilBERT, Modality Fusion=Late Fusion, Clustering Algorithm=DBSCAN, DBSCAN epsilon=0.3, DBSCAN min_samples=22026.03 | 49.99 | 99.5 | 66.5 |