K-Means vs DBSCAN
K-Means fonctionne bien pour des clusters sphériques de taille similaire. Mais que faire si:
- Les clusters ont des formes irrégulières?
- Il y a des outliers/anomalies?
- On ne connaît pas le nombre de clusters?
DBSCAN (Density-Based Spatial Clustering of Applications with Noise) résout ces problèmes!
Concepts clés:
- Epsilon (eps): Rayon de voisinage
- Min_samples: Minimum de voisins pour être un "core point"
- Core point: Point avec >= min_samples voisins dans son eps
- Border point: Point dans le voisinage d'un core point
- Noise point: Ni core ni border (outlier!)
Avantages:
- Détecte automatiquement le nombre de clusters
- Trouve des clusters de formes arbitraires
- Identifie les outliers
- Pas besoin de spécifier k
Inconvénients:
- Difficulté avec des densités variables
- Sensible aux paramètres eps et min_samples