Qu'est-ce que le clustering hiérarchique?
Le clustering hiérarchique créé une hiérarchie de clusters, représentée par un arbre appelé dendrogramme.
Deux approches:
- Agglomérative (bottom-up): Chaque point est un cluster, on fusionne iterativement
- Divisive (top-down): Tous les points forment un cluster, on divise iterativement
L'approche agglomérative est la plus courante.
Algorithme agglomératif:
- Chaque point = 1 cluster
- Trouver les 2 clusters les plus proches
- Les fusionner en 1 cluster
- Répéter jusqu'à n'avoir qu'un seul cluster
Avantages:
- Pas besoin de spécifier k à l'avance
- Dendrogramme visualise la structure à tous les niveaux
- Pas d'initialisation aléatoire (déterministe)
Inconvénients:
- Complexité O(n^3) en mémoire et temps
- Pas adapte aux très grands datasets (>10K points)
- Une fusion ne peut pas être défaite