Prédiction de la Satisfaction Client pour les Parfums
Compléments de Mathématiques 2 – Introduction au Machine Learning
Introduction
Ce projet s’inscrit dans le cadre du cours de Compléments de Mathématiques 2 — Introduction au Machine Learning (L3 MIASHS, Université Grenoble Alpes).
Ce projet vise à prédire la satisfaction des consommateurs vis-à-vis des parfums à partir de leurs caractéristiques olfactives. À partir du jeu de données Fragrantica (~24 000 parfums, 14 variables), nous construisons une variable cible binaire (satisfaction Oui/Non) en seuillant la note moyenne à la médiane (3.97). Après une analyse exploratoire approfondie et un feature engineering basé sur 10 familles olfactives, nous entraînons quatre classifieurs — la régression logistique régularisée (Elastic Net/LASSO), l’arbre de décision élagué, la forêt aléatoire et le k plus proches voisins (kNN) — évalués par AUC sur validation croisée 5-fold. La forêt aléatoire obtient les meilleures performances (AUC test ≈ 0.69), suivie de la régression logistique (0.67), de l’arbre de décision et du kNN (0.65). Nous explorons également le Naive Bayes et le clustering K-means comme pistes complémentaires. Les résultats restent modestes, illustrant la difficulté de prédire une variable subjective à partir de descripteurs olfactifs seuls.
Contexte : le monde de la parfumerie
L’industrie de la parfumerie représente un marché mondial de plus de 50 milliards de dollars. Avant d’entrer dans l’analyse statistique, il est essentiel de comprendre le vocabulaire du domaine, car la parfumerie possède sa propre terminologie :
- Note olfactive : un ingrédient individuel perçu dans un parfum (ex. : bergamote, jasmin, musc). Chaque parfum est composé de dizaines de notes.
- Pyramide olfactive : structure en trois niveaux décrivant l’évolution temporelle d’un parfum :
- Notes de tête (Top) : premières perçues, volatiles, disparaissent en 15–30 min (agrumes, herbes fraîches).
- Notes de cœur (Middle) : le « caractère » du parfum, perceptibles pendant 2–4 h (floraux, épices).
- Notes de fond (Base) : les plus persistantes, durent 6–24 h (bois, musc, vanille).
- Accord : combinaison de plusieurs notes créant une impression olfactive cohérente (ex. : un accord « fruité » mêle bergamote, pêche et cassis). Un parfum possède typiquement 3 à 5 accords principaux.
- Famille olfactive : grande catégorie regroupant des accords similaires (ex. : florale, boisée, orientale). La classification en familles est standardisée par la Société Française des Parfumeurs.
La France occupe une place centrale dans cette industrie, avec Grasse (Alpes-Maritimes) comme capitale historique du parfum depuis le XVIIe siècle, et des maisons comme Chanel, Dior, Guerlain et Hermès.
Problématique
Avec l’essor des plateformes communautaires en ligne comme Fragrantica — le plus grand site mondial dédié à la parfumerie, rassemblant des millions d’avis d’utilisateurs —, il devient possible d’analyser les préférences olfactives à grande échelle. Notre objectif est de répondre à la question :
Peut-on prédire la satisfaction des consommateurs vis-à-vis d’un parfum à partir de ses caractéristiques olfactives ?
Plus précisément, nous souhaitons :
- Exploiter les variables de familles olfactives comme prédicteurs.
- Comparer quatre approches supervisées : régression logistique régularisée, arbre de décision, forêt aléatoire et k plus proches voisins.
- Évaluer honnêtement la performance de généralisation par validation croisée.
- Explorer des pistes complémentaires (Naive Bayes, clustering K-means) et justifier leur non-rétention.
Le jeu de données est librement téléchargeable sur Kaggle (Fragrantica Fragrance Dataset).
Plan du rapport
- Données et analyse exploratoire : présentation du dataset, valeurs manquantes, distributions univariées et bivariées.
- Feature engineering et préparation : regroupement des accords en 10 familles olfactives, encodage, partition stratifiée train/test.
- Régression logistique LASSO et arbre de décision : modèles linéaire régularisé et arbre élagué.
- Forêt aléatoire et k plus proches voisins : modèles non-linéaires (ensemble et instance-based).
- Comparaison, pistes et conclusion : courbes ROC comparées, Naive Bayes, clustering K-means, regard critique et perspectives.