Analyse prédictive de l'attrition des employés
Python, Machine Learning, Classification, Scikit-learn, Pandas, SHAP, Explainable AI, HR Analytics, Feature Engineering, GridSearchCV
Analyse prédictive de l'attrition des employés
Contexte
Dans le cadre d'un projet de Data Science appliqué aux Ressources Humaines (HR Analytics), j'ai développé un modèle de Machine Learning permettant de prédire le risque de démission des collaborateurs d'une ESN à partir de données RH, d'évaluations de performance et d'enquêtes de satisfaction.
L'objectif était d'identifier les principaux facteurs expliquant l'attrition afin d'aider les équipes RH à mettre en place des actions préventives pour améliorer la fidélisation des collaborateurs.
Objectifs
- Fusionner plusieurs sources de données RH.
- Réaliser une analyse exploratoire des données (EDA).
- Construire un modèle de classification prédictif.
- Gérer le déséquilibre des classes.
- Optimiser les performances du modèle.
- Expliquer les prédictions grâce à l'IA explicable (Explainable AI).
Architecture
SIRH
│
Évaluations annuelles
│
Enquête collaborateurs
│
▼
Fusion des données
│
▼
Analyse exploratoire (EDA)
│
▼
Préparation des données
│
▼
Feature Engineering
│
▼
Classification supervisée
│
▼
Optimisation (GridSearchCV)
│
▼
Interprétation avec SHAP
Technologies utilisées
- Python
- Pandas
- NumPy
- Scikit-learn
- SHAP
- Matplotlib
- Jupyter Notebook
Réalisations
Analyse exploratoire (EDA)
- Fusion de plusieurs jeux de données RH.
- Analyse des caractéristiques des employés.
- Comparaison entre employés restés et démissionnaires.
- Identification des tendances et facteurs potentiels d'attrition.
- Création de visualisations pour faciliter l'interprétation.
Préparation des données
- Nettoyage et harmonisation des données.
- Gestion des valeurs manquantes.
- Encodage des variables catégorielles.
- Sélection des variables pertinentes.
- Création des jeux d'entraînement et de test.
Feature Engineering
Création et transformation de variables afin d'améliorer les performances du modèle :
- ancienneté
- satisfaction collaborateur
- évaluations de performance
- rémunération
- poste occupé
- département
- variables catégorielles encodées
Modélisation
Comparaison de plusieurs modèles de classification :
- Dummy Classifier
- Régression Logistique
- Random Forest
- Gradient Boosting
Évaluation des performances à l'aide de plusieurs métriques adaptées au contexte métier.
Optimisation
- Validation croisée
- Fine-tuning avec GridSearchCV
- Gestion du déséquilibre des classes
- Ajustement du seuil de décision
- Comparaison des performances avant et après optimisation
IA explicable (Explainable AI)
Interprétation des prédictions grâce à SHAP :
- importance globale des variables
- Beeswarm Plot
- Permutation Importance
- explications individuelles avec Waterfall Plot
Cette approche permet d'expliquer précisément pourquoi un collaborateur présente un risque élevé de départ.
Compétences démontrées
Data Science
- Analyse exploratoire (EDA)
- Nettoyage de données
- Fusion de jeux de données
- Data Visualization
- Feature Engineering
Machine Learning
- Classification supervisée
- Validation croisée
- Fine-tuning
- Optimisation d'hyperparamètres
- Gestion du déséquilibre des classes
Explainable AI
- SHAP
- Feature Importance
- Permutation Importance
- Explications locales et globales
- Interprétation métier des modèles
Développement Python
- Pandas
- Scikit-learn
- Pipelines de traitement
- Organisation de notebooks
Analyse métier
- HR Analytics
- Identification des facteurs d'attrition
- Aide à la décision RH
- Restitution de résultats à un public non technique
Résultat
Ce projet m'a permis de développer un modèle prédictif capable d'estimer le risque d'attrition des collaborateurs tout en expliquant précisément les facteurs influençant chaque prédiction grâce aux techniques d'Explainable AI. Il illustre une démarche complète de Data Science, de l'intégration des données jusqu'à l'interprétation des résultats pour accompagner la prise de décision métier.
Compétences acquises
- Python
- Pandas
- NumPy
- Scikit-learn
- Machine Learning
- Classification
- HR Analytics
- Explainable AI
- SHAP
- Feature Engineering
- Data Cleaning
- EDA
- GridSearchCV
- Cross Validation
- Random Forest
- Gradient Boosting
- Logistic Regression
- Feature Importance
- Permutation Importance
- Jupyter Notebook