Retour aux Projets académiques

Labellisation et apprentissage semi-supervisé sur des images médicales (IRM cérébrales)

Python, Computer Vision, Deep Learning, Semi-Supervised Learning, Clustering, PyTorch, Scikit-learn, ResNet, Healthcare AI

Labellisation et Apprentissage Semi-Supervisé pour la Détection de Tumeurs Cérébrales

Présentation

Ce projet met en œuvre une exploration analytique complète d'un jeu de données médical majoritairement non labellisé, dans le cadre d'un projet R&D de détection automatisée de tumeurs du cerveau à partir d'IRM. L'objectif est de tirer parti d'un large volume d'images non annotées et d'un sous-ensemble restreint de labels experts pour construire un pipeline de labellisation faible puis un modèle de classification semi-supervisé.

Le projet applique les bonnes pratiques du Computer Vision et de l'apprentissage semi-supervisé afin de maximiser la valeur d'un dataset partiellement labellisé, tout en évaluant la faisabilité budgétaire d'un passage à l'échelle sur plusieurs millions d'images.


Objectifs


Compétences démontrées

Exploration et préparation des données


Extraction de features par transfer learning


Clustering et labellisation faible


Apprentissage semi-supervisé


Analyse de faisabilité et recommandations


Architecture

        Dataset IRM (majorité non labellisée
         + sous-ensemble labellisé expert)
                      │
                      ▼
         Exploration & preprocessing
        (résolution, normalisation, canaux)
                      │
                      ▼
      Extraction de features (ResNet gelé)
                      │
                      ▼
        Réduction de dimension (PCA / t-SNE)
                      │
                      ▼
       Clustering (K-Means / DBSCAN)
                      │
        ┌─────────────┴─────────────┐
        ▼                           ▼
 Jeu "faiblement"            Jeu "fortement"
 labellisé (clusters)        labellisé (experts)
        │                           │
        ▼                           │
 Entraînement CNN                   │
 (labellisation faible)             │
        │                           │
        └─────────────┬─────────────┘
                      ▼
       Poursuite entraînement semi-supervisé
                      │
                      ▼
     Comparaison supervisé vs semi-supervisé
                      │
                      ▼
   Recommandations de passage à l'échelle

Stack technique

Deep Learning & Computer Vision

Clustering & réduction de dimension

Manipulation & visualisation des données

Livrables


Bonnes pratiques appliquées


Résultats

À l'issue de ce projet, le pipeline permet de :


Compétences acquises