Retour aux Projets académiques

Entraînement d'agents par Renforcement : du Q-Learning au pilotage autonome d'un atterrisseur lunaire

Python, Reinforcement Learning, PyTorch, Stable-Baselines3, Gymnasium, DQN, PPO, FastAPI, Streamlit

Entraînement d'Agents RL : du Q-Learning au Pilotage Autonome d'un Atterrisseur Lunaire

Présentation

Ce projet met en œuvre une progression complète en apprentissage par renforcement, des fondamentaux théoriques jusqu'au déploiement d'un agent autonome complet. Point de départ : la boucle observation → action → récompense sur un environnement simple. Point d'arrivée : le pilote automatique du module d'atterrissage lunaire "Eagle-1" pour AstroDynamics, exposé via une API, visualisé dans une interface graphique et suivi par un tableau de bord de performance.

Le projet applique les bonnes pratiques du Reinforcement Learning afin de construire, du zéro jusqu'à la production, une chaîne complète d'entraînement, d'optimisation et de mise à disposition d'un agent intelligent.


Objectifs


Compétences démontrées

Fondamentaux du Reinforcement Learning


Q-Learning "from scratch"


Deep Q-Network (DQN)


Entraînement et optimisation d'un agent de contrôle (LunarLander)


Mise à disposition de l'agent (MLOps léger)


Architecture

        Environnement Gymnasium
    (CartPole / FrozenLake / LunarLander)
                    │
                    ▼
        Politique aléatoire (baseline)
                    │
                    ▼
     Q-Learning (Q-table, Bellman, ε-greedy)
                    │
                    ▼
   DQN manuel (PyTorch, ReplayBuffer,
        Policy Net / Target Net)
                    │
                    ▼
      DQN / PPO via Stable-Baselines3
      (entraînement, tuning, TensorBoard)
                    │
                    ▼
       Agent optimisé (récompense >200)
                    │
        ┌───────────┼───────────┐
        ▼           ▼           ▼
      API        GUI       Dashboard
   (FastAPI)  (Streamlit/    (suivi des
              Gradio)        performances)

Stack technique

Reinforcement Learning

Suivi & optimisation

Déploiement & visualisation

Livrables


Bonnes pratiques appliquées


Résultats

À l'issue de ce projet, le pipeline permet de :


Compétences acquises