Data Analysis & Data Science : SQL, Python, Power BI, Machine Learning et Deep Learning

Liste de souhaits Partager

À propos du cours

À propos de cette formation

La plupart des parcours en data se heurtent au même problème : ils enseignent des outils sans enseigner le raisonnement. On apprend la syntaxe de pandas sans savoir quelle question poser aux données ; on produit un modèle dont on ne sait pas s’il est bon ; on construit un dashboard que personne n’utilise. Cette formation prend le problème dans l’autre sens.

En 70 heures réparties sur 16 modules, elle suit le cycle de vie réel de la donnée : comprendre le besoin, collecter, nettoyer, explorer, modéliser, évaluer, visualiser, communiquer, puis industrialiser. Les statistiques y occupent une place volontairement importante — deux modules complets — parce qu’elles constituent la différence entre un analyste qui décrit et un analyste qui conclut. Le machine learning n’arrive qu’au module 10, une fois les fondations solides.

Format

Les 16 modules et 64 leçons sont accessibles au format écrit structuré : chaque leçon présente ses objectifs, ses notions clés et sa mise en pratique, et chaque module se termine par un exercice appliqué. Les supports vidéo, les notebooks, les scripts SQL, les jeux de données et les modèles Power BI ne sont pas fournis à ce stade : les exercices et les projets s’appuient sur des données que vous choisissez dans votre propre domaine, ce qui rend le portfolio produit réellement personnel. L’accès aux mises à jour du contenu est compris.

Ce que vous saurez faire à la fin

Vous saurez interroger une base de données avec SQL, y compris les jointures complexes, les CTE et les fonctions de fenêtre ; manipuler et nettoyer des données avec Python, NumPy et pandas ; conduire une analyse exploratoire et choisir les visualisations qui servent réellement le propos ; construire un modèle de données dimensionnel et un dashboard Power BI avec des mesures DAX ; entraîner, évaluer et comparer des modèles de machine learning supervisés et non supervisés en comprenant ce que mesurent réellement leurs métriques ; comprendre les principes du deep learning, du NLP et des modèles génératifs ; et structurer un pipeline de données de l’extraction au chargement.

Comment se déroule l’apprentissage

La formation est conçue pour l’apprentissage autonome, à votre rythme. Quatre mini-projets jalonnent le parcours pour consolider les acquis à chaque grande étape : SQL, Python, Power BI et machine learning. Le projet final de 4 heures vous fait traiter un cas complet de bout en bout — collecte, nettoyage, requêtes SQL, analyse Python, statistiques, visualisation, dashboard, modèle, interprétation, documentation et présentation — de manière à constituer une pièce de portfolio directement présentable.

À qui s’adresse cette formation

Elle s’adresse aux personnes en reconversion, aux Data Analysts, Business Analysts et BI Analysts qui souhaitent consolider leurs bases, aux profils finance et investissement qui veulent exploiter leurs données, aux entrepreneurs et professionnels qui manipulent des données au quotidien, aux étudiants, et à toute personne souhaitant comprendre concrètement ce qu’est la Data Science. Aucun prérequis en programmation n’est demandé : Python est introduit depuis sa syntaxe de base au module 7.

Précisions importantes

Cette formation enseigne des compétences techniques et méthodologiques. Elle ne constitue pas une certification professionnelle reconnue et ne garantit ni emploi, ni salaire, ni résultat commercial. Le niveau atteint dépend directement du travail personnel fourni, en particulier sur les exercices, les mini-projets et le projet final. Les modules 13 et 14 constituent une introduction aux sujets qu’ils couvrent — deep learning, NLP, data engineering et cloud — et non un traitement exhaustif : ils visent à vous rendre autonome pour approfondir ensuite, pas à faire de vous un ingénieur en deep learning en quatre heures. Les logiciels et services tiers cités (Power BI, environnements cloud, plateformes de données) relèvent d’éditeurs tiers et peuvent nécessiter une licence ou un abonnement souscrit directement auprès d’eux, non inclus dans le prix de la formation.

Afficher plus

Qu’allez-vous apprendre ?

  • Comprendre le cycle de vie de la donnée, de la collecte à la restitution
  • Maîtriser les statistiques descriptives et inférentielles indispensables
  • Interroger une base avec SQL : jointures, CTE et fonctions de fenêtre
  • Manipuler et nettoyer des données avec Python, NumPy et pandas
  • Conduire une analyse exploratoire et choisir les visualisations pertinentes
  • Construire un modèle dimensionnel et un dashboard Power BI avec mesures DAX
  • Entraîner, évaluer et comparer des modèles de machine learning sans fuite de données
  • Comprendre les principes du deep learning, du NLP et des modèles génératifs
  • Structurer un pipeline de données de l'extraction au chargement
  • Produire des projets reproductibles et présentables en portfolio

Contenu du cours

Module 10 — Machine learning supervisé (5 h)
Les algorithmes supervisés les plus utilisés, expliqués par leur intuition et leurs conditions d’emploi plutôt que par leurs démonstrations mathématiques.

  • 40) Principes du machine learning supervisé
  • 41) Régression linéaire et régression logistique
  • 42) Arbres, forêts aléatoires et gradient boosting
  • 43) KNN, SVM et sélection d’algorithme avec scikit-learn

Module 11 — Évaluation, feature engineering et pipelines (4 h)
Le module qui détermine si un modèle vaut quelque chose. Mal évaluer un modèle est plus dangereux que ne pas en avoir. Il se conclut par le quatrième mini-projet.

Module 12 — Apprentissage non supervisé et séries temporelles (3 h)
Explorer des données sans étiquette et traiter la dimension temporelle, qui obéit à des règles propres trop souvent ignorées.

Module 13 — Deep learning, NLP et IA générative (4 h)
Introduction rigoureuse aux réseaux de neurones et au traitement du langage. L’objectif est de rendre autonome pour approfondir, pas de former un ingénieur en deep learning en quatre heures.

Module 14 — Data engineering, ETL, API, warehouse et cloud (4 h)
Comprendre comment la donnée arrive jusqu’à l’analyste. Une introduction destinée à dialoguer utilement avec les équipes techniques et à construire des pipelines simples de façon autonome.

Module 15 — MLOps, gouvernance, éthique et sécurité (2 h)
Ce qui se passe après la mise en production. Un modèle livré n’est pas un modèle terminé — il se dégrade, et il engage la responsabilité de son auteur.

Module 16 — Projet final appliqué (4 h)
Le projet de synthèse, conçu pour constituer une pièce de portfolio présentable. Il mobilise l’ensemble du parcours, de la collecte à la présentation.

Module 1 — Fondements de la data et environnement de travail (4 h)
Poser le vocabulaire, distinguer les métiers de la data et installer un environnement de travail propre. Un module court mais déterminant : la plupart des abandons en Data Science surviennent sur des problèmes d’environnement, pas sur des problèmes de concepts.

Module 2 — Mathématiques, probabilités et statistiques descriptives (5 h)
Les fondations mathématiques strictement nécessaires, traitées pour être comprises et non récitées. Chaque notion est reliée à son usage concret en analyse de données.

Module 3 — Statistiques inférentielles et expérimentation (5 h)
Le module qui distingue un analyste qui décrit d’un analyste qui conclut. Il traite l’inférence, les tests d’hypothèses et l’A/B testing, avec une attention particulière aux erreurs d’interprétation les plus répandues.

Module 4 — Excel avancé et Power Query (4 h)
Le tableur reste l’outil le plus répandu en entreprise. Ce module en exploite les capacités avancées et introduit Power Query, dont la logique de transformation prépare directement le travail sur Power BI.

Module 5 — SQL fondamental et avancé (6 h)
La compétence la plus demandée du domaine, traitée en profondeur — des requêtes de base aux fonctions de fenêtre. Le module se conclut par le premier mini-projet du parcours.

Module 6 — Modélisation de données (4 h)
Concevoir la structure avant de manipuler le contenu. Ce module couvre la modélisation relationnelle puis la modélisation dimensionnelle, prérequis direct du module Power BI.

Module 7 — Python, NumPy et pandas (6 h)
Python depuis sa syntaxe de base jusqu’à la manipulation avancée de données. Aucun prérequis en programmation. Le module se conclut par le deuxième mini-projet.

Module 8 — Nettoyage, exploration et visualisation (5 h)
L’étape qui consomme réellement la majeure partie du temps d’un analyste. Ce module traite le nettoyage en profondeur, puis l’analyse exploratoire et la visualisation orientée décision.

Module 9 — Power BI, DAX et Business Intelligence (5 h)
Transformer une analyse en outil de pilotage utilisé au quotidien. Ce module s’appuie directement sur la modélisation dimensionnelle du module 6 et se conclut par le troisième mini-projet.