À propos du cours
À propos de cette formation
La plupart des parcours en data se heurtent au même problème : ils enseignent des outils sans enseigner le raisonnement. On apprend la syntaxe de pandas sans savoir quelle question poser aux données ; on produit un modèle dont on ne sait pas s’il est bon ; on construit un dashboard que personne n’utilise. Cette formation prend le problème dans l’autre sens.
En 70 heures réparties sur 16 modules, elle suit le cycle de vie réel de la donnée : comprendre le besoin, collecter, nettoyer, explorer, modéliser, évaluer, visualiser, communiquer, puis industrialiser. Les statistiques y occupent une place volontairement importante — deux modules complets — parce qu’elles constituent la différence entre un analyste qui décrit et un analyste qui conclut. Le machine learning n’arrive qu’au module 10, une fois les fondations solides.
Format
Les 16 modules et 64 leçons sont accessibles au format écrit structuré : chaque leçon présente ses objectifs, ses notions clés et sa mise en pratique, et chaque module se termine par un exercice appliqué. Les supports vidéo, les notebooks, les scripts SQL, les jeux de données et les modèles Power BI ne sont pas fournis à ce stade : les exercices et les projets s’appuient sur des données que vous choisissez dans votre propre domaine, ce qui rend le portfolio produit réellement personnel. L’accès aux mises à jour du contenu est compris.
Ce que vous saurez faire à la fin
Vous saurez interroger une base de données avec SQL, y compris les jointures complexes, les CTE et les fonctions de fenêtre ; manipuler et nettoyer des données avec Python, NumPy et pandas ; conduire une analyse exploratoire et choisir les visualisations qui servent réellement le propos ; construire un modèle de données dimensionnel et un dashboard Power BI avec des mesures DAX ; entraîner, évaluer et comparer des modèles de machine learning supervisés et non supervisés en comprenant ce que mesurent réellement leurs métriques ; comprendre les principes du deep learning, du NLP et des modèles génératifs ; et structurer un pipeline de données de l’extraction au chargement.
Comment se déroule l’apprentissage
La formation est conçue pour l’apprentissage autonome, à votre rythme. Quatre mini-projets jalonnent le parcours pour consolider les acquis à chaque grande étape : SQL, Python, Power BI et machine learning. Le projet final de 4 heures vous fait traiter un cas complet de bout en bout — collecte, nettoyage, requêtes SQL, analyse Python, statistiques, visualisation, dashboard, modèle, interprétation, documentation et présentation — de manière à constituer une pièce de portfolio directement présentable.
À qui s’adresse cette formation
Elle s’adresse aux personnes en reconversion, aux Data Analysts, Business Analysts et BI Analysts qui souhaitent consolider leurs bases, aux profils finance et investissement qui veulent exploiter leurs données, aux entrepreneurs et professionnels qui manipulent des données au quotidien, aux étudiants, et à toute personne souhaitant comprendre concrètement ce qu’est la Data Science. Aucun prérequis en programmation n’est demandé : Python est introduit depuis sa syntaxe de base au module 7.
Précisions importantes
Cette formation enseigne des compétences techniques et méthodologiques. Elle ne constitue pas une certification professionnelle reconnue et ne garantit ni emploi, ni salaire, ni résultat commercial. Le niveau atteint dépend directement du travail personnel fourni, en particulier sur les exercices, les mini-projets et le projet final. Les modules 13 et 14 constituent une introduction aux sujets qu’ils couvrent — deep learning, NLP, data engineering et cloud — et non un traitement exhaustif : ils visent à vous rendre autonome pour approfondir ensuite, pas à faire de vous un ingénieur en deep learning en quatre heures. Les logiciels et services tiers cités (Power BI, environnements cloud, plateformes de données) relèvent d’éditeurs tiers et peuvent nécessiter une licence ou un abonnement souscrit directement auprès d’eux, non inclus dans le prix de la formation.
Contenu du cours
Module 10 — Machine learning supervisé (5 h)
-
40) Principes du machine learning supervisé
-
41) Régression linéaire et régression logistique
-
42) Arbres, forêts aléatoires et gradient boosting
-
43) KNN, SVM et sélection d’algorithme avec scikit-learn
