> Formations > Technologies numériques > Développement logiciel > Python > Formation Big Data - Python pour l'analyse de données > Formations > Technologies numériques > Formation Big Data - Python pour l'analyse de données
Nouvelle formation Formation référencée dans une action collective

Formation : Big Data - Python pour l'analyse de données

Big Data - Python pour l'analyse de données

Télécharger le programme Partager cette formation


Le langage Python dispose d'un écosystème scientifique, permettant entre autres, les traitements statistiques : de la construction de modèles d'analyse, à leur évaluation jusqu'à leur représentation. Ce cours vous permet d'analyser des données d'horizon divers avec les bibliothèques Python.


Inter
Intra
Sur mesure

Cours pratique en présentiel ou en classe à distance

Réf. PBD
Prix : 2280 € H.T.
  3j - 21h00
Pauses-café et
déjeuners offerts
Financements




Le langage Python dispose d'un écosystème scientifique, permettant entre autres, les traitements statistiques : de la construction de modèles d'analyse, à leur évaluation jusqu'à leur représentation. Ce cours vous permet d'analyser des données d'horizon divers avec les bibliothèques Python.

Objectifs pédagogiques
À l’issue de la formation, le participant sera en mesure de :
  • Comprendre le principe de la modélisation statistique
  • Savoir utiliser les principaux outils de traitement et d'analyse de données pour Python
  • Savoir appliquer les pratiques optimales en matière de nettoyage et de préparation des données avant l'analyse
  • Choisir entre la régression et la classification en fonction du type de données
  • Apprendre à mettre en place un modèle d'apprentissage simple
  • Être capable d'extraire des données d'un fichier

Public concerné
Développeurs en Python, responsables infocentre, développeurs de logiciels, programmeurs, data analysts, data scientists.

Prérequis
Maîtrise de la programmation Python. Connaissances de base en statistiques ou avoir suivi le stage "Statistiques, maîtriser les fondamentaux" (Réf. STA).
Vérifiez que vous avez les prérequis nécessaires pour profiter pleinement de cette formation en faisant  ce test.

Programme de la formation

Présentation de l’écosystème Python scientifique

  • Panorama de l’écosystème scientifique de Python : les librairies incontournables.
  • Savoir ou trouver de nouvelles librairies et juger de leur pérennité.
  • Les principaux outils et logiciels open source pour la data science.
Travaux pratiques
Installation de Python 3, d'Anaconda et de Jupiter Notebook.

Travailler les données avec Python

  • Le socle scientifique Python : la SciPy Stack.
  • Les bonnes pratiques pour bien démarrer votre projet de data science avec Python.
  • Les formats de fichiers scientifiques et les librairies pour les manipuler.
  • Pandas : l’analyse de données tabulaires (fichiers csv, excel...), statistiques, pivots, filtres, recherche…
  • Numpy : calcul numérique et algèbre linéaire (les vecteurs, matrices, images).
  • L’extraction des données,la préparation , le nettoyage.
Travaux pratiques
Ecrire des scripts Python permettant de travailler avec des données issues de fichiers, afin d’appliquer des filtres, des traitements de formatage, de nettoyage.

Introduction à la modélisation

  • Les étapes de construction d'un modèle.
  • Les algorithmes supervisés et non supervisés.
  • Le choix entre la régression et la classification.
Travaux pratiques
Intégration dans l’environnement installé de scripts Python, pour analyse.

Procédures d'évaluation de modèles

  • Les techniques de ré-échantillonnage en jeu d'apprentissage, de validation et de test.
  • Test de représentativité des données d'apprentissage.
  • Mesures de performance des modèles prédictifs.
  • Matrice de confusion, de coût et la courbe ROC et AUC.
Travaux pratiques
Mise en place d'échantillonnage de jeux de données. Effectuer des tests d'évaluations sur plusieurs modèles fournis.

Les algorithmes supervisés

  • Le principe de régression linéaire univariée.
  • La régression multivariée.
  • La régression polynomiale.
  • La régression régularisée.
  • Le Naive Bayes.
  • La régression logistique.
Travaux pratiques
Mise en œuvre des régressions et des classifications sur plusieurs types de données.

Les algorithmes non supervisés

  • Le clustering hiérarchique.
  • Le clustering non hiérarchique.
  • Les approches mixtes.
Travaux pratiques
Traitements de clustering non supervisés sur plusieurs jeux de données.


Modalités pratiques
Développement/réalisation d'analyses avec Python, utilisations des modules pandas, NumPy, SciPy.

Modalités d'évaluation
Le formateur évalue la progression pédagogique du participant tout au long de la formation au moyen de QCM, mises en situation, travaux pratiques…
Le participant complète également un test de positionnement en amont et en aval pour valider les compétences acquises.

Solutions de financement
Pour trouver la meilleure solution de financement adaptée à votre situation : contactez votre conseiller formation.
Il vous aidera à choisir parmi les solutions suivantes :
  • Le plan de développement des compétences de votre entreprise : rapprochez-vous de votre service RH.
  • Le dispositif FNE-Formation.
  • L’OPCO (opérateurs de compétences) de votre entreprise.
  • France Travail sous réserve de l’acceptation de votre dossier par votre conseiller France Travail.
  • Le plan de développement des compétences de votre entreprise : rapprochez-vous de votre service RH.
  • Le dispositif FNE-Formation.
  • L’OPCO (opérateurs de compétences) de votre entreprise.
  • France Travail sous réserve de l’acceptation de votre dossier par votre conseiller France Travail.

Financement par les actions collectives ou clé en main
Jusqu’à 100% de prise en charge des frais pédagogiques de la formation dans la cadre des actions collectives ou des tarifs négociés avec les actions « clé en main » mises en place par les OPCO. Cliquez sur l’OPCO pour découvrir les modalités financières associées

Avis clients
4,6 / 5
Les avis clients sont issus des évaluations de fin de formation. La note est calculée à partir de l’ensemble des évaluations datant de moins de 12 mois. Seules celles avec un commentaire textuel sont affichées.
CLARISSE D.
28/10/24
4 / 5

N’étant pas débutante sur Python et l’utilisation de Jupyter Notebook, la première journée de formation était seulement de la révision et donc pas tellement intéressante pour moi. Par contre, j’ai appris de nouvelles choses sur la librairie Pandas. Toute la partie sur le machine Learning était très intéressante mais dense. Une demi journée, voire une journée en plus pour s’entraîner sur les algos de machine learning et l’amélioration de performance serait appréciable.
THIBAULT R.
28/10/24
4 / 5

La première journée pourrait être accélérée pour passer plus de temps sur les exercices des 2 journées suivantes
THOMAS C.
21/10/24
5 / 5

formation très interessante et formateur (Redha) passionant et très pédagogue. Sait rendre accessibles des concepts à priori très compliqués, en plus d’être très sympathique.




Horaires
En présentiel, les cours ont lieu de 9h à 12h30 et de 14h à 17h30.
Les participants sont accueillis à partir de 8h45. Les pauses et déjeuners sont offerts.
Pour les stages pratiques de 4 ou 5 jours, quelle que soit la modalité, les sessions se terminent à 16h le dernier jour.

Dates et lieux
Sélectionnez votre lieu ou optez pour la classe à distance puis choisissez votre date.
Classe à distance