Référence : 5h6yprIFGIlI
Durée : 21 h sur 3 j
Tarif
4 200 €
Elara Formations
ANTIBES
Intra-Entreprise
Une formation intra-entreprise réunit dans une même session les salariés d'une seule entreprise. Elle se déroule généralement dans les locaux de l'entreprise. Le tarif est convenu pour la formation d'un groupe de salarié.
NumPy et Pandas sont les fondations de l'écosystème data science Python. Mal maîtrisées, ces librairies produisent du code lent, verbeux et fragile : copies inutiles, itérations explicites là où la vectorisation s'impose, confusion entre vues et copies dans Pandas.

J'ai vu ces pièges des dizaines de fois en formation. Ils ne viennent pas du niveau des participants : ils viennent d'un modèle mental incomplet du fonctionnement interne de ces librairies. Cette formation construit ce modèle mental, pour que vos équipes écrivent du code data science correct dès le premier jet.


Découvrez le programme complet de la formation Python data science niveau 1 — NumPy, Pandas et Seaborn, conçue pour les équipes qui démarrent leur montée en compétence sur l'écosystème data science Python.

Détails de la formation

Méthodes et outils pédagogiques

La formation alterne exposés théoriques courts et exercices pratiques sur notebooks Jupyter. Chaque concept est immédiatement mis en application. J'attache une attention particulière à ce que chaque participant suive, quel que soit son niveau initial, et je calibre la profondeur de chaque sujet en fonction du groupe.

Les supports sont fournis aux participants à l'issue de la formation, accompagnés des notebooks d'exercices corrigés.

Objectifs de la formation

À l'issue de cette formation, vous saurez

  • Maîtriser le type ndarray de NumPy : création, indexation, slicing, reshaping
  • Appliquer la vectorisation et le broadcasting pour écrire des calculs efficaces sans boucles
  • Manipuler des DataFrames Pandas avec les opérations avancées : groupby, merge, pivot
  • Gérer correctement les index, les dates et les séries temporelles dans Pandas
  • Lire et écrire des fichiers Parquet avec Pandas et PyArrow pour un stockage efficace
  • Produire des visualisations statistiques publiables avec Seaborn
  • Éviter les pièges courants : copie vs vue, chaînage d'indexation, types implicites

Méthodes d'évaluation

Il n'y a pas d'évaluation dans cette formation.

Les plus

Pourquoi me confier la formation de vos équipes ?

Un chercheur qui pratique ce qu'il enseigne

Directeur de Recherche à Inria, j'utilise Python depuis plus de 20 ans dans mes propres travaux de recherche, sur des données à très grande échelle : analyse complète du graphe social de Twitter (505 millions de comptes, 23 milliards de liens), traitement de l'intégralité du graphe de transactions Bitcoin (16,5 milliards de liens, 1,5 milliard d'adresses), mesures massives d'exposition aux ondes radio. Ces travaux ont donné lieu à une couverture par le New York Times, le Washington Post, Fortune et Le Monde. Quand j'enseigne Polars, le streaming engine ou les pièges du parallélisme, ce sont les outils que j'utilise au quotidien.

Une pédagogie rodée sur 200 000 apprenants

Co-créateur en 2014 avec Thierry Parmentelat du MOOC Python sur la plateforme FUN, suivi par plus de 200 000 inscrits et utilisé par Sorbonne Université et CentraleSupélec. Les supports et la progression pédagogique sont éprouvés sur un public extrêmement varié, du débutant complet au développeur expérimenté qui souhaite consolider ses fondations. Cette diversité m'a appris à identifier rapidement le niveau réel d'une équipe et à adapter le rythme en conséquence.

Un focus performance toujours à l'état de l'art

La spécificité de mon catalogue : aller au-delà de la data science d'introduction. Polars vs Pandas sur des volumes qui dépassent la RAM, parallélisme CPU-bound, accélération JIT avec Numba, gestion mémoire fine. Ce sont les sujets qui distinguent une équipe qui prototype d'une équipe qui livre en production. Les supports évoluent en continu pour suivre l'écosystème — nouvelles versions de Polars, évolutions du streaming engine, bonnes pratiques émergentes — parce que c'est aussi mon terrain de recherche au quotidien.

Pré-requis

Public cible

Data scientists, ingénieurs, chercheurs et doctorants souhaitant maîtriser les outils Python fondamentaux pour l'analyse de données.

Prérequis

Maîtrise intermédiaire de Python : fonctions, itération, espaces de nommage, importation de modules. Si vos équipes n'ont pas ce niveau, je propose une mise à niveau Python en complément — voir le bloc Vos équipes ont-elles le niveau Python requis ? ci-dessus.

Modalités d'enseignement

  • En distanciel

Public cible

Tous publics

Votre formateur

Arnaud Legout
## Parcours

Je suis Directeur de Recherche à Inria, l'institut national de recherche en sciences du numérique, basé sur le site de Sophia Antipolis. Mes travaux portent sur les systèmes distribués, les mesures Internet et l'analyse de très grands volumes de données.

J'utilise Python quotidiennement depuis plus de 20 ans, sur des problèmes de recherche concrets qui m'ont conduit à pratiquer en profondeur la plupart des sujets que j'enseigne aujourd'hui : performance numérique, parallélisme, gestion mémoire sur des datasets multi-milliards de lignes, manipulation avancée avec Polars.

Je forme des professionnels au langage Python depuis 2011, en entreprise comme dans le monde académique. À ce jour, mes formations ont été suivies par des équipes chez Orange, Cisco, Intel Mobile Communications, Gemalto, EPCOS, Transvalor, ainsi que par de nombreux chercheurs et ingénieurs au CNRS, à l'INRAE, à l'INSERM, à l'Observatoire de la Côte d'Azur et à l'Université Côte d'Azur.

## Travaux de recherche

Mes travaux portent sur les systèmes distribués, les mesures Internet à grande échelle, et l'analyse de très grands volumes de données. Quelques projets significatifs :

- Sotweet — Études à grande échelle sur Twitter : analyse complète du graphe social (505 millions de comptes, 23 milliards de liens) et étude de la propagation d'information. L'une de nos publications a notamment montré que près de 6 personnes sur 10 partagent un article sur Twitter sans l'avoir lu. Résultats publiés à ACM SIGMETRICS 2014 et ACM SIGMETRICS 2016, et largement repris par la presse internationale : Washington Post, Fortune, El Diario.
- Bluebear — Analyse des menaces à la vie privée sur Internet. Monitoring continu de 148 millions d'adresses IP téléchargeant 2 milliards de copies de contenus via des protocoles pair-à-pair (BitTorrent, Tor, Skype). Publications dans LEET 2010, LEET 2011, ACM SIGCOMM/USENIX IMC 2011 ; couverture par le New York Times, Le Monde.
- ElectroSmart — Mesure crowdsourcée de l'exposition aux ondes radiofréquences (antennes cellulaires, Wi-Fi, Bluetooth), déployée sur smartphones grand public : 254 410 utilisateurs uniques dans 13 pays, de janvier 2017 à décembre 2020. Publication dans Environment International.
- Analyse du graphe de transactions Bitcoin — Traitement de l'intégralité de la chaîne de transactions Bitcoin depuis ses débuts — 16,5 milliards de liens entre 1,5 milliard d'adresses — manipulation en Python avec Polars sur fichiers Parquet partitionnés.

Cette pratique sur des données réelles à grande échelle nourrit directement le contenu de mes formations. Au-delà du code, ces projets m'ont donné l'expérience du sens de l'analyse : savoir poser les bonnes questions sur un dataset volumineux, identifier les patterns significatifs, et construire des pipelines reproductibles pour des analyses qui tiennent la route scientifiquement.

Page personnelle Inria complète : www-sop.inria.fr/members/Arnaud.Legout/

## Le MOOC Python sur FUN

En 2014, j'ai co-créé avec Thierry Parmentelat le premier MOOC francophone consacré à Python, hébergé sur la plateforme FUN. Une seconde version, dédiée à Python 3, a été publiée en 2017. Depuis 2019, le MOOC est ouvert en permanence à l'inscription.

Le cours a accueilli à ce jour plus de 200 000 inscrits et a été utilisé comme support pédagogique par Sorbonne Université, CentraleSupélec et plusieurs autres établissements.

MOOC Python 3 — des fondamentaux aux concepts avancés (FUN MOOC, 200 000 inscrits)

## Ma façon de former

Mon expérience de chercheur, d'enseignant universitaire et de formateur en entreprise m'a appris une chose : la qualité d'une formation ne se mesure pas au volume de slides parcourus, mais à la capacité des participants à transposer ce qu'ils ont appris dans leur propre code.

Je construis mes formations autour d'exercices pratiques sur notebooks Jupyter, avec des cas d'usage proches des problèmes réels que rencontrent les participants. Je m'assure que chaque concept est compris avant de passer au suivant, quitte à adapter le rythme au groupe. Je reste disponible pour les questions ponctuelles dans les semaines qui suivent la formation : la transmission ne s'arrête pas le dernier jour.

Découvrez l'ensemble du catalogue de formations Python data science sur mon site.

Programme

1
Module 1 — Environnement de travail
nstallation d'un environnement data science avec Conda. IDE moderne : VS Code, git, intégration LLM.
2
Module 2 — NumPy, le calcul vectorisé en Python
Le type ndarray : structure mémoire, dtype, dimensions. Création de tableaux, slicing, reshaping, indexation avancée. Vectorisation et ufuncs. Broadcasting : règles et applications. Fonctions d'agrégation et de tri. Présentation de SciPy.
3
Module 3 — Pandas, manipulation de données tabulaires
Series et Index : structure, alignement automatique. DataFrame : création, sélection, filtrage, modification. Lecture et écriture : CSV, Excel, JSON, Parquet. Nettoyage de données : valeurs manquantes, doublons, types. Opérations avancées : concat, groupby, merge/join, pivot table. Gestion des dates et séries temporelles : DatetimeIndex, resample, rolling. Format Parquet : compression, partitionnement, interopérabilité avec PyArrow.
4
Module 4 — Seaborn, visualisation statistique
Architecture de Seaborn et relation avec Matplotlib. Graphiques relationnels (relplot), de distribution (displot), catégoriels (catplot). Visualisations multivariées : distplot, pairplot. Personnalisation : thèmes, palettes, export de figures publiables.

Sur la même thématique

Logo eDRH Sud PACA - Footer
Nous contacter

Chambre de Commerce
et d’industrie Nice Côte d’Azur

20 Boulevard Carabacel
CS 11259
06005 NICE CEDEX 1

Tel :04 93 13 75 73
(Appel gratuit depuis un poste fixe)