Référence : SQOjHG4f1eBr
Durée : 21 h sur 3 j
Tarif
4 900 €
HT
Elara Formations
ANTIBES
Intra-Entreprise
Une formation intra-entreprise réunit dans une même session les salariés d'une seule entreprise. Elle se déroule généralement dans les locaux de l'entreprise. Le tarif est convenu pour la formation d'un groupe de salarié.
Le machine learning est devenu un outil incontournable pour analyser des données complexes, détecter des patterns et faire des prédictions. scikit-learn est la librairie de référence en Python : API unifiée, documentation exemplaire, couverture exhaustive des algorithmes classiques.

Cette formation donne à vos équipes une maîtrise pratique du machine learning, des concepts théoriques fondamentaux jusqu'à la sélection rigoureuse de modèles. J'insiste particulièrement sur la rigueur méthodologique : comment éviter le surapprentissage, comment évaluer correctement un modèle, comment choisir ses hyperparamètres sans biais. Trop de pipelines de production sont entraînés sur des protocoles qui surestiment leurs performances réelles — c'est précisément ce qu'on apprend à éviter ici.

Découvrez le programme de la formation Python machine learning avec scikit-learn — pipelines, validation croisée et sélection de modèles.

Détails de la formation

Méthodes et outils pédagogiques

La formation alterne exposés théoriques courts et exercices pratiques sur notebooks Jupyter. Chaque concept est immédiatement mis en application. J'attache une attention particulière à ce que chaque participant suive, quel que soit son niveau initial, et je calibre la profondeur de chaque sujet en fonction du groupe.

Les supports sont fournis aux participants à l'issue de la formation, accompagnés des notebooks d'exercices corrigés.

Objectifs de la formation

À l'issue de cette formation, vous saurez

  • Comprendre les concepts fondamentaux : biais, variance, surapprentissage, régularisation
  • Préparer et transformer des données avec les pipelines scikit-learn
  • Appliquer les principaux algorithmes supervisés : régression, classification, SVM, arbres, forêts
  • Utiliser les méthodes non supervisées : clustering K-means, réduction de dimension PCA
  • Évaluer rigoureusement leurs modèles : validation croisée, métriques adaptées, courbes ROC
  • Sélectionner et optimiser les hyperparamètres sans fuite de données

Méthodes d'évaluation

Il n'y a pas d'évaluation dans cette formation.

Les plus

Pourquoi me confier la formation de vos équipes ?

Un chercheur qui pratique ce qu'il enseigne

Directeur de Recherche à Inria, j'utilise Python depuis plus de 20 ans dans mes propres travaux de recherche, sur des données à très grande échelle : analyse complète du graphe social de Twitter (505 millions de comptes, 23 milliards de liens), traitement de l'intégralité du graphe de transactions Bitcoin (16,5 milliards de liens, 1,5 milliard d'adresses), mesures massives d'exposition aux ondes radio. Ces travaux ont donné lieu à une couverture par le New York Times, le Washington Post, Fortune et Le Monde. Quand j'enseigne Polars, le streaming engine ou les pièges du parallélisme, ce sont les outils que j'utilise au quotidien.

Une pédagogie rodée sur 200 000 apprenants

Co-créateur en 2014 avec Thierry Parmentelat du MOOC Python sur la plateforme FUN, suivi par plus de 200 000 inscrits et utilisé par Sorbonne Université et CentraleSupélec. Les supports et la progression pédagogique sont éprouvés sur un public extrêmement varié, du débutant complet au développeur expérimenté qui souhaite consolider ses fondations. Cette diversité m'a appris à identifier rapidement le niveau réel d'une équipe et à adapter le rythme en conséquence.

Un focus performance toujours à l'état de l'art

La spécificité de mon catalogue : aller au-delà de la data science d'introduction. Polars vs Pandas sur des volumes qui dépassent la RAM, parallélisme CPU-bound, accélération JIT avec Numba, gestion mémoire fine. Ce sont les sujets qui distinguent une équipe qui prototype d'une équipe qui livre en production. Les supports évoluent en continu pour suivre l'écosystème — nouvelles versions de Polars, évolutions du streaming engine, bonnes pratiques émergentes — parce que c'est aussi mon terrain de recherche au quotidien.

Pré-requis

Public cible

Data scientists, ingénieurs, chercheurs et doctorants souhaitant appliquer les méthodes d'apprentissage machine sur leurs données avec Python.

Prérequis

Maîtrise intermédiaire de Python, NumPy et Pandas. Cette formation est conçue comme la suite logique de la formation Python data science niveau 1.

Modalités d'enseignement

  • En présentiel
  • En distanciel

Public cible

Tous publics

Votre formateur

Arnaud Legout
## Parcours

Je suis Directeur de Recherche à Inria, l'institut national de recherche en sciences du numérique, basé sur le site de Sophia Antipolis. Mes travaux portent sur les systèmes distribués, les mesures Internet et l'analyse de très grands volumes de données.

J'utilise Python quotidiennement depuis plus de 20 ans, sur des problèmes de recherche concrets qui m'ont conduit à pratiquer en profondeur la plupart des sujets que j'enseigne aujourd'hui : performance numérique, parallélisme, gestion mémoire sur des datasets multi-milliards de lignes, manipulation avancée avec Polars.

Je forme des professionnels au langage Python depuis 2011, en entreprise comme dans le monde académique. À ce jour, mes formations ont été suivies par des équipes chez Orange, Cisco, Intel Mobile Communications, Gemalto, EPCOS, Transvalor, ainsi que par de nombreux chercheurs et ingénieurs au CNRS, à l'INRAE, à l'INSERM, à l'Observatoire de la Côte d'Azur et à l'Université Côte d'Azur.

## Travaux de recherche

Mes travaux portent sur les systèmes distribués, les mesures Internet à grande échelle, et l'analyse de très grands volumes de données. Quelques projets significatifs :

- Sotweet — Études à grande échelle sur Twitter : analyse complète du graphe social (505 millions de comptes, 23 milliards de liens) et étude de la propagation d'information. L'une de nos publications a notamment montré que près de 6 personnes sur 10 partagent un article sur Twitter sans l'avoir lu. Résultats publiés à ACM SIGMETRICS 2014 et ACM SIGMETRICS 2016, et largement repris par la presse internationale : Washington Post, Fortune, El Diario.
- Bluebear — Analyse des menaces à la vie privée sur Internet. Monitoring continu de 148 millions d'adresses IP téléchargeant 2 milliards de copies de contenus via des protocoles pair-à-pair (BitTorrent, Tor, Skype). Publications dans LEET 2010, LEET 2011, ACM SIGCOMM/USENIX IMC 2011 ; couverture par le New York Times, Le Monde.
- ElectroSmart — Mesure crowdsourcée de l'exposition aux ondes radiofréquences (antennes cellulaires, Wi-Fi, Bluetooth), déployée sur smartphones grand public : 254 410 utilisateurs uniques dans 13 pays, de janvier 2017 à décembre 2020. Publication dans Environment International.
- Analyse du graphe de transactions Bitcoin — Traitement de l'intégralité de la chaîne de transactions Bitcoin depuis ses débuts — 16,5 milliards de liens entre 1,5 milliard d'adresses — manipulation en Python avec Polars sur fichiers Parquet partitionnés.

Cette pratique sur des données réelles à grande échelle nourrit directement le contenu de mes formations. Au-delà du code, ces projets m'ont donné l'expérience du sens de l'analyse : savoir poser les bonnes questions sur un dataset volumineux, identifier les patterns significatifs, et construire des pipelines reproductibles pour des analyses qui tiennent la route scientifiquement.

Page personnelle Inria complète : www-sop.inria.fr/members/Arnaud.Legout/

## Le MOOC Python sur FUN

En 2014, j'ai co-créé avec Thierry Parmentelat le premier MOOC francophone consacré à Python, hébergé sur la plateforme FUN. Une seconde version, dédiée à Python 3, a été publiée en 2017. Depuis 2019, le MOOC est ouvert en permanence à l'inscription.

Le cours a accueilli à ce jour plus de 200 000 inscrits et a été utilisé comme support pédagogique par Sorbonne Université, CentraleSupélec et plusieurs autres établissements.

MOOC Python 3 — des fondamentaux aux concepts avancés (FUN MOOC, 200 000 inscrits)

## Ma façon de former

Mon expérience de chercheur, d'enseignant universitaire et de formateur en entreprise m'a appris une chose : la qualité d'une formation ne se mesure pas au volume de slides parcourus, mais à la capacité des participants à transposer ce qu'ils ont appris dans leur propre code.

Je construis mes formations autour d'exercices pratiques sur notebooks Jupyter, avec des cas d'usage proches des problèmes réels que rencontrent les participants. Je m'assure que chaque concept est compris avant de passer au suivant, quitte à adapter le rythme au groupe. Je reste disponible pour les questions ponctuelles dans les semaines qui suivent la formation : la transmission ne s'arrête pas le dernier jour.

Page de toutes mes formations : https://formation.arnaudlegout.fr/

Programme

1
Module 1 — Fondements du machine learning
Taxonomie : apprentissage supervisé, non supervisé, semi-supervisé. Régression et classification : différences et métriques d'évaluation. Biais et variance : le compromis fondamental. Sous-apprentissage et surapprentissage. Introduction à l'API scikit-learn : fit, predict, transform, Pipeline.
2
Module 2 — Apprentissage supervisé
Modèles linéaires : régression linéaire, régression logistique. Régularisation : Ridge, Lasso, ElasticNet — quand et pourquoi. Machines à vecteurs de support (SVM) : principe et noyaux. Arbres de décision : construction, profondeur, critères de division. Méthodes d'ensemble : Random Forest, Gradient Boosting. Prétraitement : normalisation, encodage, gestion des valeurs manquantes.
3
Module 3 — Apprentissage non supervisé
Clustering K-means : algorithme, choix du nombre de clusters, évaluation. Clustering hiérarchique et DBSCAN. Réduction de dimension : PCA, variance expliquée, visualisation. Applications : détection d'anomalies, segmentation, compression.
4
Module 4 — Sélection et évaluation de modèles
Validation croisée : k-fold, stratifiée, leave-one-out. Métriques d'évaluation : accuracy, précision, rappel, F1, AUC-ROC. Sélection d'hyperparamètres : GridSearchCV, RandomizedSearchCV. Pièges de l'évaluation : fuite de données, p-hacking, comparaison multiple.

Sur la même thématique

Logo eDRH Sud PACA - Footer
Nous contacter

Chambre de Commerce
et d’industrie Nice Côte d’Azur

20 Boulevard Carabacel
CS 11259
06005 NICE CEDEX 1

Tel :04 93 13 75 73
(Appel gratuit depuis un poste fixe)