La formation alterne exposés théoriques courts et exercices pratiques sur notebooks Jupyter. Chaque concept est immédiatement mis en application. J'attache une attention particulière à ce que chaque participant suive, quel que soit son niveau initial, et je calibre la profondeur de chaque sujet en fonction du groupe.
Les supports sont fournis aux participants à l'issue de la formation, accompagnés des notebooks d'exercices corrigés.
multiprocessingIl n'y a pas d'évaluation dans cette formation.
Directeur de Recherche à Inria, j'utilise Python depuis plus de 20 ans dans mes propres travaux de recherche, sur des données à très grande échelle : analyse complète du graphe social de Twitter (505 millions de comptes, 23 milliards de liens), traitement de l'intégralité du graphe de transactions Bitcoin (16,5 milliards de liens, 1,5 milliard d'adresses), mesures massives d'exposition aux ondes radio. Ces travaux ont donné lieu à une couverture par le New York Times, le Washington Post, Fortune et Le Monde. Quand j'enseigne Polars, le streaming engine ou les pièges du parallélisme, ce sont les outils que j'utilise au quotidien.
Co-créateur en 2014 avec Thierry Parmentelat du MOOC Python sur la plateforme FUN, suivi par plus de 200 000 inscrits et utilisé par Sorbonne Université et CentraleSupélec. Les supports et la progression pédagogique sont éprouvés sur un public extrêmement varié, du débutant complet au développeur expérimenté qui souhaite consolider ses fondations. Cette diversité m'a appris à identifier rapidement le niveau réel d'une équipe et à adapter le rythme en conséquence.
La spécificité de mon catalogue : aller au-delà de la data science d'introduction. Polars vs Pandas sur des volumes qui dépassent la RAM, parallélisme CPU-bound, accélération JIT avec Numba, gestion mémoire fine. Ce sont les sujets qui distinguent une équipe qui prototype d'une équipe qui livre en production. Les supports évoluent en continu pour suivre l'écosystème — nouvelles versions de Polars, évolutions du streaming engine, bonnes pratiques émergentes — parce que c'est aussi mon terrain de recherche au quotidien.
Public cible
Data scientists, ingénieurs, chercheurs, post-doctorants et doctorants utilisant Pandas et souhaitant améliorer les performances de leurs traitements.
Prérequis
Niveau intermédiaire en Python (fonctions, itération, espaces de nommage, importation de modules) et en Pandas/NumPy. Cette formation est conçue comme la suite logique de la formation Python data science niveau 1.
Tous publics
@jit et @njit : quand et comment les utiliser. Accélération de boucles et de fonctions NumPy. Parallélisation avec @njit(parallel=True) et prange. Cas d'usage : simulation numérique, traitement de signaux, calcul scientifique. Limites de Numba et bonnes pratiques.multiprocessing : Process, Pool, Queue, Pipe. Pool.map() et Pool.starmap() : parallélisation de tâches indépendantes. Partage de mémoire et communication entre processus. Comparaison multiprocessing vs Numba vs Polars : quand utiliser quoi. Pièges courants et débogage de code multiprocessing.Sur la même thématique
Chambre de Commerce
et d’industrie Nice Côte d’Azur
20 Boulevard Carabacel
CS 11259
06005 NICE CEDEX 1