Intelligence Artificielle et Data Science

Catalogue des cours de Institut Mines-Télécom Business School

Code

MGSF INF 4803

Niveau

M1

Discipline

Informatique

Langue

French

Crédits ECTS

2

Heures programmées

18

Charge totale étudiant

40

Coordonnateur(s)

Département

  • Data analytics, Économie et Finances

Equipe pédagogique

Introduction au module

Depuis la rentrée 2026/27, ce cours fait partie du Data Camp en formation initiale.
Le Data Camp est une formation intensive et pratique à la science des données et à l'intelligence artificielle en Python, du chargement d'un premier fichier jusqu'à l'utilisation des grands modèles de langage. Il repose sur l'apprentissage par la pratique : chaque notion est introduite par une question de gestion — « quels clients risquent de partir ? », « cette campagne a-t-elle vraiment fait vendre ? » —, démontrée sur des données réelles, puis immédiatement remise entre les mains des étudiants sous forme d'exercices réalisés en séance.
Le cours se déroule intégralement dans Google Colab, un environnement Python qui s'exécute dans le navigateur : rien à installer, rien à configurer. Il peut être suivi aussi bien sur ordinateur portable que sur tablette.
Les jeux de données travaillés sont inspirés de cas d'entreprise réels : les ventes d'un détaillant en ligne européen sur une année, la base d'abonnés d'un opérateur télécom, une véritable campagne d'emailing randomisée auprès de 64 000 clients.
À l'issue de la formation, les étudiants seront capables de charger, nettoyer, croiser et visualiser un jeu de données ; de le décrire et de l'interpréter statistiquement ; d'ajuster, d'évaluer et de comparer des modèles de prédiction ; de concevoir et d'analyser une expérience A/B pour établir un effet causal ; d'appeler un modèle de langage depuis Python et d'en évaluer les limites ; et de traduire un résultat technique en recommandation exploitable par un décideur.

Bloc de compétences

  • 1. S’approprier les usages avancés et spécialisés des outils de l’intelligence digitale en s’assurant de leur impact durable et responsable

Compétences du bloc

  • 1.2 - Actionner les outils de l'intelligence digitale de manière efficiente, pour accompagner les transformations sociétale, numérique, énergétique et environnementale des organisations, en s'assurant de leur impact durable et responsable.

Objectifs d'apprentissage du cours

— Programmation en Python → écrire et exécuter un programme Python simple
(variables, types, conditions, boucles) dans un notebook, et lire un message
d'erreur pour le corriger de manière autonome.

— Manipulation de données → charger, nettoyer, agréger et croiser des jeux de
données réels avec les bibliothèques pandas et numpy, et construire une chaîne
de traitement reproductible.

— Visualisation des données → concevoir des représentations graphiques adaptées
à la question posée (série temporelle, comparaison, distribution, relation) et
identifier ce qu'un graphique révèle autant que ce qu'il masque.

— Statistiques descriptives et inférentielles → décrire une distribution et
choisir les mesures de tendance centrale et de dispersion pertinentes ;
quantifier l'incertitude d'une estimation ; tester une différence entre deux
groupes et interpréter correctement une p-value.

— Régression linéaire → mettre en œuvre une régression simple puis multiple ;
interpréter un coefficient « toutes choses égales par ailleurs », son
intervalle de confiance et le R² ; reconnaître les situations dans lesquelles
le modèle ne peut pas répondre à la question posée.

— Apprentissage supervisé et évaluation hors échantillon → mettre en œuvre une
prédiction quantitative, une classification binaire et un arbre de décision ;
évaluer la performance d'un modèle sur un jeu de test au moyen des métriques
appropriées (RMSE, MAE, matrice de confusion, précision, rappel, F1) ;
diagnostiquer un surapprentissage ou une fuite de données.

— Comparaison et interprétation des algorithmes → comparer différents
algorithmes au regard de leur performance, de leur coût et de leur
interprétabilité, et expliquer la décision d'un modèle à l'aide de
l'importance des variables et de la dépendance partielle.

— Apprentissage non supervisé → segmenter une base clients par classification
automatique et traduire les segments obtenus en plan d'action budgété.

— Causalité et expérimentation → distinguer une question prédictive d'une
question causale ; concevoir un test A/B, vérifier sa randomisation, mesurer
l'effet du traitement et son incertitude, et en tirer une décision chiffrée.

— Intelligence artificielle générative → expliquer le fonctionnement et les
limites d'un grand modèle de langage ; distinguer LLM, RAG, appel d'outils,
agent et MCP ; appeler un modèle depuis Python sur des données textuelles et
évaluer ses réponses au lieu de les croire sur parole.

— Restitution → présenter de manière claire et convaincante une analyse et ses
résultats à un public non technique.

Contenu : structure du module et agenda

Le cours est organisé en six blocs thématiques, découpés en séances de deux heures. Chaque bloc s'appuie sur le précédent : les données nettoyées au bloc 2 sont celles que l'on décrit au bloc 3, modélise au bloc 4 et expérimente au bloc 5. Le planning est susceptible de modifications.
BLOC 1 — PRISE EN MAIN DE PYTHON ET DE L'ENVIRONNEMENT (1 séance)
1.1 Colab, Markdown et vos premières lignes de code. Notebook, variables, types, conditions et boucles ; lire un message d'erreur ; charger un premier fichier depuis le web.
BLOC 2 — COLLECTER, COMPRENDRE ET MANIPULER DES DONNÉES (3 séances)
2.1 Charger et comprendre un jeu de données. Décrire un fichier jamais vu ; sélectionner lignes et colonnes ; premiers indicateurs.
2.2 Nettoyer des données réelles. Types mal lus, dates ambiguës, valeurs manquantes, doublons, valeurs aberrantes ; construire une chaîne de nettoyage rejouable.
2.3 Agréger, croiser et visualiser. groupby, jointures et tableaux croisés ; choisir le graphique adapté à la question ; première mesure de corrélation.
BLOC 3 — INTERPRÉTER DES DONNÉES (4 séances)
3.1 Décrire une distribution. Moyenne ou médiane ; dispersion ; concentration d'un chiffre d'affaires ; variables qualitatives.
3.2 Comparer deux groupes : hasard ou vrai écart ? Intervalle de confiance par rééchantillonnage ; comparaison de moyennes et lecture d'une p-value ; le piège des tests répétés.
3.3 Relier deux variables. Khi-deux ; corrélations de Pearson et de Spearman ; valeurs extrêmes, non-linéarité et variables de confusion.
3.4 Régression linéaire. Coefficient, p-value, intervalle de confiance et R² ; interprétation « toutes choses égales par ailleurs » ; refuser une extrapolation.
BLOC 4 — INTRODUCTION AU MACHINE LEARNING (4 séances)
4.1 Prédire n'est pas expliquer. Découpage apprentissage / test ; erreur en euros (RMSE, MAE) ; surapprentissage et fuite de données.
4.2 Prédire une décision : qui va résilier ? Régression logistique ; matrice de confusion, précision, rappel et F1 ; données déséquilibrées ; choisir un seuil à partir d'un coût.
4.3 Arbres de décision et interprétation des modèles. Lire un arbre comme des règles métier ; profondeur par validation croisée ; importance par permutation et dépendance partielle.
4.4 Segmenter sans étiquette. K-moyennes ; inertie, silhouette et standardisation ; transformer une segmentation en plan d'action budgété.
BLOC 5 — A/B TESTING ET INFÉRENCE CAUSALE (3 créneaux : cours, étude de cas, correction collective)
5.1 Causalité et expériences randomisées. Contrefactuel, ATE et ATT ; effet causal et biais de sélection ; vérifier une randomisation ; étude de cas sur une campagne d'emailing réellement randomisée, jusqu'à la décision chiffrée.
BLOC 6 — SCIENCE DES DONNÉES ET MODÈLES DE LANGAGE (2 créneaux : cours, atelier)
6.1 LLM, agents et MCP. Fonctionnement et limites ; distinguer LLM, RAG, appel d'outils, agent et MCP ; appeler un modèle depuis Python sur un corpus d'avis clients ; comparer classifieur spécialisé et modèle génératif ; vérifier les prédictions au lieu de les croire.

Contribution à l'atteinte des ODD (Objets du Développement Durable)

Ce cours constitue en soi une éducation de qualité en développant des compétences analytiques essentielles (ODD 4). Il améliore l’employabilité en offrant des outils utiles pour accéder à un travail de qualité, tout en aidant à comprendre les dynamiques du marché du travail (ODD 8). Il éclaire également les mécanismes d’innovation, d'investissement et d'infrastructures efficaces (ODD 9), essentiels au développement durable.

Nombre d'ODD abordés parmi les 17

3 ODD

Apprentissage

synchrone

Méthode pédagogique

Ce cours repose entièrement sur l'apprentissage par la pratique. Chaque notion est introduite par une question de gestion, démontrée sur des données réelles, puis reprise par les étudiants sur leur propre machine.

Chaque technique donne lieu à deux exercices consécutifs : un exercice guidé, où un code partiel est fourni à compléter, puis un exercice libre — un énoncé et une cellule vide — qui oblige à l'écrire de mémoire. Dans les premiers blocs, ces exercices sont insérés dans le fil même du cours, de sorte que les étudiants ne passent jamais plus de dix minutes sans écrire de code. Dans les blocs suivants, ils forment une feuille d'exercices travaillée en séance.

Système de notation et modalités de rattrapage

La note finale se compose comme suit :
40 % — Contrôle continu sur table. L'épreuve comprend un QCM (50 % de la note du contrôle continu) et des questions ouvertes (50 %). Cette note est entièrement individuelle.
30 % — Dossier. Le dossier peut être réalisé en groupe de trois. La note est collective : elle est identique pour tous les membres du groupe.
30 % — Soutenance du dossier (environ 20 minutes). La présentation se fait en groupe, mais la note est individualisée en fonction de la participation de chaque membre et de la qualité de ses réponses aux questions du jury.
Modalités de rattrapage
Le rattrapage prend la forme d'une épreuve sur table d'une heure, de même nature que le contrôle continu (QCM et questions ouvertes). La note obtenue constitue la note finale, sous réserve des règles générales de la scolarité relatives à la note maximale attribuable en session de rattrapage.

Règlement du module

Communication Professeur-Apprenant
● Le professeur contactera les apprenants via leur adresse email scolaire (IMT-BS/TSP) et le portail Moodle. Aucune communication via les adresses mails personnelles n’aura lieu. Il est de la responsabilité de l’étudiant de consulter régulièrement sa boîte mail IMT-BS/TSP.
● Les apprenants peuvent communiquer avec le professeur en envoyant un mail à son adresse institutionnelle. Au besoin, il est possible de le rencontrer dans son bureau durant les heures de bureau ou sur rendez-vous.

Apprenants avec des besoins d’accommodement
Si l’apprenant a un handicap qui empêche d’accomplir le travail décrit ou qui nécessite toute sorte d'accommodement, il est de sa responsabilité d’en informer le directeur des études (avec justificatifs) dès que possible. Aussi, l’apprenant ne doit pas hésiter à en discuter avec son professeur.

Comportement en classe
● En guise de courtoisie envers le professeur et les autres apprenants, tous les téléphones portables, jeux électroniques ou autres appareils générant du son doivent être désactivés pendant les cours.
● L’apprenant doit éviter tout comportement perturbateur et irrespectueux tel que: arriver en retard en classe, partir tôt, comportement inconsidéré (ex. dormir, lire un document non lié au cours, utiliser un langage vulgaire, parler excessivement, manger, boire, etc.). Un avertissement peut être donné à la première infraction de ces règles. Les contrevenants seront pénalisés et pourront être expulsés de la classe et/ou subir d'autres procédures disciplinaires.
● Le retard toléré est de 5 minutes. La présence sera déclarée sur Moodle durant ces 5 minutes via un QR code fourni par le professeur à chaque démarrage de cours.
● L’apprenant doit arriver à l'heure pour les examens et autres évaluations. Personne ne sera autorisé à entrer en classe une fois que la première personne aura terminé l'examen et quitté la salle. Il n'y a absolument aucune exception à cette règle. Aucun apprenant ne peut continuer à passer un examen une fois le temps écoulé. Aucun apprenant ne peut quitter la salle pendant un examen à moins qu'il / elle ait terminé et ait remis tous les documents.
● En cas de cours à distance, l'apprenant doit maintenir sa caméra allumée sauf en cas d'indications contraires données par l'enseignant.

Code éthique
IMT-BS est engagée dans une politique d'honnêteté dans le milieu académique. Toute conduite compromettant cette politique peut entraîner des sanctions académiques et/ou disciplinaires. Les apprenants doivent s'abstenir de tricher, de mentir, de plagier et de voler. Ceci consiste à accomplir un travail original et à reconnaître toute autre personne dont les idées et les documents imprimés (y compris ceux provenant d’Internet) sont paraphrasés ou cités directement. Tout apprenant qui enfreint ou aide un autre élève à enfreindre les normes de comportement scolaire sera sanctionné conformément aux règles de l'IMT-BS.

Références obligatoires et lectures suggérées

Aucun ouvrage n'est obligatoire : le cours est intégralement autoportant, les
supports de séance et les aide-mémoire fournis suffisent à le suivre.

Lectures suggérées :
— McKinney, W. (2022). Python for Data Analysis, 3e édition. O'Reilly.
(Manipulation de données avec pandas — blocs 2 et 3.)
— VanderPlas, J. (2023). Python Data Science Handbook, 2e édition. O'Reilly.
(Panorama de l'écosystème scientifique Python.)
— James, G., Witten, D., Hastie, T., Tibshirani, R., & Taylor, J. (2023). An Introduction to Statistical Learning: With Applications in Python.
(Référence du bloc 4 ; disponible gratuitement en ligne.)
— Taddy, M. (2019). Business Data Science. McGraw-Hill.
(Cadrage managérial de la science des données.)
— Angrist, J. D., & Pischke, J.-S. (2015). Mastering 'Metrics: The Path from
Cause to Effect. Princeton University Press. (Inférence causale — bloc 5.)
— Facure, M. Causal Inference for the Brave and True. (Ressource libre en ligne,
support du bloc 5.)

Ressources distribuées avec le cours : aide-mémoire pandas, aide-mémoire
statistiques, aide-mémoire machine learning, guide de démarrage sur tablette.

Mots-clés

Python, science des données, pandas, statistiques appliquées, apprentissage automatique, A/B testing, inférence causale, modèles de langage (LLM), intelligence artificielle

Prérequis

Aucun