Introduction

Augustin Chevallier

1 Origine

1.1 Le neurone biologique

  • Des connexions (synapses) reçoivent des signaux en entrée
  • Ces signaux sont pondérés puis additionnés dans le corps cellulaire
  • Si le total dépasse un certain seuil, le neurone transmet un signal en sortie (axone)
  • Le neurone artificiel copie ce principe, en beaucoup plus simple

1.2 La modélisation du perceptron (1943)

  • McCulloch & Pitts, 1943 : premier modèle mathématique de neurone artificiel
  • Entrées \(x_i\), poids \(w_i\), biais \(b\)
  • Sortie : \(y = h\left(\sum w_i x_i + b\right)\)
  • Le mot “perceptron” viendra plus tard, avec Rosenblatt (1958)

1.3 ET, OU

  • Avec les bons poids, un seul neurone calcule déjà des fonctions logiques simples
  • Initialement: les poids ne sont pas encore appris : on les choisit
ET (AND), poids=(1,1), biais=-1.5:
  0 ET 0 = 0
  0 ET 1 = 0
  1 ET 0 = 0
  1 ET 1 = 1
OU (OR), poids=(1,1), biais=-0.5:
  0 OU 0 = 0
  0 OU 1 = 1
  1 OU 0 = 1
  1 OU 1 = 1
  • Rosenblatt (1958) : le Mark I Perceptron, les poids sont cette fois appris automatiquement
  • New York Times, 1958 : une machine qui saura bientôt “marcher, parler, voir, écrire, se reproduire et être consciente”

1.4 L’hiver de l’IA

  • Minsky & Papert (1969) : un seul neurone ne peut pas apprendre XOR
  • le perceptron ne peut apprendre que des problèmes linéairement séparables
  • D’autres espoirs déçus : un rapport américain (ALPAC, 1966) juge la traduction automatique décevante
  • Les promesses de “machines intelligentes” ne sont pas tenues
  • Conséquence : coupure des financements — premier hiver de l’IA

2 1990-2010

2.1 Reconnaissance de chiffres

  • LeNet (Yann LeCun, 1989-1998) : reconnaissance de chiffres manuscrits
  • Utilisé en production dans des banques (lecture de chèques)
  • Environ 60 000 paramètres — minuscule comparé à aujourd’hui

2.2 Multi-couches : déjà familier

On empile plusieurs couches de neurones — ça règle le problème de XOR vu juste avant :

2.3 LeNet : lire l’écriture manuscrite

  • Yann LeCun applique ces couches empilées, entraînées par rétropropagation, à un problème réel
  • Ajoute deux ingrédients : la convolution (détecte des motifs locaux, comme un bord ou une courbe) et le pooling (réduit la résolution progressivement)
  • Entraîné sur des chiffres manuscrits (codes postaux américains), puis étendu à des lettres et caractères plus généraux
  • Déployé en production dès les années 1990 : lecture de chèques bancaires — bien avant l’essor du deep learning des années 2010
  • Déjà l’architecture “CNN moderne”, en miniature (voir cours “3. CNN”)

2.4 La rétropropagation (1986)

  • On sait qu’empiler des couches résout XOR… mais pas encore comment les entraîner efficacement
  • Rumelhart, Hinton, Williams (1986) : publient l’algorithme de rétropropagation du gradient
  • En réalité, une redécouverte : la différentiation automatique en mode inverse était déjà connue (Linnainmaa, 1970 ; appliquée aux réseaux de neurones par Werbos, 1974)
  • Ce qui change en 1986 : l’algorithme est popularisé, et appliqué avec succès aux réseaux de neurones

2.5 Ça ne décolle pas tout de suite

  • Malgré la rétropropagation, pas grand-chose ne se passe jusque vers 2010
  • Manque de données et de calcul pour exploiter des réseaux plus profonds
  • D’autres familles de modèles dominent le machine learning de l’époque : SVM, forêts aléatoires
  • Plus faciles à entraîner et à justifier théoriquement, avec moins de données

3 2010 - maintenant

3.1 Le rôle du GPU

  • Vers 2012 : ça décolle — AlexNet, entraîné sur GPU, avec beaucoup plus de données (ImageNet)
  • Le GPU, conçu au départ pour les jeux vidéo, devient l’outil clé du deep learning

3.2 Petit historique

  • AlexNet (2012) domine le concours ImageNet, avec une marge énorme
  • VGG, ResNet (2014-2015) : des réseaux de plus en plus profonds (voir cours “Architectures profondes”)
  • Transformers (2017) : Attention is all you need
  • BERT, GPT (2018-…), puis ChatGPT (fin 2022) : grand public

3.3 Les LLM : une croissance qui s’accélère

  • metr.org mesure la durée des tâches que les meilleurs modèles réussissent à accomplir seuls (50% du temps)
  • Cette durée double environ tous les 7 mois depuis 2019… et tous les 3 à 4 mois depuis 2023

4 Plan du cours

4.1 Ce qu’on va voir

  • 1. Inference : comment un réseau déjà entraîné produit une prédiction
  • 2. Apprentissage : comment on entraîne un réseau, et pourquoi il généralise
  • 3. CNN : exploiter la structure spatiale des images
  • 4. Architectures profondes : pourquoi les réseaux profonds sont difficiles à entraîner, et comment y remédier
  • 5. RNN : traiter des séquences
  • 6. NLP : le traitement du langage
  • 7. Transformers : l’architecture derrière les LLM actuels