FonctionnementGuide 3 sur 9

Comment fonctionne une intelligence artificielle ?

9 min de lectureMis à jour le Par la rédaction CheblAI
Lire enFrançaisEnglish中文

En bref

  • Une IA moderne est un immense réseau de petites unités de calcul, les « neurones artificiels », reliées entre elles par des nombres appelés poids ou paramètres.
  • Chaque neurone additionne des signaux reçus, les pondère, puis décide de transmettre ou non un signal. Empilées sur des dizaines de couches, ces opérations simples permettent de reconnaître des images ou de produire du langage.
  • Tout le « savoir » de l’IA est stocké dans ses paramètres : GPT-3 en compte 175 milliards. Ce ne sont pas des faits rangés en mémoire, mais des réglages numériques.
Sur cette page
L’idée de base : des règles déduites, pas écritesLe neurone artificiel : une petite calculatriceLe réseau de neurones : des couches qui extraient du sensLes paramètres : là où se trouve le « savoir » du modèleEntraînement et inférence : deux moments à ne pas confondreTous les réseaux de neurones ne se ressemblent pasCe qu’il faut garder en têteQuestions fréquentesSources et références

L’idée de base : des règles déduites, pas écrites

Imaginez que vous deviez écrire un programme qui reconnaît un chat sur une photo. Écrire à la main toutes les règles (« deux oreilles pointues, des moustaches… ») est quasiment impossible : les chats ont toutes les formes, couleurs et postures. L’IA moderne contourne le problème : on lui montre des millions de photos étiquetées « chat » ou « pas chat », et elle ajuste elle-même ses réglages internes jusqu’à réussir à les distinguer.

Ce mécanisme d’ajustement s’appelle l’entraînement (voir comment une IA apprend). Cet article explique plutôt ce que l’on obtient à la fin : le modèle lui-même, et ce qui se passe quand on l’utilise.

Le neurone artificiel : une petite calculatrice

Le neurone artificiel s’inspire (de très loin) des neurones du cerveau. Le premier modèle mathématique date de 1943 (Warren McCulloch et Walter Pitts). Voici ce qu’il fait :

Schéma d’un neurone artificiel : plusieurs entrées multipliées par des poids, additionnées, passées dans une fonction d’activation, pour donner une sortie
Schéma 1 — Un neurone artificiel : entrées, poids, somme, activation, sortie.
  1. Il reçoit des entrées

    Ce sont des nombres : par exemple la luminosité de pixels d’une image, ou la représentation numérique d’un mot.

  2. Il pondère chaque entrée

    Chaque entrée est multipliée par un poids, qui indique son importance. Un poids élevé signifie « ce signal compte beaucoup » ; un poids négatif signifie « ce signal pousse dans le sens inverse ».

  3. Il additionne le tout

    Il fait la somme des entrées pondérées, puis ajoute un petit décalage appelé biais.

  4. Il applique une fonction d’activation

    Une règle simple décide de la force du signal transmis (par exemple : « ne transmets rien si la somme est négative »). Sans cette étape, empiler des neurones ne servirait à rien : le résultat resterait une simple opération linéaire.

Le réseau de neurones : des couches qui extraient du sens

Les neurones sont organisés en couches. La première reçoit les données brutes, la dernière donne le résultat, et les couches intermédiaires (dites « cachées ») transforment progressivement l’information. C’est ce qu’on appelle le deep learning, ou apprentissage profond : « profond » désigne le nombre de couches.

Schéma d’un réseau de neurones à trois couches : entrée, couches cachées, sortie, avec l’exemple de reconnaissance d’un chat
Schéma 2 — Un réseau de neurones : l’information circule de gauche à droite et se transforme à chaque couche.

Dans un réseau qui reconnaît des images, on observe en général une progression : les premières couches détectent des traits simples (contours, taches de couleur), les suivantes des formes (yeux, oreilles, roues), les dernières des objets entiers (visage, chat, voiture). Personne n’a programmé cette hiérarchie : elle émerge de l’entraînement.

Les paramètres : là où se trouve le « savoir » du modèle

L’ensemble des poids et des biais d’un modèle s’appelle ses paramètres. Ce sont les « boutons de réglage » que l’entraînement ajuste. Un modèle ne contient ni base de données de faits, ni phrases mémorisées sous forme lisible : ses connaissances sont réparties dans des milliards de nombres.

Graphique en barres du nombre de paramètres de GPT-1, GPT-2 et GPT-3 : environ 117 millions, 1,5 milliard et 175 milliards
Schéma 3 — Le nombre de paramètres des modèles GPT a été multiplié par environ 1 500 en deux ans (échelle logarithmique).

Plus un modèle a de paramètres, plus il peut capturer de nuances, à condition de disposer de suffisamment de données et de puissance de calcul pour l’entraîner. Mais plus grand n’est pas toujours mieux : des modèles plus petits mais mieux entraînés peuvent surpasser de plus grands modèles, et ils coûtent moins cher à utiliser.

Entraînement et inférence : deux moments à ne pas confondre

La vie d’un modèle d’IA se divise en deux phases très différentes.

EntraînementInférence (utilisation)
Que se passe-t-il ?Le modèle ajuste ses paramètres à partir de donnéesLe modèle, figé, produit une réponse à votre demande
Quand ?Une fois (ou par grandes phases), avant la mise en serviceÀ chaque requête d’un utilisateur
DuréeDes semaines ou des mois pour un grand modèleQuelques secondes
CoûtTrès élevé : des milliers de GPU et des millions de dollars pour les plus grands modèlesFaible par requête, mais énorme au total avec des millions d’utilisateurs
Le modèle apprend-il de ma conversation ?Oui, mais c’est justement ce qui se passe à cette étapeNon : en conversation, il ne modifie pas ses paramètres (même s’il peut garder le contexte de la discussion)

Tous les réseaux de neurones ne se ressemblent pas

On adapte l’architecture du réseau au type de données :

  • Réseaux convolutifs (CNN) : spécialisés dans l’image. Popularisés par Yann LeCun dès les années 1990, ils ont connu leur heure de gloire avec AlexNet en 2012.
  • Réseaux récurrents (RNN, LSTM) : conçus pour les suites (texte, son), en lisant mot après mot. Ils ont dominé le langage jusqu’en 2017.
  • Transformers : introduits en 2017, ils lisent une séquence entière en parallèle grâce à un mécanisme d’attention. Ils sont à la base de ChatGPT, Claude, Gemini, et aussi de nombreux modèles d’image et d’audio (voir comment fonctionne ChatGPT).
  • Modèles de diffusion : spécialisés dans la génération d’images, de vidéo et de son (voir IA générative).

Ce qu’il faut garder en tête

  • Une IA ne « sait » pas : elle calcule. Sa réponse est le résultat de millions d’opérations numériques, pas d’un raisonnement conscient.
  • On ne comprend pas tout. Les réseaux de neurones sont souvent des « boîtes noires » : on sait comment les entraîner, mais il est difficile d’expliquer précisément pourquoi ils donnent telle réponse. L’interprétabilité est un domaine de recherche actif.
  • Un modèle reflète ses données. S’il a été entraîné sur des données biaisées ou incomplètes, ses réponses le seront aussi (voir limites et risques).

Questions fréquentes

Comment fonctionne un réseau de neurones en termes simples ?

Un réseau de neurones est une suite de couches de petites unités de calcul. Chaque unité additionne des signaux pondérés et transmet un résultat à la couche suivante. En ajustant les poids à partir d’exemples, le réseau apprend à reconnaître des motifs : un visage, un mot, un son.

Qu’est-ce qu’un paramètre dans une IA ?

Un paramètre est un nombre (un poids ou un biais) à l’intérieur du modèle, ajusté pendant l’entraînement. Le savoir d’une IA est réparti dans ses paramètres : GPT-3 en compte 175 milliards.

Quelle est la différence entre entraînement et inférence ?

L’entraînement est la phase, longue et coûteuse, où le modèle ajuste ses paramètres à partir de données. L’inférence est l’utilisation du modèle déjà entraîné pour répondre à une demande.

Une IA stocke-t-elle des informations comme une base de données ?

Non. Un modèle ne contient pas de fichiers consultables : ses connaissances sont encodées sous forme de nombres répartis dans ses paramètres, ce qui explique qu’il puisse mélanger ou inventer des détails.

Pourquoi parle-t-on de « boîte noire » ?

Parce que, même si l’on connaît l’architecture et les données d’un réseau de neurones, il est très difficile d’expliquer pourquoi il produit exactement telle réponse dans tel cas. L’interprétabilité des modèles est un champ de recherche actif.

Sources et références

  1. McCulloch & Pitts, « A logical calculus of the ideas immanent in nervous activity », 1943
  2. Rumelhart, Hinton & Williams, « Learning representations by back-propagating errors », Nature, 1986
  3. Wikipedia — Large language model
  4. Wikipedia — GPT-3
  5. Wikipedia — Artificial neural network

Contenu éditorial indépendant. Les faits, dates et chiffres cités s’appuient sur les sources listées en fin de page ; ce contenu est informatif et ne constitue pas un conseil professionnel.