Aller directement au contenu
L'IA en main

Comprendre plus loin : histoire, enjeux, énergie, droit, emploi · D'où vient l'IA · Leçon 2 sur 14

Comment on fabrique un modèle, sans mathématiques

À faire

On répète que l'IA est une boîte noire. En partie seulement. Sa fabrication tient en quatre étapes, et chacune s'explique avec une image de la vie courante. Aujourd'hui, vous repartez avec ces quatre étapes, sans une seule formule.

Objectif : À la fin, vous saurez expliquer à quelqu'un les quatre étapes d'une IA : les données, l'entraînement, le réglage et l'alignement.

La vidéo

Les sous-titres sont affichés par défaut.
Transcription (le texte de la vidéo)

Bienvenue dans cette leçon. On dit souvent que l'IA est une boîte noire. C'est vrai en partie seulement. Sa fabrication tient en quatre étapes, et chacune s'explique avec une image de la vie courante. À la fin, vous saurez les nommer et les raconter à quelqu'un.

Première étape, les données. On rassemble des textes en quantité inimaginable. Des pages web, des livres, des articles, des forums. Imaginez une bibliothèque où l'on aurait versé tout ce qui traîne en ligne. Le meilleur y côtoie le pire, sans étiquette. La CNIL rappelle que ces collectes contiennent souvent des données personnelles. Retenez surtout ceci. Ce que le modèle n'a jamais lu, il ne le connaît pas.

Deuxième étape, l'entraînement. On cache un mot dans un texte, et le programme doit le deviner. Il se trompe, on corrige, il recommence. Des milliards de fois. À chaque erreur, il ajuste des réglages internes, qu'on appelle des paramètres. Imaginez un tableau de bord couvert de milliards de petites molettes. Un grand modèle en compte des dizaines de milliards. Personne ne peut ensuite les lire. Les molettes ne sont pas des phrases.

Regardez l'écran. Nous demandons à l'assistant d'expliquer un paramètre avec une image de la vie courante. Il propose une table de mixage couverte de curseurs. Chaque curseur modifie un peu le résultat. L'entraînement déplace les curseurs jusqu'à ce que les prédictions tombent juste. L'image est bonne, alors nous la gardons. Puis nous ouvrons le site de la CNIL pour vérifier le fond. La définition concorde. Une image seule ne prouve rien, mais elle se retient.

À vous maintenant. Choisissez un seul mot. Les données, un paramètre, un jeton, ou l'alignement. Demandez une explication en cinq phrases, avec une image tirée de la cuisine, du jardinage ou de la mécanique. Demandez aussi une phrase finale sur les limites de cette image. Puis racontez l'explication à quelqu'un, sans regarder l'écran. Vous ne pouvez rien casser.

Retenez les quatre temps. On lui donne à lire. On la fait deviner. Des humains la corrigent. Puis on lui donne des règles de conduite, ce qu'on appelle l'alignement. Ces règles expliquent les refus et les excuses de votre assistant. Elles n'empêchent pas les réponses fausses dites avec assurance. La vérification reste votre travail. La prochaine leçon présente ceux qui fabriquent ces modèles, et la place de l'Europe.

L'idée

Une IA se fabrique en quatre temps. On lui donne à lire, on la fait deviner, on la corrige, puis on l'encadre.

La démonstration

Voici l'exemple, entièrement fait sous vos yeux, avant que vous ne le fassiez vous-même.

Nous ouvrons notre assistant et nous écrivons : « Expliquez en cinq phrases ce qu'est un paramètre dans un modèle d'IA. Utilisez une image de la vie courante, sans aucune formule. »

Exemple de réponse : « Imaginez une table de mixage couverte de curseurs. Chaque curseur modifie très légèrement le son final. Un paramètre est un de ces curseurs, à l'intérieur du modèle. Pendant l'entraînement, le programme déplace les curseurs jusqu'à ce que ses prédictions tombent juste. Un grand modèle en possède des dizaines de milliards. »

L'image est bonne, nous la gardons. Mais nous vérifions le fond ailleurs.

Nous ouvrons le site de la CNIL, à la définition du modèle génératif. Elle décrit un modèle capable de créer de nouveaux exemples à partir des données d'entraînement. La logique concorde avec l'image des curseurs.

Nous poussons alors la demande : « En une phrase, que ne contient pas le modèle ? » La réponse mérite d'être notée. Le modèle ne contient pas les textes lus, seulement des réglages tirés de ces textes.

C'est là tout l'intérêt de l'exercice. L'image rend l'idée saisissable. La source officielle confirme qu'elle ne trahit pas la réalité. Une image seule ne prouve rien, mais elle se retient.

L'exercice guidé

Vous ne pouvez rien casser.

Vous ne pouvez rien casser. 1. Ouvrez votre assistant en version gratuite et collez la demande ci-dessus. 2. Choisissez un seul mot dans les crochets, et un seul domaine d'image. 3. Lisez la réponse à voix haute : si l'image ne parle pas, redemandez-en une autre. 4. Ouvrez le site de la CNIL et comparez avec sa définition du modèle génératif. 5. Racontez l'explication à quelqu'un, sans regarder l'écran.

La consigne à copier :

Expliquez-moi en cinq phrases courtes, avec une image de la vie courante et sans aucune formule, ce qu'est [choisissez un seul mot : les données d'entraînement, un paramètre, un jeton, l'alignement]. Prenez une image tirée de ce domaine : [la cuisine, le jardinage, la couture, la mécanique, la musique]. Terminez par une phrase qui dit les limites de votre image.

Trois vérifications

Cochez chaque phrase quand elle est vraie pour vous :

Le quiz de la leçon

5 questions. La réponse est expliquée tout de suite. Vous pouvez réessayer autant de fois que vous voulez : aucune note n'est gardée.

1. Votre voisin affirme que ChatGPT « contient tout internet dans un dossier ». Que lui répondez-vous ?

2. Vous demandez une information sur un club de village qui n'a jamais eu de site internet. La réponse est détaillée et assurée. Que pensez-vous ?

3. Votre assistant refuse poliment de répondre à une question, puis s'excuse. D'où vient ce comportement ?

4. Un article affirme que l'alignement empêche l'IA de se tromper. Qu'en dites-vous ?

5. On vous demande pourquoi deux assistants donnent des réponses différentes à la même question. Quelle explication est la plus juste ?

Et maintenant

D'ici demain, expliquez les quatre étapes à quelqu'un, en quatre phrases : ce qu'on lui donne à lire, le jeu du mot caché, la correction par des humains, les règles de conduite. Si la personne comprend, vous avez compris. Nous vous reposerons une question dans 3 jours.

Comment avez-vous trouvé cette leçon ?

Deux questions, dix secondes. Vos réponses servent à corriger les leçons suivantes : c'est notre seul moyen de savoir ce qui passe mal.

Cette leçon vous a-t-elle servi ?
Et le rythme ?

Anonyme. Nous ne demandons ni votre nom ni votre adresse.

Les mots de cette leçon

Données d'entraînement
L'ensemble des textes et des images donnés au programme pour qu'il apprenne, souvent collectés sur internet.
Paramètre
Un réglage interne du modèle, comparable à un curseur ; un grand modèle en compte des dizaines de milliards.
Jeton
Le petit morceau de texte que le modèle manipule, d'environ trois quarts de mot.
Réglage
La phase où des personnes écrivent de bonnes réponses et comparent celles du modèle, pour l'orienter.
Alignement
Les règles de conduite données au modèle : ce qu'il accepte de faire, ce qu'il refuse, ce qu'il doit signaler.

Tout le glossaire