Accueil / Le livre / Partie 1 / Chapitre 1 : une « machine à prédire le mot suivant » / Texte intégral
[ texte intégral · chapitre 1 ]

Chapitre 1 : une « machine à prédire le mot suivant »

≈ 15 min de lecture · 3,026 mots

Pour comprendre pourquoi la scène du prologue se produit, il nous faut d'abord élucider ce que fait réellement un grand modèle de langage.

Pas au sens métaphorique, ni au sens philosophique — au sens physique, mathématique, technique. Ce chapitre entre dans le détail, mais chaque détail coule les fondations des chapitres suivants. Si vous avez la patience de le lire jusqu'au bout, tous les phénomènes qui semblaient mystérieux deviendront intelligibles.

L'essentiel en une phrase

Ce que fait un grand modèle de langage tient en une phrase :

Sur la base de tout ce que vous avez déjà dit, prédire le mot suivant le plus probable.

Rien de plus. Aucune base de connaissances n'attend en arrière-plan d'être consultée. Aucune « âme » ne médite dans les serveurs. Aucun fragment de code ne stipule « lorsque l'utilisateur aborde le sujet X, mobiliser la connaissance Y pour répondre ». Du premier mot au dernier, il ne fait toujours qu'une seule chose : à partir du texte déjà là, prédire la suite.

Mais « prédire le mot suivant » est infiniment plus complexe qu'il n'y paraît. Décomposons cela pas à pas sous vos yeux.

Première étape : le token — le « caractère » tel que la machine le voit

Commençons par un concept. Quand nous disons « prédire le mot suivant », ce « mot » ne coïncide pas tout à fait avec le mot de notre usage quotidien.

L'unité de base manipulée par le grand modèle s'appelle un token. En anglais, un token correspond grosso modo à un mot ou à la moitié d'un mot — « understanding » peut être découpé en « under » et « standing ». En chinois, c'est généralement un à deux caractères. Signes de ponctuation, espaces, voire retours à la ligne peuvent constituer des tokens à part entière.

Pourquoi ce découpage ? Parce que c'est un compromis d'ingénierie trouvé entre efficacité de calcul et couverture sémantique : trop fin (lettre par lettre), les séquences deviennent interminables ; trop grossier (phrase par phrase), on perd en précision. Le token est le « point idéal », validé par d'innombrables expériences.

Si ce détail mérite d'être relevé, c'est qu'il révèle un fait facile à ignorer : le grand modèle, dès l'origine, ne « comprend pas la langue » — il traite une suite d'unités symboliques discrètes. Il ignore à quoi ressemble le caractère « aimer », ignore son ordre de traits. Tout ce qu'il connaît, c'est le numéro que le token « aimer » occupe dans son vocabulaire — le 4217, par exemple — ainsi que les relations de cooccurrence de ce numéro avec les autres numéros, au sein de masses colossales de textes.

Toute la « compréhension », le « raisonnement », l'« empathie » ultérieurs reposent sur cette base d'une simplicité presque brutale. Tel une cathédrale gothique d'une somptuosité achevée dont chaque brique serait en réalité un parallélépipède standardisé : la splendeur de l'édifice vient de la manière dont les briques sont agencées, non des briques elles-mêmes.

Deuxième étape : la distribution de probabilités — un immense inventaire des possibles

Supposez maintenant que vous tapiez cinq caractères dans la zone de saisie :

« La capitale de la Chine est »

Ces cinq caractères (une fois tokenisés) sont transmis au modèle. Ce qui se produit à l'intérieur relève au fond d'un calcul mathématique colossal — et le résultat n'est pas une « réponse » déterminée, mais une table de distribution de probabilités.

Cette table ressemble à peu près à ceci (les chiffres sont indicatifs) :

| Token candidat | Probabilité | |---------|------| | Pékin | 93,7 % | | Nankin | 1,8 % | | une | 0,6 % | | Chang'an | 0,4 % | | où | 0,3 % | | Luoyang | 0,2 % | | Shanghaï | 0,15 % | | …… (les dizaines de milliers d'autres tokens du vocabulaire, chacun doté d'une probabilité infime) | …… |

Retenez quelques points.

Premièrement, cette table couvre tous les tokens du vocabulaire du modèle. Pas seulement les candidats « raisonnables » — « banane », « courir », « ∞ » y figurent aussi, avec une probabilité si faible qu'elle semble négligeable. Mais elle n'est pas nulle. Mathématiquement, le modèle considère que « La capitale de la Chine est banane » constitue une sortie possible — d'une probabilité d'environ 0,000001 %.

Deuxièmement, toutes ces probabilités somment exactement à 100 %. C'est garanti par une fonction mathématique appelée softmax. La sortie du modèle est, en substance, une allocation de ressources entre tous les tokens suivants possibles : 93,7 % de « confiance » attribués à « Pékin », les 6,3 % restants dispersés sur tous les autres candidats.

Troisième point, le plus important : jusqu'ici, le modèle n'a encore « prononcé » aucun mot. Il a seulement produit cette table de probabilités. Ce qui vient ensuite exige une étape supplémentaire.

Troisième étape : l'échantillonnage — prélever une réalité dans le champ des possibles

Une fois la table de probabilités générée, le modèle doit en échantillonner un token concret comme sortie.

La stratégie la plus simple s'appelle l'échantillonnage glouton (greedy sampling) : choisir directement le token de probabilité maximale — « Pékin » dans l'exemple ci-dessus. Avantage : un déterminisme fort. Inconvénient : une sortie extrêmement monotone — comme quelqu'un qui ne dirait jamais que les mots les plus sûrs.

La stratégie la plus répandue est l'échantillonnage aléatoire : tirer au sort selon la distribution de probabilités. Un token probable a de bonnes chances d'être tiré, un token improbable en a moins — mais pas zéro. D'où une certaine dose d'aléa : la même entrée, exécutée deux fois, peut donner deux sorties différentes.

Intervient ici un paramètre clé : la température (temperature). Elle règle la « pente » de la distribution de probabilités.

Comprendre la température importe beaucoup, car elle met en lumière ceci : la « créativité » ou la « prudence » d'un grand modèle n'est pas l'expression d'un « caractère » ; c'est un paramètre mathématique qu'un simple curseur externe module. Il n'a pas de caractère. Il n'a qu'une table de probabilités et une stratégie d'échantillonnage.

Quatrième étape : l'autorégression — mot après mot

Très bien. Supposons que le modèle ait échantillonné « Pékin » dans la table de probabilités. Que se passe-t-il ensuite ?

Le modèle concatène « Pékin » au texte antérieur ; le contexte devient désormais « La capitale de la Chine est Pékin ». Puis il injecte ce nouveau contexte entier en lui-même, rejoue l'intégralité du calcul et produit une nouvelle table de probabilités — cette fois pour prédire le token suivant « La capitale de la Chine est Pékin » : peut-être « , » (la virgule), peut-être « . » (le point), peut-être « , c'est » — s'il s'apprête à écrire « , c'est également le centre politique et culturel de la Chine ».

On rééchantillonne un token, on concatène, on prédit, on rééchantillonne… Ce processus s'appelle la génération autorégressive (autoregressive generation). « Autorégressive » signifie : chaque sortie devient une partie de l'entrée suivante. Le choix d'un token influe sur la distribution de probabilités du token suivant, dont le choix influe à son tour sur le suivant encore — de même que chaque embranchement d'une route change la carte de tous les embranchements à venir.

Quand un grand modèle produit une réponse de 500 tokens, il exécute en réalité 500 cycles indépendants de « prédiction-échantillonnage ». Chaque cycle met en jeu une propagation avant complète — plusieurs centaines de milliards de paramètres engagés dans une opération matricielle. C'est aussi pourquoi les réponses des grands modèles « sortent mot à mot » : elles sont bel et bien générées un mot après l'autre, non rédigées d'un trait puis dévoilées lentement sous vos yeux.

Cinquième étape : pourquoi « prédire le mot suivant » n'est pas une capacité inférieure

Arrivés ici, vous éprouvez peut-être un doute intuitif : comment une chose qui, au fond, ne fait que des « exercices à trous » pourrait-elle écrire des poèmes, programmer, analyser des marchés, discuter philosophie ? C'est bien trop rudimentaire, non ?

Cette intuition est erronée ; elle sous-estime les prérequis d'une prédiction exacte du mot suivant.

Menez quelques expériences de pensée.

Expérience 1. Pour prédire correctement le mot absent de « le principe d'incertitude de la mécanique quantique fut formulé pour la première fois par ____ en 1927 », il faut avoir « rencontré » Heisenberg au fil de l'entraînement, connaître la date d'énoncé du principe d'incertitude, comprendre l'unicité qu'implique la tournure « pour la première fois par ». Ce n'est pas un simple appariement de caractères — cela exige que le modèle encode dans ses paramètres un savoir factuel sur l'histoire de la physique.

Expérience 2. Pour prédire la suite de « Elle fixait depuis trois minutes entières le message lu et sans réponse sur son téléphone, puis lentement ____ », il faut « comprendre » l'anxiété de celui qui attend une réponse, ce que signifie, dans les usages sociaux contemporains, un message « lu sans réponse », le tempo d'action que suggère l'adverbe « lentement » — il est peu probable que suive « elle bondit » ; plus vraisemblablement « elle posa le téléphone face contre la table » ou « elle éteignit l'écran ». Cela exige que le modèle encode dans ses paramètres une intelligence des affects et des schémas comportementaux humains.

Expérience 3. Pour prédire exactement la ligne suivante d'un code Python, il faut suivre l'état courant des variables, saisir l'imbrication des appels de fonctions, inférer l'intention du programmeur — cela requiert un raisonnement logique.

Expérience 4. Pour prédire l'argument suivant d'un développement juridique, il faut comprendre la structure du raisonnement juridique, les conventions de citation de la jurisprudence, le rythme offensif et défensif de l'argumentation — cela requiert la mise en œuvre d'un corpus savant propre au droit.

Autrement dit, pour bien faire cette unique chose — prédire le mot suivant —, le modèle a été contraint, pendant l'entraînement, d'apprendre les structures massives que la langue recèle : faits, logique, causalité, rhétorique, affects, sens commun, savoir expert. Ces capacités n'ont été écrites ligne à ligne par des ingénieurs — personne n'a codé « lorsque l'utilisateur interroge la physique, appeler le module physique ». Elles ont émergé naturellement, sous la pression d'un objectif unique : mieux prédire le mot suivant.

Comme cet homme perdu dans une forêt inconnue qui, pour ne pas s'égarer, se voit contraint d'apprendre à lire les étoiles, à sentir la direction du vent, à repérer le sens de pousse des mousses. Son but initial n'était que « rentrer chez lui » ; le voilà devenu astronome amateur, observateur météo et botaniste.

Toutes les capacités d'un grand modèle de langage sont, au fond, les produits accessoires de cet unique objectif : mieux prédire le mot suivant.

Ce qui stupéfie dans ce fait, ce n'est pas sa complexité — c'est justement sa simplicité. Qu'une fonction objectif si simple, portée par des données et des paramètres assez nombreux, fasse émerger des capacités si riches — voilà l'une des découvertes les plus inattendues de la décennie passée dans le domaine de l'intelligence artificielle.

La différence fondamentale entre « réponse » et « possibilité »

Une fois ce mécanisme compris, une conséquence extrêmement importante fait surface. Arrêtez-vous ici, je vous le demande, car cette conséquence va transformer toute votre manière d'envisager les grands modèles :

Un grand modèle ne « donne » jamais une réponse. Il donne une possibilité — le chemin textuel de plus haute probabilité dans le contexte que vous fournissez.

Ce n'est ni un jeu de mots ni une coquetterie philosophique. C'est un fait technique aux conséquences pratiques immédiates.

Le mot « réponse » suppose implicitement un postulat fort : il existe un terme unique et correct, et le travail du modèle consiste à le trouver. Or vous savez désormais que le modèle n'affronte pas un terminus, mais un espace des probabilités — des milliers de chemins textuels possibles coexistent simultanément, chacun doté de son poids probabiliste.

Imaginez-vous au milieu d'un brouillard épais, face à d'innombrables sentiers partant dans des directions différentes. Chaque sentier porte un chiffre : la « probabilité de l'emprunter ». À chaque pas, le brouillard se redistribue selon le chemin déjà parcouru — certains sentiers s'éclairent, d'autres s'effacent, certains surgissent soudain qui n'existaient pas. Chacun de vos pas modifie la distribution de probabilités de tous les chemins subséquents.

Dans ce tableau, quel rôle joue votre prompt ? C'est votre position de départ et votre cap au moment d'entrer dans ce brouillard. Entrant par l'est, vous illuminez les chemins de l'est. Entrant par l'ouest, vous illuminez ceux de l'ouest. Les paysages diffèrent radicalement, mais tous deux existent réellement dans cet espace des probabilités — le modèle ne vous trompe pas : c'est votre point d'entrée qui détermine le paysage que vous verrez.

Revenons aux deux protagonistes du prologue. Par ses mots — « en suivant strictement les critères », « je veux avoir la confirmation que je n'ai aucun problème » — la professeure fixait son point de départ : entrant dans la zone « confirmation » de cet espace des probabilités, elle n'illuminait que les textes du chemin « vous n'avez aucun problème ». Par les siens — « jouiez le directeur artistique », « ne vous souciez pas de mes sentiments » — l'illustrateur fixait un point de départ entièrement différent : entrant dans la zone « diagnostic », il illuminait les chemins les plus incisifs, ceux qui touchent à l'essentiel.

Dans l'espace des paramètres du modèle, ces deux zones existent, toutes deux riches, toutes deux réelles. Le modèle n'a favorisé personne. Des portes différentes l'ont simplement conduit vers des chemins différents.

Ce qui signifie : chaque « réponse » que vous obtenez n'est pas une vérité objective, mais un chemin particulier que votre entrée trace dans l'espace des probabilités. Changez votre entrée — ne serait-ce que la formulation de quelques mots — et vous vous engagez sur un chemin entièrement différent, vous obtenez une « réponse » entièrement différente. Deux « réponses » peuvent se contredire, chacune demeurer cohérente sur son propre chemin probabiliste.

L'avènement des modèles de raisonnement : une manche de plus de « jeu contre soi-même »

Depuis un an ou deux, une évolution technique notable a marqué le domaine des grands modèles — ce qu'on appelle généralement les « modèles de raisonnement » ou « modèles à réflexion lente ». Si vous avez utilisé DeepSeek-R1 ou la série o d'OpenAI, vous aurez peut-être remarqué qu'avant de livrer leur réponse finale, ils déploient un long « processus de réflexion » — formulant en interne des hypothèses, se mettant eux-mêmes en question, vérifiant la logique, écartant les directions erronées — avant de produire leur sortie définitive.

Beaucoup y ont vu l'intuition suivante : « cette fois, il pense vraiment. »

Mais si vous avez compris le mécanisme exposé plus haut, vous constaterez que rien d'essentiel n'a changé. Ce « processus de réflexion » lui-même est engendré par la prédiction du token suivant. À chaque maillon de sa chaîne de pensée, le modèle procède toujours par échantillonnage probabiliste ; simplement, le processus d'échantillonnage s'allonge — il génère un texte interne, du genre « attends, cette hypothèse pose problème, reprenons », puis rééchantillonne à partir de ce nouveau contexte. Autrement dit, il parcourt dans l'espace des probabilités un chemin plus long, plus sinueux, jalonné de davantage d'auto-corrections.

Prenons une analogie. Deux élèves passent la même épreuve de mathématiques. Le premier lit l'énoncé et inscrit une réponse, porté par l'intuition. Le second, après lecture, dresse au brouillon trois pistes de résolution ; il essaie la première, découvre une impasse, la barre, passe à la deuxième, s'aperçoit à mi-calcul qu'un signe est erroné, corrige, poursuit, obtient enfin une réponse, la revérifie soigneusement, constate qu'elle est juste, puis recopie cette réponse sur sa copie.

La réponse du second est ordinairement plus fiable. Mais la capacité sous-jacente qu'il déploie — « savoir faire des calculs » — est la même que celle du premier. Il s'est simplement accordé quelques tours de calcul supplémentaires pour se vérifier.

Le modèle de raisonnement, c'est cet élève qui multiplie les vérifications au brouillon. Sa « réflexion » se compose de chaînes d'échantillonnage plus longues et de rondes supplémentaires d'auto-vérification — non d'un « mécanisme de pensée » d'une autre nature. D'où cette conséquence : les limites du modèle de raisonnement sont de même origine que celles du modèle de base — il chemine toujours dans l'espace des probabilités, simplement avec plus de circonspection. Plus circonspect signifie d'ordinaire plus exact, mais pas « plus proche de la vérité ». Si le cap initial que vous lui fixez est faux, il suivra plus prudemment encore un chemin faux.

Une limite qu'il faut marteler sans relâche

Avant de clore ce chapitre, permettez-moi de tracer la ligne rouge dans le langage le plus net :

Quelle que soit la proximité de son allure avec la délibération humaine — qu'il dise dans ses réponses « laissez-moi réfléchir » — qu'il écrive des passages qui vous arrachent des larmes — qu'il décroche l'or à des olympiades de mathématiques —, la nature d'un grand modèle de langage demeure, invariablement :

Un déploieur de possibilités, non un distributeur de vérités.

La qualité, l'orientation et les bornes des possibilités qu'il déploie dépendent de deux choses : premièrement, les motifs compressés dans ses paramètres au fil de l'entraînement, extraits de masses colossales de données ; deuxièmement, les conditions initiales que vous lui assignez à chaque dialogue, par ce que vous tapez.

La première échappe à votre contrôle — c'est le travail de centaines d'ingénieurs, pour des centaines de millions de dollars.

La seconde est entièrement entre vos mains — c'est chacun des mots que vous tapez dans la zone de saisie.

D'où le thème du chapitre suivant : si la sortie d'un grand modèle dépend à ce point de votre entrée, combien de choses votre entrée transporte-t-elle que vous ne soupçonnez même pas ?


← Retour au résumé
← Prologue : le même modèle, deux mondesChapitre 2 : l'amplificateur d'intention — dans le miroir, v →