Comment fonctionne un LLM — ce que tout développeur devrait savoir

Catégorie : IA | Temps de lecture : 4 min | Auteur : Jonathan JODAR | 25 Mai 2025

Derrière chaque réponse générée, il y a une boucle mathématique précise. La comprendre change la façon dont on construit avec.


J'ai fait développer deux agents IA par Claude — Coach Analyse et Coach Plan — deux modules d'une app Symfony qui ingèrent mes données de sport en CSV et me sortent analyses et plans d'entraînement personnalisés. J'ai structuré le cahier des charges, défini les flux, pensé l'architecture. Claude a écrit le code. Mais à un moment, j'ai réalisé que j'orchestrais quelque chose que je ne comprenais pas vraiment de l'intérieur. Ce n'était pas tenable. Alors j'ai creusé. Voilà ce que j'aurais voulu qu'on m'explique dès le début.


Ce qu'un LLM fait vraiment

Un Large Language Model n'est pas un moteur de recherche. Il ne récupère pas des réponses existantes — il les génère, token par token, en calculant à chaque étape ce qui a le plus de probabilités de suivre ce qui précède.

C'est la distinction fondamentale. Et elle change tout à la façon dont on l'utilise.

Un LLM, c'est un modèle entraîné sur des milliards de textes pour apprendre les patterns du langage humain — ses structures, ses logiques, ses cohérences. À l'issue de cet entraînement, il contient des poids : des milliards de paramètres numériques qui encodent, de façon compressée, une représentation statistique du langage.

GPT-4 en a environ 1 000 milliards. Claude 3 Opus, plusieurs centaines de milliards. Ces poids ne bougent plus à l'inférence — c'est-à-dire quand le modèle répond. Tout est figé. Ce qui varie, c'est le prompt qu'on lui donne.


Le pipeline de A à Z

Quand j'envoie à Coach Analyse une semaine de données running, voilà ce qui se passe concrètement sous le capot.

1. Tokenisation Le texte est découpé en tokens — des unités subword, ni des mots entiers ni des lettres isolées. "Running" peut devenir 1 ou 2 tokens selon le modèle. "Kilomètres" sera probablement découpé. Un token représente en moyenne 0,75 mot en anglais, un peu moins en français. C'est important : la fenêtre de contexte d'un modèle est mesurée en tokens, pas en mots.

2. Embeddings Chaque token est converti en un vecteur numérique — une liste de nombres qui le positionne dans un espace mathématique à plusieurs milliers de dimensions. Les tokens sémantiquement proches ("course", "running", "jogging") se retrouvent proches dans cet espace. C'est ici que le sens commence à exister pour le modèle.

3. Mécanisme d'attention C'est le cœur du transformer, introduit dans le papier Attention Is All You Need en 2017. Pour chaque token, le modèle calcule son degré de relation avec tous les autres tokens du contexte. "Kilomètres" est fortement lié à "distance" et "séance", moins à "récupération". Ce calcul de pondération, appliqué en parallèle sur toute la séquence, donne au modèle sa capacité à comprendre le contexte long.

4. Couches transformer L'attention n'est pas appliquée une seule fois — elle est empilée sur des dizaines, voire des centaines de couches. Chaque couche affine la représentation. Les premières couches captent la syntaxe, les suivantes la sémantique, les plus profondes des relations abstraites. C'est cette profondeur qui distingue un petit modèle d'un grand.

5. Distribution de probabilités et génération En sortie, le modèle ne renvoie pas un mot — il renvoie une distribution de probabilités sur l'ensemble du vocabulaire (souvent 100 000 tokens ou plus). "Course" à 38%, "séance" à 27%, "entraînement" à 19%... Un mécanisme de sampling sélectionne le token suivant selon cette distribution. La temperature règle le curseur : basse, le modèle est déterministe et conservateur ; haute, il est plus créatif et imprévisible.

6. La boucle auto-régressive Le token généré est ajouté au contexte, et tout recommence. Une réponse de 200 mots, c'est environ 250 passages dans cette boucle. C'est pour ça que la génération prend du temps — et que les modèles rapides sont une prouesse d'optimisation.


Du LLM à l'agent — ce que ça change

Un LLM seul est stateless. Il ne se souvient de rien entre deux appels. Il n'agit pas. Il prédit.

Un agent IA, c'est un LLM auquel on a donné des outils — accès à une base de données, capacité d'appeler une API, possibilité de lire un fichier CSV — et une boucle de raisonnement qui lui permet de décider quand et comment utiliser ces outils.

Dans le cas de Coach Analyse et Coach Plan, le LLM reçoit en contexte mes données de running exportées en CSV, un prompt système qui définit son rôle et ses contraintes, puis il génère une analyse ou un plan structuré. Il ne "sait" pas courir. Il a appris, à partir de milliards de textes sur l'entraînement sportif, quels patterns produire face à ce type de données.

C'est Andrej Karpathy qui formule ça le mieux avec son concept de "Software 2.0" : (Source : Karpathy — Medium) au lieu d'écrire des règles explicites ("si allure < 5min/km alors performance = bonne"), on entraîne un modèle sur des exemples et on laisse les poids encoder ces règles implicitement. Le code devient des données. La logique devient de la statistique.

Ce n'est pas moins rigoureux. C'est différemment rigoureux.


Comprendre le pipeline d'un LLM ne transforme pas magiquement la façon dont on écrit des prompts. Mais ça change la façon dont on pense ce qu'on construit. Savoir que le modèle génère token par token, que la fenêtre de contexte est limitée, que la température influe sur la cohérence — ce sont des leviers concrets, pas de la théorie.

Quand j'ai compris ça, j'ai revu mes prompts système, affiné la façon dont je structure les données CSV envoyées en contexte, et rendu mes agents plus prévisibles. Pas parce que j'ai tout compris. Parce que j'ai compris ce qui compte.

L'IA ne remplace pas — l'immobilité, oui.

Schéma — Pipeline complet d'un LLM


Légende

Étape Ce qui se passe concrètement
Tokenisation Le texte est découpé en unités subword — pas des mots entiers, pas des lettres. "running" peut devenir 1 ou 2 tokens selon le modèle.
Embeddings Chaque token est converti en un vecteur de nombres. Les tokens sémantiquement proches sont proches dans cet espace mathématique.
Attention Le mécanisme clé du transformer. Il calcule pour chaque token son degré de relation avec tous les autres. C'est ce qui donne au modèle son "contexte".
Couches Transformer L'attention est appliquée N fois en profondeur. GPT-4 en a des centaines. Chaque couche raffine la représentation.
Distribution de probabilités Le modèle ne "choisit" pas un mot — il calcule la probabilité de chaque token possible dans le vocabulaire (~100k tokens).
Sampling / Temperature La température contrôle la créativité : basse = déterministe, haute = plus aléatoire. C'est ici qu'on règle le comportement du modèle.
Boucle auto-régressive Le LLM génère un token à la fois, puis se relit pour générer le suivant. Une réponse de 200 mots = ~250 passages dans cette boucle.