La « conversation » n'est qu'une répétition de tokens
Les Large Language Models (LLMs) génèrent du texte en prédisant un token à la fois, de manière répétée, jusqu'à ce qu'ils terminent une réponse. Ce mécanisme diffère fondamentalement de la compréhension humaine, mais permet des résultats étonnamment sophistiqués. La « conversation » n'est pas une véritable compréhension ; c'est une danse probabiliste d'associations statistiques.
Avant d'être traité, le texte saisi subit une tokenization, où il est décomposé en mots courants et en fragments de mots. Par exemple, « incroyable » pourrait être divisé en « in », « croy », « able ». Un token représente en moyenne les trois quarts d'un mot. Le nombre de tokens impacte directement les coûts d'API, les limites de la fenêtre de contexte et parfois la latence. Explorez ce processus avec le Tokenizer d'OpenAI ou le résumé des tokenizers de Hugging Face.
Les LLMs sont intrinsèquement stateless (sans état) ; ils ne possèdent aucune mémoire intrinsèque entre les requêtes. Lorsqu'une interface de chat semble « se souvenir » des interactions passées, elle y parvient en renvoyant l'intégralité de l'historique de la conversation (ou les faits stockés pertinents) à chaque nouvelle requête. Cela consomme un espace de contexte précieux et contribue directement à l'utilisation des tokens.
À l'intérieur du Transformer : poids, attention et entraînement
Sous la surface de la prédiction de tokens se cache une architecture complexe. Imaginez le calcul du prix d'une maison : entrez la taille (100 m²), multipliez par un weight (disons 3 000), et obtenez un résultat (300 000 €). Les LLMs appliquent cela à plus grande échelle, en empilant des centaines de layers avec des milliers de « neurones » pour traiter des modèles beaucoup plus complexes. Ces milliards de poids, collectivement appelés parameters, sont fixes lors de l'inférence mais ajustés lors de l'entraînement.
Le « T » de GPT signifie Transformer, et son innovation clé est l'attention. Imaginez le mot « banque » : son sens change radicalement entre « bord de banque » (rivière) et « banque financière ». L'attention permet à chaque token de pondérer dynamiquement l'importance des autres tokens dans la séquence d'entrée, en levant l'ambiguïté du sens en reliant « banque » à « rivière » ou à « argent ». Ce mécanisme, introduit dans l'article fondateur « Attention Is All You Need », empêche les tokens d'être traités de manière isolée.
Le pipeline d'apprentissage comprend plusieurs étapes. Le pre-training commence avec des poids aléatoires, où le modèle prédit les tokens manquants et ajuste ses poids via la backpropagation en fonction de l'erreur. Ce processus itératif, répété des milliers de milliards de fois, affine les prédictions. Le fine-tuning adapte ensuite le modèle pré-entraîné à des tâches spécifiques en utilisant des jeux de données plus petits et sélectionnés. Enfin, le reinforcement learning peut optimiser davantage le comportement en notant les sorties du modèle et en ajustant les poids pour favoriser les réponses les mieux notées, intégrant souvent le feedback humain (RLHF) ou des vérifications automatisées.
Rendre les modèles plus petits — et leur fournir des faits actualisés
Adapter de grands modèles à des tâches spécifiques peut être gourmand en ressources, mais des techniques comme LoRA (Low-Rank Adaptation) offrent une solution rentable. LoRA gèle la grande majorité des poids originaux d'un modèle, en n'entraînant qu'un petit ensemble supplémentaire de paramètres — souvent moins de 1 % de la taille du modèle de base. Cela réduit considérablement la charge de calcul, permettant un fine-tuning sur un seul GPU.
La Quantization traite l'empreinte mémoire de ces modèles colossaux. Chaque poids dans un LLM est généralement stocké sous forme de nombre de 16 bits. Un modèle de 8 milliards de paramètres, par exemple, consomme environ 16 gigaoctets. La Quantization réduit cela en stockant les poids avec moins de bits (par exemple, 8 ou 4 bits), en les arrondissant à des valeurs moins précises. Bien que cela réduise la taille du modèle — une version quantifiée en 4 bits du même modèle pourrait faire environ 5 gigaoctets, exécutable sur un ordinateur portable — cela introduit un compromis, sacrifiant potentiellement un peu de précision.
Pour étendre les connaissances d'un modèle au-delà de ses données d'entraînement, le Retrieval-Augmented Generation (RAG) exploite des informations externes. Ce processus commence par la conversion du texte en embeddings — de longues listes de nombres qui capturent numériquement le sens sémantique, permettant une comparaison par similarité. Ces embeddings, ainsi que leur texte original, sont ensuite stockés dans une base de données vectorielle.
Lorsqu'un utilisateur pose une question, l'application transforme d'abord cette requête en embedding. Elle recherche ensuite dans la base de données vectorielle des passages sémantiquement similaires. Ces passages récupérés sont ensuite ajoutés au prompt original, permettant au LLM de générer une réponse informée par des données actuelles ou propriétaires sur lesquelles il n'a jamais été explicitement entraîné. Explorez comment le texte se convertit en tokens et en embeddings avec l'outil OpenAI Tokenizer Tool.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
D'une simple réponse à des agents qui passent à l'action
Les modèles, par essence, sont des générateurs de texte. Ils ne peuvent pas rechercher indépendamment sur le web ou exécuter des commandes. C'est là qu'intervient le tool calling : le modèle identifie un besoin pour une fonction externe, puis demande une action spécifique autorisée dans un format structuré. Le code de l'application, et non le modèle lui-même, reçoit cette requête, exécute l'outil et renvoie le résultat au modèle sous forme de texte brut.
De nombreux services exposent ces outils via le Model-Client Protocol (MCP), un modèle de connexion courant qui permet aux applications d'IA compatibles de découvrir et d'interagir avec des capacités externes. Le MCP définit comment une application peut communiquer avec un outil, mais il ne dicte pas le raisonnement interne ou les capacités du modèle. Le modèle utilise le MCP pour demander des actions ; il ne les exécute pas.
Ces concepts convergent dans une agent loop. Un agent d'IA reçoit une tâche, identifie les outils nécessaires et les appelle via le MCP. Il inspecte ensuite la sortie de l'outil, met à jour son état interne et répète le processus jusqu'à ce que la tâche soit terminée. Ce cycle itératif permet des flux de travail complexes, de la réservation de vols à l'analyse de données.
Bien que puissants, ces flux de travail autonomes nécessitent une gestion prudente. Validez toujours les sorties des outils, configurez les autorisations appropriées pour empêcher tout accès non autorisé et examinez attentivement l'exposition des données. Les agents excellent dans les tâches structurées, mais leur autonomie a des limites ; la supervision humaine reste cruciale pour un fonctionnement robuste et sûr.
Questions fréquemment posées
Qu'est-ce qu'un LLM en termes simples ?
Un large language model prédit les tokens suivants probables à partir de son entrée, répétant le processus pour générer une réponse.
Les chatbots d'IA se souviennent-ils des conversations passées ?
Le modèle lui-même est généralement sans état (stateless). Une application de chat peut créer une continuité en envoyant l'historique de la conversation ou des informations enregistrées avec une nouvelle requête.
Quelle est la différence entre le RAG et le fine-tuning ?
Le RAG récupère des informations pertinentes au moment de la réponse et les ajoute au prompt. Le fine-tuning ajuste les poids du modèle en utilisant des exemples d'entraînement supplémentaires.
En quoi un agent d'IA est-il différent d'un chatbot ?
Un agent peut exécuter une boucle de raisonnement et d'actions, en utilisant des outils, en vérifiant les résultats et en continuant vers une tâche plutôt que de répondre une seule fois.

