Aller au contenu
4h pour Maîtriser l'IA

C'est quoi un LLM

C'est quoi un LLM ?

Slides du chapitre

Introduction : Pourquoi s'intéresser aux LLM ?

Vous utilisez probablement déjà un LLM sans le savoir. Quand vous demandez à ChatGPT de rédiger un mail professionnel, quand vous discutez avec Claude pour préparer un cours, ou quand vous utilisez Gemini pour résumer un long document... vous interagissez avec un Large Language Model.

Mais au-delà du buzzword à la mode, qu'est-ce qu'un LLM exactement ? Comment ça fonctionne ? Et surtout, pourquoi est-ce que ça a révolutionné notre manière d'interagir avec les machines en à peine 2 ans ?

Dans ce chapitre, on va démystifier tout ça. Pas de jargon inutile, juste les concepts essentiels pour comprendre cette technologie qui transforme déjà l'éducation, l'administration, la communication, et à peu près tous les métiers qui touchent au langage.

Objectifs d'apprentissage 🎯 À la fin de ce chapitre, vous serez capable de :

  • Définir ce qu'est un LLM et expliquer ce qui le différencie d'un chatbot classique
  • Situer l'évolution historique des LLM dans le contexte de l'IA
  • Identifier les principaux acteurs et modèles du marché
  • Comprendre les ordres de grandeur (paramètres, tokens, coûts)

1. Définition : Un LLM, c'est quoi concrètement ?

La définition simple

Un Large Language Model (LLM) ou "grand modèle de langage" est un programme d'intelligence artificielle capable de comprendre et de générer du texte en langage naturel. [^1] [^2]

Mais attention, on ne parle pas d'un simple "robot qui parle". Un LLM, c'est :

  • 🧠 Un réseau de neurones profond entraîné sur des milliards de mots
  • 📊 Un système probabiliste qui prédit le mot suivant dans une séquence
  • 🎯 Un modèle généraliste capable d'effectuer une multitude de tâches sans être spécifiquement programmé pour chacune

Ce qui rend un LLM "large" (grand)

Le terme "large" fait référence à deux caractéristiques :

Caractéristique Ordre de grandeur Exemple
Paramètres Centaines de milliards GPT-3 : 175 milliards [^3]
Données d'entraînement Billions de tokens LLaMA 3 : 15 billions de tokens [^4]

💡 Analogie : Imaginez que vous voulez apprendre toutes les langues du monde. Plus vous lisez de livres (données), plus votre cerveau développe de connexions neuronales (paramètres), et mieux vous comprenez les subtilités du langage.

LLM vs Chatbot classique : quelle différence ?

Avant les LLM, les chatbots fonctionnaient avec des règles prédéfinies et des arbres de décision. Exemple typique : le chatbot de votre banque qui vous propose 3 options à chaque étape.

Chatbot classique

  • Suit un script fixe
  • Ne comprend que les phrases prévues
  • Incapable d'improviser

LLM moderne

  • Comprend le contexte
  • Génère des réponses originales
  • S'adapte à la conversation

2. Comment ça marche ? (Vision d'ensemble)

Sans rentrer dans les détails mathématiques, voici les 3 éléments clés à comprendre :

🎲 Principe 1 : La prédiction probabiliste

À la base, un LLM fait quelque chose d'apparemment simple : il prédit statistiquement quel est le mot le plus probable qui devrait suivre, en se basant sur des millions d'exemples vus pendant son entraînement. [^5]

Exemple concret : Vous écrivez : "Je vais au supermarché acheter du..."

Le LLM calcule les probabilités :

  • "pain" → 35%
  • "lait" → 28%
  • "fromage" → 15%
  • "JavaScript" → 0,001% 🤡

Et il choisit le mot le plus probable (ou un peu moins probable pour varier, selon un paramètre appelé "température").

Mais attention : ce mécanisme apparemment simple permet en réalité de faire énormément de choses !

Prédire le prochain mot, c'est aussi :

  • 📝 Écrire : des mails, des rapports, des poèmes, des articles...
  • 🧮 Calculer : résoudre des problèmes mathématiques en générant les étapes de raisonnement
  • 💻 Coder : écrire des programmes en prédisant les lignes de code logiques
  • 🌍 Traduire : passer d'une langue à l'autre en prédisant les mots équivalents
  • 💬 Converser : maintenir un dialogue cohérent en prédisant les réponses appropriées
  • 🎯 Raisonner : décomposer un problème complexe étape par étape

C'est cette polyvalence qui fait toute la puissance des LLM modernes !

🏗️ Principe 2 : L'architecture Transformer

Depuis 2017, presque tous les LLM utilisent une architecture appelée Transformer. [^6]

Sans entrer dans les détails techniques, retenez que :

  • Les Transformers peuvent traiter toute une phrase en parallèle (contrairement aux anciens réseaux de neurones séquentiels)
  • Ils utilisent un mécanisme d'"attention" qui permet au modèle de comprendre quels mots sont importants dans une phrase
  • Cette architecture a permis de créer des modèles beaucoup plus grands et performants

📚 Principe 3 : L'entraînement en trois phases

Les LLM modernes passent par plusieurs étapes d'entraînement, chacune améliorant leurs capacités :

  1. Pré-entraînement : Le modèle lit des milliards de pages web, livres, articles, et apprend les structures du langage [^7]

  2. Affinage (fine-tuning & RLHF) : On spécialise le modèle pour certaines tâches (être un assistant conversationnel, écrire du code, etc.) et on lui apprend à donner des réponses utiles grâce à l'apprentissage par renforcement avec retour humain (RLHF)[^8]

  3. Test-time compute (RL) : Phase d'entraînement plus récente où le modèle apprend à "réfléchir plus longtemps" sur les problèmes complexes. Les modèles comme o1, o3 (OpenAI) ou DeepSeek-R1 utilisent cette technique pour améliorer leur raisonnement [^9]

⚠️ Important : L'entraînement d'un LLM coûte des millions de dollars en puissance de calcul. Les chiffres donnent le vertige :

  • GPT-4 (2023) : environ 100 millions de dollars [^34]
  • DeepSeek V3 (2024) : seulement 5,6 millions de dollars [^31] [^32]
  • GPT-4.5/GPT-5 (2025) : estimé à plusieurs centaines de millions de dollars

💡 Fait intéressant : DeepSeek a prouvé qu'on peut créer des modèles très performants sans dépenser des milliards. Leur secret ? Des optimisations algorithmiques intelligentes et l'utilisation de puces moins coûteuses.

3. Un peu d'histoire : De GPT-1 à aujourd'hui

La timeline qui a tout changé

Année Événement Impact
2017 Google publie le papier "Attention is All You Need" Naissance de l'architecture Transformer 🎉
2018 GPT-1 (OpenAI) : 117M paramètres Première démonstration du potentiel
2019 GPT-2 (OpenAI) : 1,5B paramètres OpenAI le juge "trop dangereux" pour être diffusé publiquement [^8]
2020 GPT-3 (OpenAI) : 175B paramètres Premier vrai "wow effect" grand public [^3]
2022 ChatGPT lancé 100 millions d'utilisateurs en 2 mois [^9]
2023 GPT-4 (OpenAI) : ~1,8 trillion de paramètres Architecture MoE (Mixture of Experts) [^51] [^54]
2023-2024 Explosion : Claude, Gemini, Mistral, Qwen, DeepSeek La course à l'IA s'internationalise
2025 GPT-5 (août) Modèle unifié avec raisonnement avancé [^21] [^22]

Le moment ChatGPT : pourquoi maintenant ?

ChatGPT n'était pas la première IA capable de générer du texte. Mais trois facteurs ont convergé :

  1. Interface accessible : Une simple boîte de discussion, pas besoin d'être développeur
  2. Performances impressionnantes : GPT-3.5 était suffisamment bon pour être utile au quotidien
  3. Timing parfait : Sortie juste avant les vacances de Noël 2022, viralité maximale sur les réseaux sociaux

📊 Chiffre clé : En janvier 2023, ChatGPT était déjà l'application grand public à la croissance la plus rapide de l'histoire. [^9]


4. Les acteurs principaux du marché

En 2025, le marché des LLM est plus dynamique que jamais. Les géants américains font face à une concurrence chinoise de plus en plus sérieuse.

🏆 Les "Big Three" américains

OpenAI (ChatGPT)

  • Modèles : GPT-5 (août 2025), GPT-4.5, o-series (modèles de raisonnement) [^21] [^22]
  • Points forts : Le plus populaire, 400 millions d'utilisateurs actifs hebdomadaires [^11]
  • Particularité : GPT-5 unifie raisonnement avancé et multimodalité en un seul système
  • GPT-4 : ~1,8 trillion de paramètres, architecture MoE avec 16 experts [^51] [^54]
  • Limite : Modèles propriétaires, code source fermé

Anthropic (Claude)

  • Modèles : Claude Sonnet 4.5, Claude Opus 4.1 [^12]
  • Points forts : Excellente compréhension de texte, fenêtre de contexte étendue (200K tokens) [^13]
  • Particularité : Approche "IA Constitutionnelle" axée sur la sécurité [^14]
  • Avantage : Version gratuite avec accès au dernier modèle

Google (Gemini)

  • Modèles : Gemini 2.5 Pro, Gemini Flash [^15]
  • Points forts : Fenêtre de contexte d'1 million de tokens [^16]
  • Particularité : Multimodal dès le départ (texte, image, audio, vidéo)
  • Avantage : Intégration native avec tous les services Google

🇨🇳 Les challengers chinois qui bousculent le marché

DeepSeek (Chine)

  • Modèles : DeepSeek-R1, DeepSeek-V3 (671B paramètres) [^31] [^32]
  • Révolution : Performances comparables à GPT-4 pour seulement 5,6 millions de dollars d'entraînement (vs 100M$ pour GPT-4) [^31] [^40]
  • Points forts : Open-source, optimisation algorithmique poussée, raisonnement avancé
  • Impact : A secoué Wall Street en janvier 2025, prouvant qu'on peut faire des LLM puissants sans budgets astronomiques [^40]

Qwen / Alibaba (Chine)

  • Modèles : Qwen 2.5-Max, Qwen 3 (multimodal et raisonnement hybride) [^41] [^42]
  • Points forts : Multilinguisme (excellent en chinois et anglais), architecture hybride
  • Particularité : Entraîné sur 18+ trillions de tokens [^41]
  • Avantage : Tarifs API très compétitifs

🆓 Les pionniers open-source

Meta (LLaMA)

  • Modèles : LLaMA 3.1 (jusqu'à 405B paramètres) [^17]
  • Particularité : Gratuit, utilisable commercialement
  • Impact : Démocratise l'accès aux LLM pour les entreprises

Mistral AI (France 🇫🇷)

  • Modèles : Mistral Large, Mixtral 8x7B
  • Points forts : Excellent rapport performance/coût
  • Particularité : Développement européen, respect du RGPD

📊 Comparaison rapide

Critère ChatGPT Claude Gemini DeepSeek
Utilisateurs 400M+ Non communiqué 419M visites/mois [^18] N°1 App Store US (janv 2025) [^40]
Contexte max 400K tokens 200K tokens 1M tokens 128K tokens
Force principale Polyvalence & mémoire Analyse & code Multimodalité Prix imbattable
Prix API $$$ $$$ $$$ $ (95% moins cher) [^32]
Approche Propriétaire Propriétaire Propriétaire Open-source

💡 Pour vous, enseignants :

  • Besoin de rédiger des cours ou documents pédagogiques ? → ChatGPT ou Claude
  • Analyser de très longs documents (syllabus complets, thèses) ? → Gemini avec son million de tokens
  • Budget limité mais besoin de performances ? → DeepSeek ou Qwen
  • Besoin d'un assistant multilingue (cours de langues) ? → Qwen excelle en plusieurs langues

5. Les ordres de grandeur à retenir

Pour vraiment comprendre ce qu'est un LLM, il faut saisir les échelles en jeu :

Taille des modèles

  • GPT-3 (2020) : 175 milliards de paramètres [^3]
  • GPT-4 (2023) : ~1,8 trillion de paramètres (architecture MoE avec 16 experts) [^51] [^54] [^55]
  • DeepSeek V3 (2024) : 671 milliards de paramètres (MoE, seulement 37B activés par token) [^33]
  • LLaMA 3.1 (2024) : jusqu'à 405 milliards [^17]

⚠️ Attention : Plus n'est pas toujours mieux ! Un modèle plus petit mais mieux entraîné peut surpasser un géant mal optimisé. DeepSeek l'a prouvé avec des résultats exceptionnels pour "seulement" 671B paramètres.

Quantité de données

  • GPT-1 (2018) : 985 millions de mots (BookCorpus) [^4]
  • GPT-4 (2023) : ~13 trillions de tokens [^54] [^55]
  • LLaMA 3 (2024) : 15 trillions de tokens [^4]
  • Qwen 2.5 (2024) : 18+ trillions de tokens [^41]

Pour mettre ça en perspective : si vous lisiez 300 mots/minute, 24h/24, 7j/7, il vous faudrait environ 95 000 ans pour lire toutes les données d'entraînement de LLaMA 3. 🤯

Coûts d'entraînement (la révolution DeepSeek)

Modèle Année Coût estimé Rapport qualité/prix
GPT-4 2023 ~100 millions $ [^34] 💰💰💰 Très cher
DeepSeek V3 2024 5,6 millions $ [^31] [^32] 💰 Prix révolutionnaire !
GPT-4.5/GPT-5 2025 Plusieurs centaines de millions $ 💰💰💰💰 Le plus cher

💡 La leçon DeepSeek : En janvier 2025, cette start-up chinoise a secoué l'industrie en montrant qu'on peut créer un modèle aussi performant que GPT-4 pour moins de 6 millions de dollars, soit 95% moins cher ! [^31] [^32] [^40]

Comment ont-ils fait ?

  • Optimisations algorithmiques poussées (architecture MoE efficace)
  • Utilisation de puces moins coûteuses (Nvidia H800)
  • Techniques de "distillation" pour réduire la taille sans perdre en performance

Utilisation via API : Quelques cents par millier de tokens pour les modèles commerciaux, DeepSeek étant jusqu'à 95% moins cher que ses concurrents [^36]

6. Ce qu'un LLM n'est PAS (probablement...)

Pour éviter les malentendus, clarifions quelques points importants. Attention, certains sujets sont encore débattus par les chercheurs !

Un LLM a-t-il une conscience ? C'est une question philosophique complexe et encore débattue. Ce qui est certain :

  • Les LLM traitent l'information d'une manière très différente des humains
  • Ils n'ont pas d'émotions, de désirs ou d'intentions propres (à notre connaissance)
  • Mais définir précisément la "conscience" est déjà difficile pour les humains !

Un LLM "sait"-il vraiment des choses ? Question délicate ! Les LLM :

  • Ont "absorbé" une quantité phénoménale d'informations pendant leur entraînement
  • Peuvent mobiliser ces informations de manière cohérente et pertinente
  • Mais ne "comprennent" probablement pas au sens humain du terme
  • C'est plutôt une forme de "reconnaissance de patterns" ultra-sophistiquée

Ce qui est certain :

Un LLM n'est pas une base de données Il ne stocke pas les faits comme Google. Il génère des réponses basées sur des probabilités, ce qui explique pourquoi il peut parfois inventer des informations (on appelle ça des "hallucinations").

Un LLM n'a pas accès à Internet (par défaut) Sans outils additionnels (comme la recherche web), il ne connaît que ce qu'il a vu pendant son entraînement. Sa "date limite de connaissance" (knowledge cutoff) détermine ce qu'il peut savoir.

Un LLM peut se tromper Même les meilleurs modèles font des erreurs, surtout sur :

  • Des faits très spécifiques ou récents
  • Des calculs complexes
  • Des raisonnements nécessitant plusieurs étapes logiques

Ce qu'un LLM EST vraiment : Un outil puissant de traitement du langage qui, bien utilisé et avec un regard critique, peut considérablement augmenter votre productivité.

Synthèse : Les points clés à retenir

🎯 Définition : Un LLM est un modèle d'IA entraîné sur des milliards de textes pour comprendre et générer du langage naturel.

📈 Évolution : De GPT-1 (2018) à aujourd'hui, les modèles ont été multipliés par 1000+ en taille et capacités.

🏢 Acteurs : OpenAI (ChatGPT), Anthropic (Claude) et Google (Gemini) dominent, mais l'open-source (LLaMA, Mistral) gagne du terrain.

⚙️ Fonctionnement : Architecture Transformer + prédiction probabiliste + entraînement massif = génération de texte cohérent.

💰 Échelles : Centaines de milliards de paramètres, trillions de tokens, millions de dollars d'entraînement.

Pour aller plus loin

Questions de réflexion 🤔

  1. Si un LLM ne "comprend" pas vraiment le langage, pourquoi ses réponses semblent-elles intelligentes ?
  2. Quels sont les risques éthiques liés à l'utilisation massive de LLM dans l'éducation ?
  3. Un modèle open-source comme LLaMA peut-il rattraper (ou dépasser) ChatGPT ?

Ressources complémentaires 📚

Sources

[^1]: Cloudflare. (2024). Qu'est-ce qu'un grand modèle de langage (LLM) ?. https://www.cloudflare.com/fr-fr/learning/ai/what-is-large-language-model/

[^2]: AWS. (2025). Qu'est-ce que le LLM ? - Explication des grands modèles de langage. https://aws.amazon.com/fr/what-is/large-language-model/

[^3]: IBM. (2025). Qu'est-ce qu'un LLM (Large Language Models) ?. https://www.ibm.com/fr-fr/think/topics/large-language-models

[^4]: Wikipédia. (2024). Grand modèle de langage. https://fr.wikipedia.org/wiki/Grand_modèle_de_langage

[^5]: DataScientest. (2024). Grand modèle de langage (LLM) : Tout ce qu'il faut savoir. https://datascientest.com/large-language-models-tout-savoir

[^6]: Techopedia. (2024). Large language model définition. https://www.techopedia.com/fr/dictionnaire/grand-modele-de-langage-general

[^7]: DataBird. (2024). Large Language Model (LLM) : Qu'est ce qu'un LLM ?. https://www.data-bird.co/blog/llm-definition

[^8]: Wikipedia. (2025). Large language model. https://en.wikipedia.org/wiki/Large_language_model

[^9]: TalkAI. (2024). ChatGPT vs Gemini vs Claude vs Llama : quel modèle est le meilleur. https://talkai.info/fr/blog/comparative_analysis_of_chatgpt_gemini_claude_llama/

[^10]: DataStudios. (2025). ChatGPT vs Google Gemini vs Anthropic Claude: Full Report and Comparison (Mid-2025). https://www.datastudios.org/post/chatgpt-vs-google-gemini-vs-anthropic-claude-full-report-and-comparison-mid-2025

[^11]: ControlSys. (2025). Claude vs ChatGPT vs Gemini 2025 : Comparatif Complet des 3 IA. https://controlsys.fr/blog/claude-vs-chatgpt-vs-gemini-guide-2025/

[^12]: Creator Economy. (2025). ChatGPT vs Claude vs Gemini: The Best AI Model for Each Use Case in 2025. https://creatoreconomy.so/p/chatgpt-vs-claude-vs-gemini-the-best-ai-model-for-each-use-case-2025

[^13]: Intellectual Lead. (2025). ChatGPT vs Claude vs Gemini : une comparaison détaillée. https://intellectualead.com/fr/chatgpt-claude-gemini/

[^14]: Wild Code School. (2024). Comprendre les Modèles d'IA en 2024 : ChatGPT, Gemini, Claude.... https://www.wildcodeschool.com/blog/fondamentaux-modeles-ia-2024

[^15]: Jedha. (2025). Gemini vs ChatGPT : quelle est la meilleure IA en 2025 ?. https://www.jedha.co/formation-ia/gemini-vs-chatgpt-quelle-est-la-meilleure-ia-en-2025

[^16]: DataLeon. (2024). Qu'est-ce qu'un Large Language Model (LLM) ?. https://www.dataleon.ai/blog/quest-ce-quun-large-language-model-llm

[^17]: Hupp Communication. (2024). ChatGPT vs Claude vs Gemini : quel IA choisir pour vos développements web ?. https://hupp-communication.fr/chatgpt-vs-claude-vs-gemini-quel-ia-choisir-pour-vos-developpements-web/

[^18]: Loup Digital. (2024). Quel chatbot IA choisir en 2025 ? Comparez Claude, ChatGPT.... https://leloupdigital.fr/claude-chatgpt-grok-mistral-gemini-differences-2025/

[^19]: Foxeet. (2025). Mistral, ChatGPT, Claude, Gemini… Quelle IA Choisir selon vos Besoins en Entreprise ?. https://foxeet.fr/contenu/mistral-chatgpt-claude-gemini-quelle-ia-choisir-comparatif

[^21]: Botpress. (2025). Tout ce que vous devez savoir sur le GPT-5. https://botpress.com/fr/blog/everything-you-should-know-about-gpt-5

[^22]: Wikipédia. (2025). GPT-5. https://fr.wikipedia.org/wiki/GPT-5

[^31]: Intelligence Artificielle. (2025). DeepSeek, la révolution IA à petit budget qui remet en question ChatGPT. https://intelligence-artificielle.com/deepseek-tout-savoir/

[^32]: Le Grand Continent. (2025). DeepSeek : la Chine a développé une IA aussi performante que ChatGPT pour 7 % du coût. https://legrandcontinent.eu/fr/2025/01/25/la-chine-a-developpe-une-ia-aussi-performante-que-chatgpt-pour-7-du-cout/

[^33]: Thunderbit. (2025). 50 Statistiques Récentes sur DeepSeek (2025). https://thunderbit.com/fr/blog/deepseek-ai-statistics

[^34]: DeepAI. (2025). Combien coûte réellement GPT-4 ? Guide des prix et options pour les utilisateurs et développeurs. https://deepai.fr/chatgpt/combien-coute-reellement-gpt-4-guide-des-prix-et-options-pour-les-utilisateurs-et-developpeurs/

[^36]: École Cube. (2025). DeepSeek : Guide, Présentation et Avis (2025). https://www.ecole.cube.fr/blog/deepseek-aussi-puissant-que-chatgpt

[^40]: Blog du Modérateur. (2025). DeepSeek : 5 choses à savoir sur l'IA chinoise qui concurrence ChatGPT. https://www.blogdumoderateur.com/deepseek-5-choses-savoir-ia-chinoise-concurrence-chatgpt/

[^41]: BtoB Leaders. (2025). Qwen 2.5 : un modèle d'IA concurrent de ChatGPT ?. https://btob-leaders.com/qwen-2-5-alibaba-un-nouveau-modele-dia-chinoise-concurrente-de-chatgpt/

[^42]: Développez.com. (2025). L'entreprise technologique chinoise Alibaba a lancé une nouvelle version de son modèle d'IA Qwen 2.5-Max. https://intelligence-artificielle.developpez.com/actu/368554/

[^51]: The Decoder. (2023). GPT-4 has more than a trillion parameters. https://the-decoder.com/gpt-4-has-a-trillion-parameters/

[^54]: Life Architect. (2025). GPT-4 (2022). https://lifearchitect.ai/gpt-4/

[^55]: Patrick McGuinness. (2023). GPT-4 Details Revealed. https://patmcguinness.substack.com/p/gpt-4-details-revealed

https://www.aihero.dev/what-are-tokens