Littérature scientifique (part 1)
PARTIE 1 : Pourquoi la recherche existe (et pourquoi ça te concerne)
Slides du chapitre
La recherche scientifique : pas que pour les profs en blouse blanche 🥼
Bon, on va casser un mythe direct : la recherche scientifique, c'est pas juste des gens en blouse qui mélangent des trucs colorés dans des tubes à essai. En informatique, c'est des développeurs, des ingénieurs, des chercheurs qui se posent des questions et qui tentent d'y répondre de manière rigoureuse.
Concrètement, la recherche c'est quoi ?
La recherche scientifique, c'est l'art de :
1. Trouver des questions sans réponse
Tu sais, toutes ces questions que personne ne s'est posé ou que personne n'a encore résolues ? Genre :
- "Est-ce qu'on peut réduire la consommation d'énergie d'un algorithme de machine learning sans sacrifier ses performances ?"
- "Comment rendre une application web accessible aux personnes malvoyantes sans refondre tout le code ?"
- "Pourquoi ce framework tout neuf crash systématiquement après 10 000 requêtes ?"
Bah la recherche, c'est partir de ce genre de questions et essayer d'y répondre de façon méthodique et vérifiable.
2. Tester si quelque chose fonctionne (ou pas)
Et attention, c'est super important : prouver que quelque chose NE fonctionne PAS, c'est aussi valable que de prouver que ça fonctionne ! On y reviendra, mais retiens déjà ça : un échec bien documenté, c'est de la science de qualité (ง'̀-'́)ง
3. Documenter et partager
La recherche, c'est pas juste trouver un truc dans ton coin et garder ça pour toi. C'est :
- Documenter ta démarche (comment t'as fait, avec quels outils, quelles données)
- Partager tes résultats (via des articles, des conférences)
- Permettre aux autres de vérifier, reproduire, ou construire sur ton travail
C'est un peu comme GitHub pour la connaissance : tu build sur le travail des autres, et les autres buildent sur le tien 🔄
La problématisation : l'art de poser les bonnes questions 🎯
T'as déjà vu un dev junior arriver avec "mon code marche pas" ? Bah c'est exactement ce qu'il ne faut pas faire en recherche. Une bonne recherche commence par une bonne question.
De la question vague à la question de recherche
Regarde la différence :
| ❌ Question trop vague | ✅ Question de recherche précise |
|---|---|
| "L'IA c'est bien ?" | "Les modèles de langage de plus de 100 milliards de paramètres offrent-ils un gain de performance significatif comparé aux modèles de 10 milliards pour des tâches de classification de texte ?" |
| "PHP c'est rapide ?" | "Quelle est la différence de temps de traitement entre PHP 8.2 et Node.js 20 pour une API REST traitant 10 000 requêtes/seconde ?" |
| "Le web pollue ?" | "Quelle est l'empreinte carbone moyenne d'une requête vers un modèle LLM hébergé dans le cloud comparée à une recherche Google traditionnelle ?" |
Tu vois la diff ? Une bonne question de recherche est :
- Précise : on sait exactement ce qu'on mesure
- Mesurable : on peut obtenir des chiffres, des données
- Pertinente : ça répond à un vrai problème ou besoin
- Réaliste : on peut effectivement faire les tests
La problématisation : creuser plus profond
Problématiser, c'est pas juste poser une question random. C'est :
1. Partir d'une observation ou d'un besoin
"Les développeurs se plaignent que leur application Vue.js devient lente avec beaucoup de composants"
2. Contextualiser
"Plusieurs frameworks JS ont ce problème. React a introduit le Virtual DOM, Vue utilise un système de réactivité. Qu'est-ce qui cause vraiment ces ralentissements ?"
3. Formuler une question précise
"Est-ce que le système de réactivité de Vue.js devient un goulot d'étranglement lorsque le nombre de composants dépasse 500, et si oui, existe-t-il des patterns d'optimisation efficaces ?"
4. Définir comment tu vas y répondre
"On va créer une app test avec 100, 300, 500, et 1000 composants, mesurer les performances, identifier les bottlenecks, et tester différentes optimisations"
C'est ça la problématisation : transformer un "ça lag" en une vraie démarche scientifique 🔬
Exemple concret en veille techno
Imaginons que t'entends parler de ChatGPT et de son impact écologique. Au lieu de juste dire "ouais ça pollue", tu problématises :
- Observation : "On dit que l'IA consomme beaucoup d'énergie"
- Contexte : "Les data centers existent depuis longtemps. Qu'est-ce qui change avec les LLMs ?"
- Question : "Quelle est la consommation énergétique réelle d'une requête ChatGPT comparée à une recherche Google, et quels sont les facteurs qui influencent cette consommation ?"
- Méthode : "On va chercher des études qui ont mesuré ça, comparer les chiffres, analyser les méthodologies"
Boom, t'es passé de "ChatGPT pollue" à une vraie question de recherche exploitable ( ˘ ³˘)
Les résultats "négatifs" : l'échec qui fait avancer la science 💀
Voilà un truc que personne te dit à l'école : prouver qu'un truc NE marche PAS, c'est aussi précieux que prouver que ça marche.
Pourquoi c'est important ?
Imagine : un chercheur teste un nouvel algorithme de compression d'images. Il passe 6 mois dessus. Résultat ? C'est moins bon que ce qui existe déjà.
Deux options :
- ❌ Il planque ses résultats, personne en parle jamais
- ✅ Il publie : "On a testé X, voilà pourquoi ça marche pas, évitez de perdre votre temps"
L'option 2 sauve potentiellement des centaines d'heures à d'autres chercheurs qui auraient tenté la même chose ! C'est ça la valeur d'un résultat négatif (•̀ᴗ•́)و
Exemples en informatique
Cas réel : Google+ (RIP 2011-2019)
Google a tenté de créer un réseau social pour concurrencer Facebook. Échec total. Mais ils ont documenté pourquoi :
- Les utilisateurs veulent pas forcément lier leur identité Google à un réseau social
- Le timing était mauvais (Facebook déjà dominant)
- L'approche "cercles" était trop complexe pour l'utilisateur moyen
Résultat ? Plein d'autres entreprises ont évité de refaire les mêmes erreurs. C'est de la recherche appliquée, et l'échec a apporté de la connaissance 📊
En recherche académique
Tu trouveras des papiers avec des titres comme :
- "Why Feature X Does Not Improve Neural Network Performance: An Empirical Study"
- "A Failed Attempt at Optimizing Database Queries Using Method Y"
Ces papiers sont essentiels. Ils disent : "On a essayé, voilà nos résultats, c'était une impasse, voici pourquoi". Ça permet à la communauté d'avancer sans refaire les mêmes erreurs.
Le problème du "publication bias"
Mais attention, voilà le drama : les journaux scientifiques préfèrent souvent publier des résultats positifs ("on a trouvé un truc génial !") plutôt que négatifs ("bon bah ça marche pas en fait").
C'est un vrai problème appelé publication bias (biais de publication) :
- Les chercheurs qui trouvent "rien" ont du mal à publier
- Du coup, la littérature est biaisée vers les succès
- Et on perd énormément de connaissances sur ce qui ne fonctionne pas
Quand tu fais de la veille techno, garde ça en tête : ce que tu ne trouves pas dans les papiers est parfois aussi important que ce que tu trouves 🤔
La crise de la reproductibilité : le sale petit secret 🔓
Bon, accroches-toi, on va parler d'un truc qui fâche dans le monde de la recherche.
C'est quoi la reproductibilité ?
Un article scientifique, c'est censé être comme une recette de cuisine :
- Tu donnes les ingrédients (données, outils)
- Tu expliques les étapes (méthodologie)
- Quelqu'un d'autre devrait pouvoir refaire exactement la même chose et obtenir les mêmes résultats
Bah devine quoi ? Beaucoup de papiers ne sont pas reproductibles (╯°□°)╯︵ ┻━┻
Les chiffres qui font peur
En 2016, une étude dans Nature a montré que :
- 70% des chercheurs ont échoué à reproduire les expériences d'autres scientifiques
- 50% ont échoué à reproduire leurs propres expériences (!!)
En machine learning et IA, c'est encore pire. Pourquoi ?
Raisons courantes de non-reproductibilité :
-
Code source manquant 💾
- "On a entraîné un modèle révolutionnaire !"
- Toi : "Cool, le code est où ?"
- Eux : "Ah bah euh... c'est propriétaire"
- 🚩 Red flag énorme
-
Données privées ou inaccessibles 📊
- "On a testé sur 10 millions d'images"
- Toi : "Je peux avoir le dataset ?"
- Eux : "C'est confidentiel"
- Résultat : impossible de vérifier
-
Paramètres cachés ⚙️
- Les hyperparamètres (learning rate, batch size, etc.) pas documentés
- "On a optimisé le modèle" (ouais mais comment mon gars ?)
- Impossible à reproduire sans ces infos
-
Randomness non contrôlée 🎲
- Pas de seed fixée pour les générateurs aléatoires
- Les résultats varient à chaque exécution
- Tu peux jamais retomber sur leurs chiffres exacts
-
Environnement non spécifié 🖥️
- Versions des librairies non précisées
- Hardware différent (GPU vs CPU)
- "Ça marche sur ma machine™" mais pas ailleurs
Exemple concret qui fait mal
En 2020, un papier célèbre en NLP (traitement du langage) affirmait des performances incroyables sur GPT-3. Problème :
- L'entraînement coûtait $4.6 millions en ressources cloud
- OpenAI n'a pas partagé le code complet
- Les données d'entraînement sont partiellement confidentielles
Résultat : personne ne peut vraiment reproduire leurs résultats. Tu dois leur faire confiance sur parole. C'est de la science ça ? Bof (ಠ_ಠ)
Comment repérer un papier non-reproductible ?
Quand tu lis un article, poses-toi ces questions :
| Question | ✅ Bon signe | 🚩 Red flag |
|---|---|---|
| Code disponible ? | Lien GitHub avec le code complet | "Available upon request" ou rien |
| Données accessibles ? | Dataset public ou lien de téléchargement | "Proprietary dataset" |
| Environnement décrit ? | Versions précises (Python 3.9, TensorFlow 2.8, etc.) | "We used standard libraries" |
| Paramètres complets ? | Tous les hyperparamètres listés | "Default parameters" sans préciser |
| Seed fixée ? | random_seed=42 mentionné |
Aucune mention du random |
Et alors, on fait quoi avec ça ?
Quand tu fais de la veille techno et que tu tombes sur un papier :
- Check la reproductibilité : code + données dispo ?
- Sois critique : si c'est pas reproductible, baisse ta confiance dans les résultats
- Favorise les papiers open : ceux qui partagent tout sont généralement plus fiables
- Cherche des replications : d'autres chercheurs ont-ils tenté de reproduire ? Qu'est-ce qu'ils ont trouvé ?
La reproductibilité, c'est pas un détail technique chiant. C'est LA base de la confiance en science. Sans ça, c'est juste des gens qui racontent des trucs sur internet (et on a déjà assez de ça avec Twitter) 🙃
Ce qu'il faut retenir de cette section 🎓
✅ La recherche cherche des réponses à des questions que personne n'a encore résolues
✅ Problématiser = poser la bonne question, précise et mesurable
✅ Les échecs comptent : prouver qu'un truc marche pas, c'est aussi de la science
✅ Reproductibilité = crédibilité : si personne peut refaire ton expérience, ta recherche vaut que dalle
✅ Sois critique : beaucoup de papiers ont des problèmes de reproductibilité, surtout en IA/ML
Maintenant que tu sais POURQUOI on fait de la recherche, on va voir COMMENT un article scientifique est structuré et comment y accéder (spoiler : c'est le bordel avec les paywalls) 💸
