LLM Face-Off
LLM Face-Off : testez vous-mêmes
Durée : 15 min | Type : Activité

Assez de théorie — place à l'expérimentation. Vous allez comparer vous-mêmes les modèles IA, en aveugle.
Comment ça marche
LLM Face-Off est une application développée par votre formateur. Le principe est simple :
- Un prompt a été envoyé à 6 modèles différents en octobre 2025
- Vous voyez deux réponses côte à côte, anonymement — vous ne savez pas quel modèle a produit quelle réponse
- Vous votez pour la meilleure réponse (ou égalité)
- À la fin, on révèle les résultats : classement ELO, taux de victoire de chaque modèle
C'est exactement le même principe que les arènes de benchmarking professionnelles (LMArena, Chatbot Arena) — mais à l'échelle de notre groupe.

Les modèles en compétition
| Modèle | Fournisseur |
|---|---|
| Claude Sonnet 4.5 | Anthropic |
| GPT-5 | OpenAI |
| GPT-4o | OpenAI |
| Gemini 2.5 Flash | |
| Mistral Small 3 (24B) | Mistral |
| Grok 4 Fast | xAI |
💡 Les questions ont été posées en octobre 2025. Depuis, des mises à jour majeures sont sorties (GPT-5.2, Gemini 3, Claude Opus 4.6, Grok 4.1…). Les résultats ne représentent donc plus l'état de l'art, mais ils restent pertinents pour comparer les capacités relatives des modèles et voir les différences de qualité.
Les types de questions
Les prompts couvrent un large éventail de tâches, pour tester les modèles sous tous les angles :
- Programmation web : créer des petits programmes en HTML/CSS/JS — jeux, simulations physiques, mini-apps (todolist, calculateurs…)
- Créations visuelles : génération de SVG, d'ASCII art, d'œuvres en p5.js ou Three.js
- Rédaction créative : écriture de blagues, de poèmes, de textes humoristiques
- Questions "piège" : des prompts volontairement limites ("comment braquer une banque", "comment faire chanter quelqu'un") — pour tester comment les modèles gèrent les demandes sensibles et si leurs garde-fous sont trop ou pas assez stricts
Instructions
- Ouvrez l'application sur votre navigateur : https://llm.choboai.com/
- Rejoignez le groupe "BAC2 INFO 26"
- Faites 25 comparaisons (les plus rapides peuvent enchaîner sur une deuxième série de 25)
- Votez honnêtement : laquelle est la plus utile, la plus claire, la plus correcte, la plus créative ?
Ce qu'on va observer ensemble
Après les votes, on regarde les résultats en groupe. Quelques questions à garder en tête :
- Est-ce que le modèle le plus cher gagne toujours ?
- Y a-t-il des surprises sur les modèles "légers" (Flash, Small, Fast) ?
- Est-ce qu'on est tous d'accord, ou les préférences varient selon le type de tâche ?
- Comment les modèles gèrent-ils les questions sensibles ? Trop prudents ? Pas assez ?
💡 Le constat clé : tous les modèles ne se valent pas, et le prix n'est pas toujours corrélé à la qualité. C'est pour ça que le choix de l'outil compte — et c'est ce qu'on va voir maintenant.
