Janus
16 mots/lecture 7 min

LEXIQUE

Les mots qu'on entend partout dès qu'on parle d'IA, expliqués simplement. Ils sont rangés par étage, pas dans l'ordre alphabétique. Un mot devient clair quand on sait à quel endroit il vit.

Étage 1

Le modèle

L'objet lui-même. Ce que c'est, qui peut le récupérer, comment on le modifie.

LLM Large Language Model

Un programme entraîné à deviner le mot suivant. Des milliards de fois, sur des milliards de textes.

En vrai, il ne sait rien. Il a juste vu tellement de phrases qu'il devine très bien la suite. Et quand on devine assez bien, ça ressemble à comprendre.

LesquelsClaude (Anthropic), GPT (OpenAI), Gemini (Google), Llama (Meta), Mistral (français), Qwen (Alibaba), DeepSeek.

Open source ou « poids ouverts », et ce n'est pas pareil

Le modèle est publié. Tu peux le télécharger, le faire tourner sur ta machine, le modifier. Personne ne peut te couper l'accès du jour au lendemain.

Attention : « poids ouverts » et « open source » ne veulent pas dire la même chose. La plupart du temps on te donne le modèle fini, mais pas les données qui ont servi à le fabriquer. Tu peux t'en servir, tu ne peux pas le refaire.

LesquelsLlama, Mistral, Qwen, DeepSeek, Gemma. Face à eux, Claude et GPT restent fermés : tu y accèdes, tu ne les possèdes pas.

Fine-tuning réglage fin

Prendre un modèle qui existe déjà et le réentraîner un peu, sur tes propres exemples.

Tu ne lui apprends pas des informations. Tu lui apprends une façon de faire : un ton, un format, un style de réponse. Si ton but est qu'il connaisse tes documents, ce n'est pas ça qu'il te faut, c'est le RAG (voir plus bas).

En vraiLes modèles Hermes de Nous Research sont des fine-tunes de Llama et Qwen, réglés pour mieux suivre des instructions et utiliser des outils.

Quantization compression

Compresser le modèle pour qu'il prenne moins de place en mémoire.

Une version compressée tourne sur un bon ordinateur portable, là où l'originale réclamait une carte graphique à plusieurs milliers d'euros. Tu perds un peu de qualité, tu gagnes le droit de t'en servir.

Pour essayerOllama ou LM Studio. Tu installes, tu choisis un modèle compressé, il tourne sur ta machine sans connexion.

Étage 2

Ce qu'il lit

Ce que le modèle manipule vraiment. Ce ne sont ni des mots, ni des idées.

Token jeton

Le petit morceau de texte que le modèle lit réellement. Ce n'est pas un mot entier, c'est un bout de mot.

« automatisation » peut compter pour quatre tokens. C'est aussi l'unité qui sert à facturer : quand tu paies l'accès à un modèle, tu paies des tokens.

Ordre de grandeur1 000 tokens font à peu près 750 mots en anglais, un peu moins en français, parce que nos accents et nos mots longs se découpent en plus de morceaux.

Context window fenêtre de contexte

Tout ce que le modèle a sous les yeux au moment où il répond : ta question, la discussion, les documents que tu as collés.

Attention : ce n'est pas de la mémoire, c'est un champ de vision. Ce qui sort du cadre n'est pas oublié, ça n'existe tout simplement plus pour lui. C'est exactement pour ça qu'il perd le fil au bout de vingt messages.

Ordre de grandeurQuelques milliers de tokens en 2022, plusieurs centaines de milliers aujourd'hui. Un livre entier tient désormais dans la fenêtre.

Embedding liste de nombres

Transformer un texte en une suite de nombres qui représente son sens.

Deux phrases qui veulent dire la même chose donnent deux suites proches. C'est ce qui permet de chercher « comment annuler mon abonnement » et de tomber sur un document qui parle de « résiliation », alors qu'aucun mot n'est commun.

Où on les rangeDans une base vectorielle : pgvector (une extension de PostgreSQL), Qdrant, Chroma, Pinecone.

Multimodal plusieurs formats

Le modèle ne comprend pas que du texte. Il comprend aussi les images, le son, la vidéo.

Tu lui montres la capture d'écran d'un message d'erreur, il te dit ce qui ne va pas. C'est le changement le plus concret de ces deux dernières années.

LesquelsClaude, GPT et Gemini lisent tous les images. Pour l'audio, Whisper (OpenAI) transcrit à peu près n'importe quelle langue.

Étage 3

Comment il marche

Ce qui déclenche sa réponse, comment il la fabrique, et pourquoi il se trompe avec autant d'assurance.

Prompt la consigne

Tout ce que tu écris au modèle. Pas seulement ta question : aussi le rôle que tu lui donnes, le format que tu attends, les exemples que tu montres.

C'est le seul volant que tu as entre les mains. Deux personnes avec le même modèle n'obtiennent pas du tout la même chose, et l'écart vient presque entièrement de là.

Le truc qui marcheMontrer un exemple de la réponse que tu veux marche mieux que trois paragraphes d'explications. C'est tout ce que recouvre l'expression « prompt engineering ».

Inference inférence

Le moment où le modèle répond à ta question.

Fabriquer le modèle coûte une fortune, mais ça n'arrive qu'une seule fois. L'inférence, c'est chaque question posée, par chaque personne. C'est là que part ton budget à toi.

Où ça tourneChez toi avec Ollama ou llama.cpp. Chez un hébergeur avec Groq ou Together. Ou directement chez celui qui a fait le modèle.

Température le réglage du hasard

Un curseur qui décide si le modèle prend toujours le mot le plus probable, ou s'il s'autorise à en choisir un moins évident.

Basse, il est fiable et un peu plat. Haute, il devient inventif et part parfois complètement en vrille. Pour du code ou pour extraire des données, on la met au minimum. Pour écrire, on la remonte.

Ordre de grandeurElle va en général de 0 à 1, parfois jusqu'à 2. La plupart des applications grand public la cachent, mais elle est toujours là dès que tu passes par une API.

Hallucination invention

Le modèle invente une réponse fausse, avec exactement le même aplomb que quand il a raison.

Attention : ce n'est pas un bug qui sera corrigé dans la prochaine version. C'est la conséquence directe de sa mécanique, qui est de deviner la suite la plus probable. Et le probable n'est pas toujours le vrai. Tout ce qui compte se vérifie.

Cas réelEn 2023, des avocats new-yorkais ont déposé au tribunal des décisions de justice inventées de toutes pièces par ChatGPT. Ils ont été sanctionnés. Les références avaient l'air parfaitement authentiques.

Étage 4

Ce qu'on branche autour

Tout seul, le modèle ne sert pas à grand-chose. Ces quatre mots décrivent ce qu'on lui accroche.

RAG Retrieval-Augmented Generation

Avant de répondre, on va chercher les bons passages dans tes documents et on les glisse dans sa fenêtre de contexte.

Le modèle ne connaît pas tes fichiers. On les lui met sous les yeux au bon moment, et il a l'air de les connaître. C'est la réponse à « comment lui faire lire mes 400 pages ».

Où tu en croisesLa quasi-totalité des chatbots de support d'entreprise. Et toute IA qui prétend répondre sur tes documents à toi.

Agent agent

Un modèle à qui on donne des outils et le droit de recommencer tout seul. Il décide, il agit, il regarde le résultat, il ajuste.

La différence avec un chatbot tient en un mot : il fait. Il ne se contente pas de répondre. C'est aussi pour ça qu'un agent se surveille, parce que ce qui agit tout seul peut se tromper tout seul.

LesquelsHermes Agent de Nous Research, que je fais tourner sur mon serveur. Claude Code (Anthropic) qui écrit et exécute du code. OpenAI Codex.

API Application Programming Interface

La prise sur laquelle un programme vient brancher le modèle.

Pas d'écran, pas de bouton : une adresse, une clé, une requête. C'est ce qui fait passer de « je copie-colle dans une fenêtre » à « ça tourne pendant que je dors ».

LesquellesAnthropic, OpenAI, Mistral et Google en publient toutes une. Même principe partout : une clé, une adresse, tu paies au token.

MCP Model Context Protocol

Une norme pour brancher des outils et des données sur un modèle sans tout réécrire à chaque fois.

L'USB-C des agents : une seule prise, plein d'appareils. Avant, chaque branchement était du sur-mesure à jeter.

D'où ça vientPublié par Anthropic fin 2024, puis repris par à peu près tout le monde. C'est devenu la façon standard de brancher un agent sur des outils.

Et maintenant ?

Ces seize mots suffisent pour lire n'importe quel article, suivre n'importe quelle démo, et surtout repérer quand quelqu'un raconte n'importe quoi.

Le vrai passage, c'est d'arrêter de les apprendre et de les faire tourner. Un modèle sur ta propre machine. Un RAG sur tes propres documents. Un agent qui fait une seule tâche, mais pour de vrai.

Cette page en est un morceau : elle est servie par un serveur que j'administre, sur lequel tourne un agent qui écrit dans mes notes pendant que je dors. Rien d'extraordinaire, juste des trucs branchés ensemble correctement.

Dis-moi lequel de ces seize mots tu veux voir tourner pour de vrai. Réponds à ce message, je lis tout. C'est toi qui décides ce que je construis ensuite.

Tu es arrivé ici autrement que par un DM ? Commente LEXIQUE sous un post et je t'envoie la page.

Janus · 7Lee @0x7lee · Août 2026