Ingénierie de Prompts

LLM & IA
Deep Learning
Maîtriser les techniques de prompting (few-shot, chain-of-thought, system prompts) pour guider les réponses du modèle.

Un LLM ne cherche pas la “vraie” réponse dans une base de données. À chaque token généré, il tire au sort dans une distribution de probabilité sur tout son vocabulaire. Le Prompt Engineering consiste à orienter cette distribution vers la zone de réponse souhaitée — c’est de la physique probabiliste, pas de la magie.

🎲 Les Paramètres d’Échantillonnage

Trois leviers contrôlent comment le modèle “tire au sort” son prochain token. Ajustez-les pour observer leur impact sur la distribution Softmax.

Simulateur de Distribution Softmax
Température

Modifie la “pente” de la fonction Softmax :

T → 0 — Distribution pincée, modèle déterministe. Idéal pour le code et l’extraction de faits.

T > 1 — Distribution aplatie, illusion de créativité, mais risque d’incohérence.

Top-K

Ne conserve que les K tokens les plus probables. Tous les autres sont exclus avant le tirage — ils apparaissent en gris dans le simulateur.

Top-P (Nucleus)

Additionne les probabilités en descendant dans la liste. Dès que la somme dépasse P, on coupe. Plus dynamique que Top-K : la “fenêtre” s’adapte au contexte.

✍️ Les Techniques de Prompting

La qualité du contexte fourni détermine quelle zone de la distribution sera explorée. Trois niveaux, du plus simple au plus puissant :

Zero-Shot

Aucun exemple. Le modèle s’appuie uniquement sur ses connaissances d’entraînement.

Traduis en anglais :
"L'IA est une discipline fascinante."

Tâches courantes bien représentées dans les données d’entraînement.

Few-Shot

2 à 5 exemples entrée → sortie avant la question. Ancre le format attendu dans la fenêtre d’attention.

"Il as mangé" → "Il a mangé"
"Les chien aboie" → "Les chiens aboient"
"Elle coure vite" → ???

Tâches avec une structure de sortie précise à respecter.

Chain-of-Thought

Forcer le modèle à verbaliser son raisonnement avant de conclure. Les tokens intermédiaires guident mathématiquement la prédiction finale.

Résous étape par étape :
"3 paniers × 4 pommes,
 j'en mange 5. Combien reste-t-il ?"

Raisonnement mathématique, logique, multi-étapes.

L’attention d’un LLM se nourrit des tokens qu’il vient de générer. En le forçant à produire des étapes intermédiaires (“3 × 4 = 12, puis 12 − 5 = 7”), chaque étape re-contextualise la fenêtre d’attention et oriente la prédiction suivante vers une conclusion logique — plutôt qu’une association statistique hâtive.

🧠 Le System Prompt

Le System Prompt est lu avant toute interaction utilisateur. Il cadre l’espace de probabilité du modèle pour toute la conversation. Ce n’est pas une simple consigne — c’est une architecture rhétorique.

Anatomie d’un System Prompt

RÔLE : Tu es Léo, pédagogue expert en informatique. Style : direct, précis, sans condescendance.

CONTEXTE : L’utilisateur est un développeur junior qui découvre le cloud.

FORMAT : Toujours répondre avec ce schéma JSON : { "concept": "...", "analogie": "...", "exemple_code": "..." }

CONTRAINTE : Vérifier ton raisonnement avant de produire la réponse.

Persona Design

Définir une “parallaxe conceptuelle” pour saturer le modèle de priorités spécifiques. “Agis comme un expert en cybersécurité doublé d’un pédagogue stoïcien” évite les réponses génériques et le sycophantisme (l’IA qui acquiesce à tout pour plaire).

Framing Block

Forcer le modèle à verbaliser son interprétation de la tâche dans un bloc de raisonnement obligatoire avant de répondre. Ancre la réponse dans une analyse logique plutôt qu’une réaction statistique immédiate.