Vous avez posé la même question au modèle deux fois. Vous avez obtenu deux réponses complètement différentes. L’une était utile. L’autre était du non-sens.
Ce n’est pas du hasard, c’est un réglage. La température et le top-p contrôlent comment un modèle choisit le mot suivant. Mal réglés, vous obtenez de l’incohérence. Bien réglés, vous obtenez un comportement reproductible.
Ce que fait réellement la température
La température contrôle la confiance du modèle. Pensez-y comme à un bouton sur « le niveau de risque que le modèle veut prendre ».
Tous les LLM fonctionnent de la même manière lors de la génération : ils calculent un score de probabilité pour chaque mot possible suivant. Un mot peut avoir 45 % de chances, un autre 23 %, un autre 12 %. Ensuite, il en choisit un.
La température remodèle ces probabilités avant que le modèle ne fasse son choix.
- Température = 0 : Choisit toujours le mot à la plus haute probabilité. Déterministe. Même entrée, même sortie, à chaque fois. Utilisez ceci pour l’extraction de données, la classification, les sorties structurées.
- Température = 1 : Utilise les probabilités telles quelles. Équilibré. C’est souvent la valeur par défaut. Assez créatif, assez cohérent.
- Température = 2+ : Aplatit les probabilités. Les mots à faible probabilité deviennent plus probables. Haute variabilité. Utilisez ceci uniquement pour le brainstorming ou l’écriture créative.
Voici ce qui est important : une température de 0 vous donne de la cohérence. Une température supérieure à 1 vous donne de la variété au détriment de la prévisibilité. Dans les systèmes de production, vous voulez presque toujours une température entre 0 et 0,7.
Top-P : La coupure qui corrige les « longues traînes »
Le top-p (échantillonnage par noyau) résout un problème différent de la température.
La température change la confiance du modèle. Le top-p contrôle quels mots le modèle est même autorisé à considérer.
Si top-p = 0,9, le modèle ne considère que les mots qui constituent les 90 % supérieurs de la masse de probabilité. Il ignore la longue traîne des mots étranges à faible probabilité.
Pourquoi est-ce important ? La température seule n’empêche pas les mauvaises sorties. Si la température est de 1 et que le modèle calcule des probabilités comme ceci :
Mot A : 40 %
Mot B : 35 %
Mot C : 15 %
Mot D : 5 %
Mot E : 3 %
Mot F : 2 %
Il pourrait quand même choisir Mot E ou F parfois. Ajouter top-p = 0,9 coupe tout ce qui est en dessous de 90 % de probabilité cumulative, donc les Mots D, E, F sont retirés de la considération.
Utilisez le top-p pour éliminer les sorties absurdes sans sacrifier la variété utile. Un top-p entre 0,8 et 0,95 fonctionne bien pour la plupart des cas d’utilisation.
Quand utiliser chaque réglage
Extraction structurée (JSON, CSV, classification) : Température = 0, top-p = 1. Vous voulez la meilleure réponse unique, de manière cohérente.
# Prompt pour extraire des données
Utilisateur : "Extrayez le nom du client, la date de commande et le total de cette facture. Retournez uniquement en JSON."
Appel avec :
- température : 0
- top_p : 1
Chat ou réponse aux questions : Température = 0,7, top-p = 0,9. Assez cohérent pour rester sur le sujet, assez varié pour paraître naturel.
# Exemple en Python utilisant l'API Claude
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=1024,
temperature=0.7,
top_p=0.9,
messages=[
{"role": "user", "content": "Expliquez pourquoi mes requêtes API expirent."}
]
)
print(message.content[0].text)
Brainstorming ou travail créatif : Température = 1,0 à 1,5, top-p = 0,95. Vous voulez de la variation sans chaos complet.
Notation ou évaluation : Température = 0, top-p = 1. La cohérence dans la notation est plus importante que tout.
Le vrai problème : les effets d’interaction
La température et le top-p interagissent. Ce ne sont pas des boutons indépendants.
Si vous réglez la température = 0,1 (très conservateur) mais le top-p = 0,5 (coupure agressive), la coupure importe peu — le modèle était déjà conservateur. Si vous réglez la température = 2 et le top-p = 0,99, vous vous battez contre vous-même.
Commencez avec un bouton. La température d’abord, généralement. Si vous obtenez toujours des sorties absurdes après avoir baissé la température à 0,3 ou moins, ajoutez un top-p = 0,85.
En pratique : température 0 à 0,7 + top-p 0,9 à 1 gère 95 % des cas d’utilisation en production. Tout ce qui va au-delà est généralement un sur-ajustement.
Testez vos réglages dès aujourd’hui
Choisissez un prompt que vous utilisez régulièrement. Exécutez-le 10 fois avec une température = 0. Comptez combien de fois vous obtenez la même sortie.
Ensuite, exécutez-le 10 fois avec une température = 1 sans rien changer d’autre. Remarquez la différence. C’est l’écart entre la cohérence et la variabilité.
Trouvez maintenant la température qui vous donne 80 % de cohérence de sortie avec une qualité de sortie acceptable pour votre cas d’utilisation. C’est votre référence. Ajoutez le top-p si vous voyez encore des résultats occasionnels de mauvaise qualité.
Enregistrez les réglages. Utilisez-les. Si vous déboguez la qualité de sortie plus tard, vous saurez exactement ce que vous avez changé et pourquoi.