Vous pouvez exécuter un modèle linguistique performant sur votre ordinateur portable dès maintenant. Pas un modèle basique — quelque chose qui gère de vraies tâches. Llama 3 8B, Mistral 7B et Phi 3.5 fonctionnent tous sur du matériel grand public. La barrière n’est plus la capacité. C’est savoir quel outil, quelle quantification et quels 20 minutes de configuration fonctionnent réellement.
Pourquoi les LLM Locaux sont Importants Maintenant
Pendant trois ans, l’inférence locale signifiait soit utiliser un modèle de 7 milliards de paramètres qui performait comme GPT-3, soit dépenser 200 $ par mois en appels API. Cela a changé en 2024. Llama 3 8B (sorti en juillet 2024) performe au niveau de GPT-3.5 sur la plupart des tâches. Mistral 7B bat GPT-3.5 en raisonnement. Phi 3.5 fonctionne sur 8 Go de RAM et gère la résumé, la classification et la revue de code sans dégradation évidente.
L’avantage pratique : zéro coût d’API pour le développement, latence d’inférence inférieure à 500 ms sur du matériel modeste, et vos données ne quittent jamais votre machine. Le hic : vous avez besoin de la bonne quantification, du bon outil, et d’attentes réalistes concernant les compromis vitesse/qualité.
Réalité Matérielle
Avant de télécharger quoi que ce soit, vous devez savoir avec quoi vous travaillez.
- RAM : Un modèle 7B en quantification 4 bits nécessite environ 6–8 Go. En 8 bits : 14–16 Go. Non quantifié (float32) : 30 Go minimum. Vous utiliserez probablement du 4 bits.
- GPU : Facultatif mais transformateur. Une RTX 4060 (8 Go de VRAM) exécute Llama 3 8B en 4 bits à plus de 30 tokens/seconde. Sans GPU : l’inférence CPU sur un MacBook Pro M1 fait 5–8 tokens/seconde — acceptable pour le traitement par lots, difficile pour une utilisation interactive.
- Disque : Un modèle 7B quantifié en 4 bits pèse 3–5 Go. Gardez 20 Go libres pour les téléchargements de modèles et l’espace de travail.
Si vous utilisez un MacBook Air M1/M2, arrêtez ici — Ollama (ci-dessous) gère automatiquement toute l’accélération GPU. Si vous êtes sous Windows ou Linux avec une carte RTX, l’accélération GPU réduit le temps d’inférence de 4 à 6 fois.
Ollama : Le Chemin Sans Friction
Si vous voulez exécuter un modèle dans les cinq prochaines minutes sans vous battre avec les environnements Python, utilisez Ollama.
Téléchargez depuis ollama.ai, exécutez l’installateur. Ensuite :
ollama run llama2
C’est tout. Ollama télécharge automatiquement, quantifie et sert le modèle sur localhost:11434. Vous avez maintenant une API locale compatible avec l’interface de chat d’OpenAI.
Pour exécuter Mistral à la place :
ollama run mistral
Ollama télécharge la quantification recommandée (généralement Q4_K_M — 4 bits, variante moyenne) automatiquement. Pas de fichiers de configuration. Pas de manipulations CUDA sous Linux. Sur Mac, il détecte le GPU automatiquement.
La limitation : Ollama abstrait les choix de quantification. Si vous avez besoin de Q2_K (VRAM ultra-faible) ou Q8_0 (qualité maximale), vous aurez besoin de l’approche suivante.
LM Studio : Contrôle et Simplicité
Pour 80 % des praticiens, Ollama suffit. Pour les 20 % restants — ceux qui fonctionnent avec 4 Go de RAM, ou qui recherchent des compromis spécifiques qualité/vitesse — LM Studio est l’étape suivante.
LM Studio vous offre une interface graphique, un sélecteur de quantification, et la même API compatible OpenAI qu’Ollama.
Installez depuis lmstudio.ai. Ouvrez l’application. Recherchez « Mistral 7B ». Vous verrez 15 versions :
- Q2_K : 3,5 Go, ~2 tokens/sec sur CPU
- Q4_K_M : 5 Go, ~5 tokens/sec sur CPU
- Q6_K : 8 Go, ~3 tokens/sec sur CPU (qualité supérieure à Q4)
- Q8_0 : 14 Go, qualité proche de l’original, plus lent
Pour la plupart des travaux, Q4_K_M est la réponse par défaut. C’est le juste milieu entre qualité et utilisation des ressources qu’Ollama utilise également par défaut.
Téléchargez le modèle, cliquez sur « Charger », puis utilisez-le via API :
import requests
import json
response = requests.post(
"http://localhost:1234/v1/chat/completions",
json={
"model": "local-model",
"messages": [{"role": "user", "content": "Résumez ceci en une phrase : [votre texte]"}],
"temperature": 0.7
}
)
print(response.json()['choices'][0]['message']['content'])
L’API est identique à celle d’OpenAI. C’est important — vous pouvez tester localement, puis changer le point de terminaison pour GPT-4o sans réécrire de code.
Quand Choisir Quel Modèle
Llama 3 8B, Mistral 7B et Phi 3.5 résolvent différents problèmes à différents niveaux de ressources.
- Phi 3.5 Mini (3,8 milliards de paramètres, 2 Go quantifié) : Fonctionne sur n’importe quel matériel. Idéal pour la classification, l’extraction, le résumé. Perd la cohérence sur la génération ouverte au-delà de 1000 tokens.
- Mistral 7B (7 milliards de paramètres, 5 Go quantifié) : Le raisonnement le plus solide pour sa taille. Meilleur que Llama 3 sur le code et la sortie structurée. Légèrement plus faible en écriture créative.
- Llama 3 8B (8 milliards de paramètres, 6 Go quantifié) : Le plus équilibré. Bon à tout faire. Plus lent que Mistral sur CPU (nombre de paramètres plus élevé), mais plus fiable sur les longs documents.
Si vous avez 8 Go de RAM : commencez avec Phi 3.5. Si vous avez 16 Go ou un GPU : Mistral 7B. Si vous avez besoin d’une flexibilité maximale : Llama 3 8B.
Testez-le Aujourd’hui : Un Exemple Fonctionnel
Installez Ollama. Exécutez ceci :
ollama run mistral
Attendez 3–4 minutes pour le téléchargement. Ensuite, collez ceci dans l’invite :
Extrayez les entités de ce texte au format JSON. Retournez uniquement du JSON valide, sans explication.
Texte : Apple a sorti l'iPhone le 29 juin 2007. Steve Jobs l'a présenté à San Francisco.
Format de retour : {"entreprises": [], "produits": [], "dates": [], "personnes": []}
Vous obtiendrez un JSON valide en moins de 5 secondes sur la plupart des matériels. C’est de l’extraction — pas de hallucination, pas de dérive de génération. Une tâche réelle qui nécessitait auparavant un appel API. Maintenant, c’est local, gratuit et hors ligne.
Cette invite fonctionne car elle est contrainte (le format JSON impose une structure) et Mistral 7B est fort en suivi d’instructions. Si vous essayez la même invite sur Phi 3.5, vous pourriez obtenir du JSON malformé occasionnellement — une différence quantitative qu’il est bon de connaître avant de vous y fier.
Ensuite : Intégrez-le à Votre Flux de Travail
Configurez Ollama ou LM Studio pour qu’ils démarrent au lancement. Ajoutez ceci à votre environnement Python pour tout pipeline d’extraction ou de classification :
from openai import OpenAI
client = OpenAI(api_key="not-used", base_url="http://localhost:11434/v1")
def classify_text(text, categories):
response = client.chat.completions.create(
model="mistral",
messages=[{
"role": "user",
"content": f"Classez ce texte comme l'un des suivants : {', '.join(categories)}
Texte : {text}"
}]
)
return response.choices[0].message.content
C’est votre couche d’inférence locale. Elle est compatible API avec OpenAI, sans coût, et prête pour une utilisation en production sur des tâches répétitives où la latence de la vitesse de la lumière n’est pas primordiale — traitement par lots, tâches d’arrière-plan, pipelines de classification.