Guides pour faire tourner une IA sur votre propre PC. Installation, configuration, modèles, RAG, agents autonomes.
18 articles
Où en est l'IA locale en août 2026 ? La génération courante — Gemma 4, Qwen 3.6 et GLM-4.7 (version Flash pour nos machines) — a changé l'échelle : un PC avec 8 à 24 Go de VRAM fait tourner hors ligne des modèles du niveau cloud d'il y a deux ans, sans abonnement et sans envoyer vos données à qui que ce soit.
Côté outils, le paysage s'est stabilisé : Ollama pour l'API et les scripts, LM Studio pour l'interface graphique, Open WebUI pour retrouver un ChatGPT privé, Docker pour déployer proprement. Le vrai tri se fait désormais sur le matériel : la VRAM décide de ce qui tient, le benchmark décide de ce qui sert.
Ces guides couvrent l'installation, les modèles, le RAG et les agents. Pour la vue d'ensemble, commencez par le hub IA locale ; pour savoir ce que votre machine encaisse vraiment, testez votre PC.
Télécharger, configurer et lancer votre première IA locale gratuitement, en 5 minutes.
Configs minimum, choix du modèle (8B à 405B), Modelfile optimisé et Open WebUI.
Installation, téléchargement de modèles IA, interface de chat et serveur API local.
Docker-compose, GPU NVIDIA, volumes, Open WebUI, modèles et matériel conseillé.
Votre propre ChatGPT privé, gratuit et 100 % local : RAG intégré, multi-utilisateurs.
Commandes, modèles distillés, RAM/VRAM, GPU conseillé, prompts de test et erreurs fréquentes.
ComfyUI pas à pas : vérifiez d'abord GPU, VRAM, pilote et stockage, sans vitesse inventée.
Utiliser Ollama ou LM Studio hors ligne, garder vos données privées, choisir le bon PC, GPU ou mini-PC.
30 jours sans ChatGPT, uniquement Hermes en local : 200 €/mois économisés, 80 % des usages couverts.
25 projets concrets avec Hermes et Ollama : argent, travail, maison, business. Fini les tests « hello world ».
L'architecture 6 couches de Hermes Agent : interface, cerveau, infrastructure, 40+ outils, sécurité.
Créer des agents autonomes avec Ollama, CrewAI, AutoGen et LangGraph : 10 agents concrets, pas à pas.
Construire une recherche IA locale pour Paperless, Nextcloud et emails avec Ollama, Qdrant et hybrid search. Architecture, matériel et pièges.
Comparatif des modèles pour le RAG : embeddings (nomic, bge-m3, e5-mistral), LLM et bases vectorielles.
Le bon système selon l'usage : WSL2, NVIDIA, AMD, Apple Silicon, limites et vérifications utiles.
Le tableau de référence : quel modèle tourne sur quel matériel, de la RTX 3060 au Mac M4. Quantification Q4/Q8.
Choisir le bon moteur (OpenAI Whisper, faster-whisper, whisper.cpp, Buzz), puis mesurer la vitesse sans inventer de benchmark.
Et si des millions de GPU grand public remplaçaient les datacenters ? Analyse des projets Petals et Exo Labs.