Vous voulez une IA qui tourne sur votre ordinateur, sans abonnement, sans quota, et sans envoyer vos documents sur un serveur à l’autre bout du monde ? Bonne idée. Et contrairement à ce qu’on imagine, il n’y a ni terminal, ni ligne de code à taper : deux applications gratuites font tout le travail.
Le vrai sujet, ce n’est pas l’installation. C’est de savoir si votre machine suit, quel modèle télécharger, et quel réglage changer en premier, parce que par défaut, votre IA locale ne pourra pas lire un long document. J’ai fait tout le parcours sur un Mac mini M4 à 16 Go, et voici le guide pas à pas :
- Vérifier votre machine : mémoire, processeur, carte graphique
- Méthode 1, Ollama : l’installation la plus simple, en 5 étapes
- Méthode 2, LM Studio : pour choisir vous-même la version du modèle
- Mac, Windows, Linux ou serveur : ce qui change selon votre système
- Les erreurs classiques : et comment les régler en 2 minutes
C’est parti !
Avant d’installer : votre machine est-elle prête ?
Une IA locale, c’est un fichier de 5 à 8 Go qui doit tenir en entier dans votre mémoire vive pendant qu’il tourne, plus 2 ou 3 Go pour le système. Tout part de là.
- 16 Go de mémoire : le confort, vous faites tourner les modèles de 8 à 12 milliards de paramètres
- 8 Go de mémoire : ça marche, avec des versions allégées de 2 à 4 milliards de paramètres
- 32 Go et plus : vous pouvez viser les modèles de 26 à 30 milliards de paramètres, plus fins
- Un Mac à puce Apple : à partir du M1, toute la mémoire est rapide et partagée avec la carte graphique, c’est la machine idéale
- Un PC avec carte Nvidia : au moins 8 Go de mémoire vidéo, les cartes AMD récentes sont aussi prises en charge
- Un PC sans carte graphique : ça fonctionne, mais l’IA écrit lentement
Prévoyez aussi de la place sur le disque : chaque modèle occupe 5 à 8 Go, et on finit vite par en avoir trois ou quatre. Si vous hésitez sur le modèle à choisir, je les ai comparés sur du vrai travail dans mon comparatif des meilleures IA locales. Ici, on se concentre sur l’installation.
Méthode 1 : installer une IA locale avec Ollama (la plus simple)
Ollama fonctionne en mode automatique : vous tapez le nom du modèle, il choisit la bonne version pour votre machine, et vous discutez. Si c’est votre première IA locale, c’est la méthode que je vous conseille. Je vous montre chaque écran dans cette vidéo, à partir du chapitre sur l’installation :
Voici les mêmes étapes, avec les captures, pour les suivre à votre rythme.
Étape 1 : télécharger et installer Ollama
Rendez-vous sur la page de téléchargement d’Ollama et choisissez votre système.

- Sur Mac : bouton « Download for macOS », il faut macOS 14 Sonoma au minimum, puis glissez l’application dans le dossier Applications
- Sur Windows : téléchargez l’installeur, lancez-le et laissez les options par défaut
- Sur Linux : une seule commande, affichée sur la même page (
curl -fsSL https://ollama.com/install.sh | sh)
Étape 2 : premier lancement, et refuser le compte
Au premier démarrage, Ollama affiche un écran de bienvenue. Cliquez sur Continue.

L’application vous propose ensuite de créer un compte pour accéder à ses modèles en ligne. Ce n’est pas ce que vous cherchez : un compte, c’est le cloud qui revient par la fenêtre. Cliquez sur « No thanks, I’ll use Ollama locally ».

Étape 3 : choisir et télécharger un modèle
En bas de la fenêtre de discussion, un sélecteur de modèle vous laisse taper un nom. Le modèle se télécharge une seule fois, en quelques minutes selon votre connexion, puis il reste sur votre disque.

Les noms exacts à taper, selon votre machine :
- gemma4:12b : le généraliste de Google, 7,6 Go, mon premier choix avec 16 Go de mémoire
- gemma4:e4b : sa version allégée, pour 8 Go de mémoire
- qwen3.5:9b : le modèle d’Alibaba, 6,6 Go, plus léger et fort en plusieurs langues
- lfm2.5:8b : le plus rapide, 5,2 Go, pour les tâches courtes
- deepseek-r1:8b : la version locale de DeepSeek, 5,2 Go, j’ai écrit un guide dédié à l’installation de DeepSeek
Sur chaque fiche du site d’Ollama, la colonne Size vous dit combien pèse chaque version. Règle simple : le fichier doit faire au moins 3 Go de moins que votre mémoire vive.
Étape 4 : le réglage à faire tout de suite, la longueur de contexte
C’est le réglage que personne ne vous dit. Ouvrez les réglages d’Ollama et cherchez la ligne Context length : c’est la quantité de texte que le modèle peut garder en tête.

Par défaut, elle est trop courte pour un vrai document. Quand j’ai donné un guide de 9 000 mots à mes modèles avec le réglage d’origine, deux ont renvoyé une réponse vide, et deux autres n’en ont lu que la moitié, sans le dire. Montez le curseur à 32k. Au-delà, le modèle consomme plus de mémoire pour rien.
Étape 5 : discuter, et donner vos documents
Vous écrivez votre message comme dans ChatGPT. Le bouton + permet d’ajouter un fichier, et les modèles Gemma 4 et Qwen3.5 lisent aussi les images. Sur un long document, comptez 1 à 2 minutes de lecture avant la première ligne de réponse : c’est normal, la machine lit tout.
Une habitude à prendre dès le premier jour : relisez les chiffres, les dates et les noms. Un petit modèle se trompe avec le même aplomb que quand il a raison.
Méthode 2 : LM Studio, pour choisir vous-même votre version

LM Studio est le mode manuel. Il va chercher directement dans Hugging Face, la grande bibliothèque des modèles, et vous montre tout : la mémoire consommée, la vitesse, la version exacte. Sur Mac, il est souvent un peu plus rapide qu’Ollama grâce au format MLX.
- Télécharger LM Studio : Mac à puce Apple, Windows ou Linux, les Mac Intel ne sont plus pris en charge
- Onglet Discover : cherchez le modèle, par exemple Gemma 4 ou Qwen3.5
- Choisir la variante : il y en a souvent une dizaine par modèle, prenez la version 4 bits, la plus légère, en format MLX sur Mac
- Onglet Chat : chargez le modèle et écrivez, la mémoire et la vitesse s’affichent en direct
- Longueur de contexte : même réglage qu’Ollama, à monter à 32k dans les paramètres du modèle
Quand préférer LM Studio ? Si vous voulez tester des modèles absents d’Ollama, comparer plusieurs versions du même modèle, ou surveiller précisément ce que consomme votre machine. Pour tout le reste, Ollama suffit.
Mac, Windows, Linux ou serveur : ce qui change
Sur Mac
C’est le cas le plus simple. Les puces M1 à M4 partagent leur mémoire entre le processeur et la carte graphique, donc un Mac à 16 Go fait tourner les mêmes modèles qu’un PC équipé d’une carte graphique à 16 Go. Les deux applications s’installent en glissant l’icône dans Applications.
Sur Windows
Avec une carte Nvidia, Ollama la détecte tout seul et l’IA écrit vite. Avec une carte AMD récente, c’est pris en charge aussi. Sans carte graphique dédiée, le processeur fait le travail : ça marche, mais un modèle de 8 milliards de paramètres écrit nettement plus lentement. Prenez alors une version plus petite, comme gemma4:e4b ou qwen3.5:4b.
Sur Linux
Ollama s’installe avec la commande de sa page de téléchargement et tourne comme un service. Vous pouvez ensuite lui ajouter une interface web comme Open WebUI pour retrouver une fenêtre de discussion dans le navigateur.
Sur un serveur ou un VPS
Une IA locale peut aussi tourner sur un serveur que vous louez, pour la partager avec une équipe. C’est le même Ollama, piloté à distance. Attention au coût : il faut un serveur avec au moins 16 Go de mémoire, et sans carte graphique, les réponses seront lentes. J’ai décrit une installation de ce type dans mon tutoriel Hermes Agent sur un VPS.
Les erreurs classiques (et comment les régler)
- Le modèle renvoie une réponse vide sur un document : la longueur de contexte est trop courte, montez-la à 32k
- Le modèle ne se charge pas ou fait ramer la machine : il est trop gros pour votre mémoire, prenez la version en dessous
- La réponse commence par un pavé en anglais : c’est le mode réflexion de certains modèles, comme Granite 4.2 ou Qwen3.5, désactivez-le dans les options du modèle
- L’IA écrit trop lentement : sans carte graphique, passez à un modèle de 2 à 4 milliards de paramètres, ou à LFM2.5
- L’IA invente un chiffre ou une date : aucun réglage ne corrige ça, relisez tout ce qui doit être exact
- Le modèle ne connaît pas l’actualité : normal, il n’a pas accès à internet, collez-lui les informations dont il a besoin
Conclusion
Installer une IA en local prend moins de 10 minutes, téléchargement compris, et ne demande aucune compétence technique avec Ollama. Le seul piège, c’est la longueur de contexte : réglez-la à 32k avant de donner un document au modèle.
Ensuite, tout dépend du modèle que vous choisissez, et là, les écarts sont réels : sur mes 3 tests, un seul a tout bon. Pour choisir le vôtre, mon comparatif des IA locales vous donne les résultats, modèle par modèle.